Исследование оценило способность современных LLM генерировать научные рецензии, сопоставив их с результатами экспертного рецензирования на конференциях. Анализ показал, насколько оценки моделей GPT-5.4, Gemini 3.1 Pro и Claude Opus 4.6 коррелируют с итоговыми решениями программных комитетов и приоритетами ученых, выявляя сильные и слабые стороны автоматизированного процесса оценки качества научных работ в контролируемой среде.
Авторы работы сосредоточились на том, могут ли нейросети воспроизвести логику человеческого рецензирования, учитывая не только техническую грамотность, но и научную новизну, методологическую строгость и значимость результатов. В ходе эксперимента сравнивались рецензии, написанные моделями, с реальными отзывами экспертов, полученными в ходе конференционного цикла. Исследование подчеркивает разрыв между способностью моделей генерировать связный текст и их умением выносить критические суждения, сопоставимые с экспертными.
Результаты показывают, что хотя LLM демонстрируют высокий уровень формальной аргументации, они чаще склонны к «мягкой» оценке работ по сравнению с людьми. Модели показывают разную степень чувствительности к специфическим критериям отбора, что ставит вопросы о возможности их использования в качестве вспомогательного инструмента для первичного отсева заявок или подготовки черновиков рецензий в академической среде.
Ключевые факты
- В исследовании сравнивались модели OpenAI GPT-5.4, Google Gemini 3.1 Pro Preview и Anthropic Claude Opus 4.6.
- Анализ проводился на основе сопоставления с реальными решениями программных комитетов научных конференций.
- Выявлено, что LLM чаще склонны к завышению оценок по сравнению с человеческими экспертами.
- Исследование оценивает корреляцию между приоритетами моделей и ключевыми критериями научного рецензирования.