Исследователи проанализировали способность языковых моделей выступать в роли экзаменаторов, создающих тестовые наборы и критерии оценки для других систем. Выяснилось, что при использовании стандартного подхода «one-shot» без цепочки рассуждений модели склонны к «молчаливым пропускам» — игнорированию допустимых вариантов ответов, что делает их оценки предвзятыми и неполными.

Проблема заключается в том, что при генерации наборов правильных ответов модели часто ограничиваются узким подмножеством допустимых решений. Это приводит к тому, что системы, оцениваемые такими «авторами», несправедливо штрафуются за корректные, но не предусмотренные моделью-экзаменатором ответы. Использование моделей для автоматизации контроля качества требует пересмотра методологии, так как текущие подходы не обеспечивают полноту охвата всех возможных вариантов.

Авторы работы подчеркивают, что процесс оценки требует более глубокого логического вывода, чем простая генерация текста. Без внедрения механизмов проверки на этапе тестирования или использования итеративного уточнения, автоматизированные системы оценки остаются ненадежными. Это создает риски для пайплайнов, где ИИ-модели используются для автоматической разметки данных или обучения других моделей через функции вознаграждения.

Ключевые факты

  • Исследование выявило систематическую склонность LLM к пропуску валидных ответов при создании тестовых наборов.
  • Основная причина ошибок — использование стратегии «one-shot greedy authoring», исключающей этап рассуждений (reasoning) во время генерации.
  • Проблема подтверждена на четырех различных типах референсных конструкций, используемых для оценки качества моделей.
  • Автоматизированные системы оценки, созданные LLM без дополнительного контроля, демонстрируют низкую полноту охвата (recall) допустимых решений.
  • Результаты указывают на необходимость перехода от прямой генерации ответов к методам, включающим верификацию и расширенный поиск решений.