Автоматизированная оценка ответов LLM с помощью других моделей (LLM-as-a-judge) становится стандартом для контроля качества в агентных системах. Исследование детально разбирает архитектуру таких «судей», методы их настройки и ключевые метрики, позволяющие заменить дорогостоящую человеческую разметку на масштабируемые программные пайплайны, обеспечивая стабильность и воспроизводимость результатов при тестировании генеративных моделей.

В основе подхода лежит использование более мощной модели (например, GPT-4o) для оценки вывода менее производительных систем. Авторы подчеркивают, что эффективность «судьи» напрямую зависит от качества промптов, структуры выходных данных и учета специфических когнитивных искажений моделей, таких как предпочтение первого ответа в списке или чрезмерная склонность к самовосхвалению при оценке собственных генераций.

Для внедрения системы оценки необходимо учитывать не только точность суждений, но и стоимость инференса. Оптимальный пайплайн включает калибровку модели-судьи на эталонных наборах данных, использование четких рубрик для выставления баллов и обязательную проверку на согласованность оценок. Это позволяет снизить зависимость от субъективного мнения и ускорить итерации при разработке сложных агентных сценариев.

Ключевые факты

  • LLM-as-a-judge позволяет сократить время на оценку качества ответов в десятки раз по сравнению с ручной разметкой.
  • Основные искажения моделей-судей включают предвзятость к длине ответа, позиционную предвзятость и склонность к чрезмерно высокой оценке.
  • Использование структурированного вывода (JSON) в качестве оценки повышает надежность интеграции судей в CI/CD пайплайны.
  • Калибровка судьи требует наличия «золотого стандарта» — набора данных, размеченного экспертами-людьми для настройки весов модели.
  • Эффективность судейства напрямую коррелирует с детализацией инструкций (rubrics), предоставляемых модели для анализа конкретных аспектов ответа.