Метод «LLM-as-a-judge» стал стандартом для автоматизированной оценки качества ответов моделей, заменяя медленные и дорогостоящие человеческие проверки. Новое руководство систематизирует подходы к выбору моделей-судей, проектированию промптов и калибровке метрик, позволяя разработчикам создавать надежные пайплайны оценки для RAG-систем и агентных решений, минимизируя предвзятость и ошибки при масштабировании ИИ-продуктов.
Основная проблема автоматической оценки заключается в склонности моделей-судей отдавать предпочтение более длинным или стилистически «уверенным» ответам, а также в их зависимости от порядка следования вариантов в бенчмарке. Руководство предлагает использовать специализированные модели для оценки, такие как GPT-4o или Claude 3.5 Sonnet, и внедрять техники «chain-of-thought» для обоснования судейских решений, что значительно повышает корреляцию с человеческими оценками.
Для обеспечения точности процесса авторы рекомендуют использовать многошаговую валидацию, где судья сначала анализирует критерии качества, а затем выставляет итоговый балл. Также рассматриваются методы борьбы с «позиционной предвзятостью», когда модель систематически выбирает первый или второй вариант из предложенных, независимо от их фактического содержания.
Ключевые факты
- Использование LLM в качестве судьи позволяет сократить время оценки ответов с нескольких дней до минут.
- Основные риски включают позиционную предвзятость (предпочтение первому ответу) и склонность к выбору более объемных текстов.
- Рекомендуется применять техники пошагового рассуждения (CoT) перед выставлением оценки для повышения объективности.
- Для калибровки судейской модели необходимо иметь «золотой стандарт» — набор данных, размеченный экспертами-людьми.
- Эффективность оценки напрямую зависит от качества системного промпта, определяющего критерии точности, релевантности и тональности.