Исследователи предложили использовать многопользовательские текстовые миры (MUD) как среду для оценки возможностей LLM. Традиционные метрики, такие как коэффициент каппа (κ), часто не учитывают специфические искажения, возникающие при использовании моделей в качестве «судей». Новый подход позволяет выявить системные ошибки в оценках, которые скрываются за усредненными показателями согласия между моделями.
Использование MUD-сред предоставляет динамический контекст, где агент должен принимать последовательные решения, взаимодействуя с меняющейся средой. В отличие от статических бенчмарков, такой подход позволяет отследить, как именно LLM-судьи интерпретируют действия агентов и почему их оценки могут систематически отклоняться от человеческих предпочтений. Это критически важно для понимания того, насколько надежно модели могут оценивать качество работы других ИИ-систем.
Проблема «искажения судей» заключается в том, что модели склонны отдавать предпочтение ответам, которые имитируют их собственный стиль или содержат определенные лингвистические маркеры. В условиях MUD эти искажения становятся более заметными, так как модель-судья должна оценивать не только текст, но и эффективность достижения цели в рамках игровых механик. Это позволяет глубже проанализировать границы применимости LLM как инструментов автоматизированного контроля качества.
Ключевые факты
- MUD (Multi-User Dungeon) рассматривается как среда для тестирования агентных способностей и навыков рассуждения.
- Традиционные метрики согласия (например, коэффициент каппа) не способны уловить качественные искажения в суждениях LLM.
- LLM-судьи демонстрируют систематические ошибки, отдавая предпочтение ответам, схожим с их собственными паттернами генерации.
- Использование игровых сред позволяет проводить более глубокий анализ того, как модели оценивают долгосрочные стратегии и принятие решений.
- Исследование подчеркивает необходимость перехода от статических тестов к динамическим симуляциям для оценки надежности ИИ.