Исследователи представили Crucible — новый бенчмарк для оценки LLM, использующий механику текстовых многопользовательских игр (MUD). В отличие от статических тестов, эта среда требует от модели долгосрочного планирования, взаимодействия с динамическим миром и управления инвентарем. Проект доказывает, что создание сложных игровых миров для тестирования ИИ-агентов возможно при бюджете менее 100 долларов.

Традиционные бенчмарки часто страдают от «загрязнения» данных, когда модели обучаются на ответах к тестам. Crucible решает эту проблему, создавая процедурно генерируемые сценарии, где успех зависит не от заученных знаний, а от способности агента рассуждать в меняющихся условиях. Модель должна исследовать локации, собирать предметы и решать логические задачи, чтобы достичь цели.

Использование MUD-архитектуры позволяет отслеживать состояние мира в реальном времени и оценивать прогресс агента по конкретным игровым метрикам. Это дает более глубокое понимание того, как LLM справляются с многошаговыми задачами, требующими удержания контекста и адаптации стратегии, что критически важно для разработки автономных систем.

Ключевые факты

  • Crucible использует текстовые игры (MUD) как платформу для тестирования когнитивных способностей LLM.
  • Стоимость реализации концепта составила менее 100 долларов, что делает метод доступным для широкого тестирования.
  • Бенчмарк фокусируется на проверке навыков планирования, навигации и управления ресурсами в динамической среде.
  • Проект направлен на борьбу с проблемой «загрязнения» обучающих выборок, характерной для статических тестов.