Разработчики представили In2it — карточную игру, спроектированную как специализированный бенчмарк для тестирования когнитивных способностей ИИ-агентов. В отличие от стандартных тестов на знание фактов, In2it фокусируется на стратегическом планировании, адаптации к неполной информации и долгосрочном принятии решений в динамичной среде, что позволяет глубже оценить автономность и логику моделей.

Игра имитирует условия, требующие от агента анализа текущего состояния стола, прогнозирования ходов противника и управления ресурсами. Такой подход помогает выявить пробелы в «рассуждениях» LLM, которые часто проявляются при переходе от простых задач к многоходовым сценариям. Использование игровых механик в качестве метрики позволяет стандартизировать оценку того, насколько эффективно агент справляется с неопределенностью.

Проект предоставляет открытую документацию и API, позволяющие исследователям интегрировать своих агентов в игровую среду для проведения автоматизированных тестов. Это дает возможность количественно измерить прогресс в развитии агентных систем, переходя от субъективных оценок к воспроизводимым результатам в условиях, приближенных к реальным бизнес-задачам с переменными вводными.

Ключевые факты

  • In2it разработана как среда для оценки стратегического мышления и принятия решений в условиях ограниченной информации.
  • Бенчмарк фокусируется на многоходовых сценариях, требующих от агента адаптации к действиям оппонента.
  • Платформа предоставляет API для интеграции сторонних ИИ-агентов и автоматизированного сбора метрик производительности.
  • Инструмент направлен на решение проблемы нехватки качественных тестов для оценки автономных систем в сложных игровых или бизнес-контекстах.