Исследователи из Epoch AI проанализировали способность языковых моделей обучаться сложной настольной игре Earthborne Rangers через практику. Несмотря на тысячи сыгранных партий, модели не показали значимого улучшения навыков принятия решений. Результаты ставят под сомнение гипотезу о том, что масштабные модели способны эффективно учиться на собственном опыте в условиях ограниченной обратной связи и сложных правил.

В ходе эксперимента использовались современные LLM, которым предлагалось играть в Earthborne Rangers — кооперативную карточную игру с глубокой механикой и необходимостью долгосрочного планирования. В отличие от игр с полной информацией, таких как шахматы или го, здесь ИИ сталкивается с проблемой неполных данных и необходимостью интерпретации текстовых инструкций. Исследователи обнаружили, что модели часто повторяют одни и те же стратегические ошибки, не извлекая уроков из проигрышных партий.

Этот кейс подчеркивает разрыв между способностью моделей к генерации текста и их возможностями в области логического планирования и обучения с подкреплением. В то время как многие системы показывают высокие результаты на статических бенчмарках, динамическая среда настольной игры выявила критические ограничения в способности ИИ к адаптивному поведению и стратегическому мышлению в процессе практики.

Ключевые факты

  • Исследование проведено организацией Epoch AI с использованием настольной игры Earthborne Rangers.
  • Модели не продемонстрировали статистически значимого роста качества игры после проведения тысяч симуляций.
  • Эксперимент показал, что текущие LLM испытывают трудности с обучением в средах, требующих долгосрочного планирования и интерпретации сложных правил.
  • Результаты работы ставят под вопрос эффективность методов обучения с подкреплением для улучшения логических способностей моделей в игровых сценариях.