Исследователи проанализировали способность больших языковых моделей к многошаговому планированию и принятию решений в динамических средах. Выяснилось, что даже продвинутые архитектуры демонстрируют значительные трудности при выполнении последовательных действий, требующих учета долгосрочных последствий. Модели часто совершают ошибки в логических цепочках, что ставит под сомнение их надежность в качестве автономных агентов для сложных задач, требующих глубокого стратегического планирования.

Авторы работы вводят понятие «прыжка» как способности модели переходить между состояниями в пространстве задач, требующих нетривиальных рассуждений. В ходе экспериментов было показано, что стандартные методы обучения и предсказания следующего токена не гарантируют корректного построения траектории действий. Модели склонны к «миопии» — фокусировке на ближайших шагах в ущерб глобальной цели, что приводит к деградации качества решений при увеличении глубины планирования.

Результаты исследования подчеркивают фундаментальный разрыв между способностью моделей генерировать связный текст и их умением моделировать причинно-следственные связи в физическом или логическом мире. Это указывает на необходимость разработки новых подходов к обучению, которые выходят за рамки простого предсказания вероятности токенов и включают механизмы верификации промежуточных состояний в процессе рассуждения.

Ключевые факты

  • Исследование сфокусировано на анализе способности LLM к многошаговому планированию и принятию решений.
  • Выявлена склонность моделей к «миопии», при которой краткосрочные выгоды превалируют над долгосрочными целями.
  • Установлено, что текущие методы обучения не обеспечивают надежного построения сложных логических цепочек действий.
  • Работа опубликована на платформе OpenReview, что подчеркивает её значимость для академического сообщества в области ИИ.