Исследователи проанализировали способность больших языковых моделей к решению задач, требующих последовательного планирования, и выявили фундаментальные ограничения. В работе показано, что стандартные методы авторегрессионной генерации часто приводят к ошибкам в долгосрочных стратегиях, так как модели не способны эффективно оценивать последствия своих действий на несколько шагов вперед, что критически важно для сложных агентных систем.

Авторы статьи вводят понятие «прыжка» (jump) в пространстве состояний задачи, который требует от модели не просто предсказания следующего токена, а понимания глобальной структуры процесса. В ходе экспериментов выяснилось, что даже при наличии доступа к внешним инструментам или RAG-системам, модели склонны к «миопии» — краткосрочному планированию, которое не учитывает оптимальный путь к цели. Это объясняет, почему современные LLM часто застревают в циклах или совершают нелогичные действия при выполнении многоэтапных инструкций.

Для решения проблемы авторы предлагают новые подходы к обучению с подкреплением и поисковым алгоритмам, которые позволяют моделям лучше оценивать промежуточные состояния. Исследование подчеркивает разрыв между способностью моделей к генерации текста и их реальной эффективностью в качестве автономных агентов, способных к самостоятельному принятию решений в динамических средах.

Ключевые факты

  • Исследование демонстрирует, что LLM систематически проваливают задачи, требующие глубокого планирования из-за ограничений авторегрессионной архитектуры.
  • Выявлена проблема «миопии» моделей, при которой они отдают предпочтение немедленному вознаграждению, игнорируя долгосрочную стратегию.
  • Предложены методы интеграции алгоритмов поиска и обучения с подкреплением для улучшения агентных способностей моделей.
  • Работа доказывает, что простое увеличение масштаба модели не решает проблему логических ошибок в многошаговых процессах.