Исследователи представили новый подход к изучению долгосрочного планирования в ИИ-агентах, переходя от обучения на неструктурированных данных из интернета к контролируемой среде. Работа фокусируется на методах дистилляции агентных навыков от одного или нескольких учителей, что позволяет точно отследить процесс формирования способности модели к многоходовому планированию и оптимизировать её архитектуру для выполнения сложных задач.
Основная проблема существующих моделей заключается в их обучении на «непрозрачных» данных, где невозможно выделить конкретные цепочки рассуждений, приведшие к успеху. Авторы статьи предлагают унифицированную среду, которая позволяет изолировать факторы, влияющие на качество планирования. Это дает возможность понять, как именно навыки стратегического мышления интегрируются в модель на этапах пре-тренинга и пост-тренинга.
Методология опирается на концепцию «агентной дистилляции» (agentic distillation), при которой модель обучается на траекториях, созданных экспертными системами. Такой подход позволяет не просто увеличивать объем данных, а целенаправленно улучшать способность агента к декомпозиции длинных задач на последовательные шаги, минимизируя ошибки при выполнении многоходовых сценариев.
Ключевые факты
- Исследование фокусируется на преодолении ограничений обучения на «сырых» интернет-данных для задач долгосрочного планирования.
- Предложен метод дистилляции навыков от одного или нескольких учителей (Single- and Multi-Teacher On-Policy Distillation).
- Разработана контролируемая среда для точной оценки того, как именно формируются и закрепляются способности агента к многоходовому планированию.
- Работа затрагивает критические этапы жизненного цикла модели: от предварительного обучения до финальной донастройки (post-training).
- Исследование направлено на повышение предсказуемости и надежности агентных систем при работе с задачами, требующими длительного горизонта планирования.