Исследователи представили метод Hybrid Advantage Estimation (HAE) для обучения мультимодальных моделей (VLM) в интерактивных средах. Подход объединяет токенизированную и пошаговую оптимизацию с использованием унифицированного критика, что позволяет агентам эффективнее принимать решения в многоходовых сценариях. Это решает проблему разрыва между предсказанием отдельных токенов и долгосрочным планированием, повышая общую результативность ИИ-агентов в сложных динамических задачах.

Современные VLM-агенты часто сталкиваются с трудностями при выполнении последовательных действий, где ошибка на раннем этапе приводит к провалу всей задачи. Традиционные методы обучения либо фокусируются на оптимизации каждого токена, что игнорирует контекст всей траектории, либо работают на уровне отдельных шагов, теряя детализацию. Новый подход с унифицированным критиком позволяет модели оценивать полезность действий на разных уровнях абстракции, обеспечивая более стабильное обучение с подкреплением.

Внедрение гибридной оценки преимуществ позволяет агентам лучше справляться с неопределенностью в интерактивных средах. Система эффективно балансирует между краткосрочной точностью генерации текста и долгосрочной стратегией достижения цели. Это значимый шаг в сторону создания автономных агентов, способных к последовательному рассуждению и выполнению сложных инструкций в реальном времени.

Ключевые факты

  • Метод HAE (Hybrid Advantage Estimation) объединяет токенизированную и пошаговую оптимизацию для VLM-агентов.
  • Использование унифицированного критика позволяет модели оценивать действия на разных уровнях планирования.
  • Исследование направлено на улучшение способности агентов к многоходовому принятию решений в интерактивных средах.
  • Метод решает проблему накопления ошибок при долгосрочном планировании в агентных системах.