Исследователи из BAIR представили метод ABBEL, обучающий языковые модели динамически обновлять свои внутренние представления в процессе взаимодействия. В отличие от стандартных LLM, которые полагаются на фиксированные веса, ABBEL позволяет агентам корректировать свои «убеждения» о среде в реальном времени, что критически важно для выполнения многоэтапных задач и долгосрочного планирования в условиях неопределенности.

Традиционные подходы к работе с контекстом часто ограничены размером окна и не учитывают необходимость активной фильтрации информации при изменении состояния среды. Метод ABBEL вводит механизм, при котором агент учится различать, какую информацию стоит сохранить в долгосрочной памяти, а какую — отбросить как устаревшую. Это позволяет модели сохранять высокую точность действий на протяжении сотен шагов, не перегружая контекстное окно избыточными данными.

Разработка направлена на решение проблемы «забывания» или накопления ошибок в агентных системах, работающих в динамических мирах. Авторы продемонстрировали, что интеграция процесса обновления убеждений в архитектуру модели значительно повышает эффективность выполнения сложных последовательных задач, где каждое последующее действие зависит от актуализации данных, полученных на предыдущих этапах взаимодействия.

Ключевые факты

  • Метод ABBEL (Agent Belief-Based Learning) разработан исследователями из Berkeley Artificial Intelligence Research (BAIR).
  • Основная цель — улучшение способности LLM к долгосрочному планированию за счет динамического обновления внутренних представлений.
  • Система позволяет агентам эффективно управлять памятью, отсеивая неактуальные данные в процессе выполнения многоэтапных задач.
  • Тестирование показало значительное преимущество метода в сценариях, требующих адаптации к меняющимся условиям среды на длинных временных горизонтах.