Исследователи представили метод RoMeRL, решающий проблему неэффективного обучения памяти у ИИ-агентов. Алгоритм использует состояния полезности пониженного порядка для борьбы с размытием обратной связи и ловушкой «память-награда». Это позволяет агентам точнее оценивать релевантность накопленного опыта, предотвращая ошибочное обновление полезности для неактуальных данных при работе с длинными историями взаимодействий.

Системы памяти, основанные на обучении, часто сталкиваются с тем, что пространство состояний расширяется по мере накопления истории. Это приводит к тому, что сигналы подкрепления распределяются слишком широко, снижая качество обучения. Кроме того, при извлечении нескольких фрагментов памяти одновременно, награда часто распределяется по всем элементам сразу, что создает шум и искажает процесс оптимизации.

RoMeRL внедряет механизм сжатия состояний, который позволяет агенту эффективно фильтровать и приоритизировать информацию. Вместо того чтобы полагаться на всю траекторию целиком, система выделяет ключевые компоненты полезности. Такой подход повышает стабильность обучения и позволяет агентам быстрее адаптироваться к новым задачам, сохраняя при этом только действительно важный контекст для принятия решений.

Ключевые факты

  • Метод RoMeRL направлен на решение проблемы размытия обратной связи в самообучающихся агентных системах.
  • Использование состояний полезности пониженного порядка (Reduced-Order Utility States) позволяет эффективно сжимать пространство состояний.
  • Алгоритм устраняет «ловушку памяти-награды», возникающую при одновременном извлечении релевантных и нерелевантных данных.
  • Предложенный подход оптимизирует процесс обновления полезности, предотвращая искажение обучения из-за накопления избыточного опыта.