Исследователи представили SESA (Self-Evolving Skill-Augmented Agent) — архитектуру, объединяющую самообучение через игру (self-play) с механизмом внешней памяти навыков. В отличие от стандартных моделей, SESA не просто корректирует веса через градиенты, а сохраняет процедурный опыт в структурированной памяти, что позволяет агенту целенаправленно формировать учебную программу, решать задачи и запоминать успешные стратегии для будущих итераций.

Традиционные методы обучения агентов часто страдают от отсутствия «памяти» о прошлых неудачах: ошибки влияют на текущий градиент, но не формируют долгосрочный опыт. SESA решает эту проблему, создавая цикл, в котором агент самостоятельно генерирует задачи, пытается их решить и записывает эффективные алгоритмы действий во внешнее хранилище. Это позволяет системе эволюционировать, опираясь на накопленную базу навыков, а не только на случайные попытки или фиксированные наборы данных.

Такой подход значительно повышает адаптивность агентов в условиях, где нет заранее заданных бенчмарков. Благодаря интеграции памяти навыков, агент способен переносить опыт из решенных задач на новые, более сложные сценарии, что делает процесс обучения более автономным и эффективным. Система демонстрирует, как комбинация генерации задач и их последующего структурированного запоминания меняет парадигму построения агентных систем.

Ключевые факты

  • SESA (Self-Evolving Skill-Augmented Agent) объединяет механизмы self-play и внешнюю память для накопления процедурного опыта.
  • Система самостоятельно генерирует учебные задачи без опоры на внешние эталонные бенчмарки.
  • Внешняя память навыков позволяет агенту сохранять успешные стратегии и использовать их для решения будущих проблем.
  • Архитектура устраняет разрыв между кратковременным обучением через градиенты и долгосрочным сохранением навыков.
  • Метод направлен на создание автономных агентов, способных к непрерывному самосовершенствованию в динамических средах.