Исследователи представили SkillProx — фреймворк для автоматического формирования и оптимизации навыков ИИ-агентов через проксимальный текстовый градиентный спуск. В отличие от традиционных методов, требующих дообучения весов модели, SkillProx создает легкие текстовые артефакты. Они итеративно уточняются на основе анализа ошибок и траекторий выполнения задач, позволяя агентам эффективно адаптироваться к повторяющимся процессам без изменения архитектуры LLM.

Система решает проблему накопления процедурных знаний, превращая опыт выполнения задач в переиспользуемые инструкции. Метод имитирует процесс градиентного спуска в пространстве естественного языка: агент анализирует успешные и неудачные попытки, после чего корректирует свои «навыки» — текстовые модули, которые подгружаются в контекстное окно при необходимости. Это позволяет сохранять высокую гибкость системы при минимальных вычислительных затратах.

Подход значительно упрощает масштабирование агентных систем, так как новые навыки можно добавлять или обновлять «на лету» в процессе эксплуатации. Такой подход снижает зависимость от дорогостоящего дообучения (fine-tuning) и позволяет агентам накапливать экспертизу в узких доменах, сохраняя при этом общую логику работы базовой языковой модели.

Ключевые факты

  • SkillProx использует механизм проксимального текстового градиентного спуска для итеративного улучшения навыков.
  • Навыки представляют собой легковесные текстовые артефакты, не требующие обновления весов нейросети.
  • Система автоматически диагностирует ошибки и корректирует инструкции на основе анализа траекторий выполнения задач.
  • Метод обеспечивает переиспользование накопленного опыта в различных задачах без необходимости переобучения модели.