Исследователи проанализировали влияние процедурных навыков на работу ИИ-агентов, выявив феномен «регрессионного налога». Несмотря на рост среднего успеха в задачах, внедрение новых навыков часто приводит к деградации производительности в других сценариях. Анализ 6000 запусков показал, что расширение функциональности агента не всегда линейно улучшает результат, создавая скрытые риски для стабильности автоматизированных систем.
Авторы работы сосредоточились на том, как именно дополнительные инструменты и алгоритмы действий влияют на принятие решений LLM. Выяснилось, что избыточное количество навыков может приводить к «зашумлению» контекста модели, заставляя её выбирать менее оптимальные стратегии даже там, где она ранее справлялась успешно. Это ставит под сомнение традиционный подход к оценке агентов, основанный исключительно на средних показателях успешности.
Для оценки использовались два бенчмарка по автоматизации офисных задач и три различных стека моделей. Полученные данные позволяют разделить влияние навыков на положительное (улучшение выполнения специфических задач) и отрицательное (снижение точности в базовых операциях). Исследование подчеркивает необходимость более глубокого тестирования агентов перед их внедрением в реальные рабочие процессы.
Ключевые факты
- Проведено почти 6000 тестовых запусков ИИ-агентов для оценки влияния процедурных навыков.
- Использованы два независимых бенчмарка в области офисной автоматизации.
- Исследование охватило три различных стека моделей для обеспечения репрезентативности результатов.
- Выявлен эффект «регрессионного налога», при котором расширение функционала агента приводит к снижению качества выполнения базовых задач.
- Доказано, что средний показатель успеха маскирует реальные потери в производительности при добавлении новых инструментов.