Исследование показало, что популярные методы улучшения ответов LLM через самокритику, планирование и рефлексию часто уступают простому многократному сэмплированию при равных затратах токенов. Авторы доказали, что рост точности в сложных задачах при использовании агентных техник саморефлексии обусловлен не качеством алгоритмов, а увеличением общего объема сгенерированного текста, что делает простые подходы более экономически выгодными.
Методы, заставляющие модель критиковать собственные черновики или вступать в дебаты с копиями самой себя, потребляют значительное количество вычислительных ресурсов. Исследователи проанализировали модели размером от 1,5 млрд до 7 млрд параметров и установили, что при одинаковом бюджете на генерацию токенов стратегия «сгенерировать несколько вариантов и выбрать лучший» демонстрирует более высокую производительность, чем сложные итеративные процессы.
Результаты работы ставят под сомнение эффективность сложных агентных архитектур, ориентированных на многошаговое рассуждение и самокоррекцию. Вместо внедрения ресурсоемких циклов рефлексии разработчикам предлагается сфокусироваться на оптимизации стратегий сэмплирования, которые обеспечивают сопоставимый или лучший результат при меньшей сложности реализации и предсказуемых затратах на инференс.
Ключевые факты
- Исследование охватило модели с количеством параметров от 1,5 млрд до 7 млрд.
- Методы саморефлексии и итеративного планирования проигрывают простому многократному сэмплированию при равном расходе токенов.
- Рост точности в агентных системах часто является следствием увеличения объема вывода, а не интеллектуального преимущества алгоритмов рефлексии.
- Авторы рекомендуют пересмотреть подходы к проектированию агентных систем в пользу более простых методов выбора лучших ответов из нескольких генераций.