Исследователи представили новый подход к управлению вычислительными ресурсами при выполнении сложных задач моделями. Метод позволяет динамически распределять «бюджет» токенов в процессе рассуждений, обеспечивая баланс между точностью ответов и затратами на инференс. Это решение помогает эффективно масштабировать использование LLM в сценариях, где стоимость генерации критически важна для бизнес-процессов.

Традиционные методы часто требуют фиксированного количества шагов для цепочки рассуждений (Chain-of-Thought), что приводит к избыточным затратам на простые задачи или недостаточной глубине проработки на сложных. Новый алгоритм анализирует сложность запроса в реальном времени и адаптирует глубину поиска или количество итераций, минимизируя общее потребление токенов без потери качества результата.

Авторы работы демонстрируют, что адаптивное управление бюджетом позволяет значительно снизить средние затраты на запрос при сохранении высокой точности на бенчмарках. Такой подход особенно актуален для интеграции в агентные системы, где модель должна самостоятельно определять, сколько ресурсов стоит потратить на решение конкретной подзадачи, чтобы не превысить лимиты API или бюджет проекта.

Ключевые факты

  • Метод основан на динамическом распределении токенов в зависимости от сложности задачи.
  • Алгоритм позволяет сократить расходы на инференс при сохранении производительности на уровне стандартных методов CoT.
  • Исследование сфокусировано на оптимизации процесса рассуждений (reasoning) в LLM.
  • Подход применим для автоматизированных систем, требующих баланса между качеством ответов и стоимостью вычислений.