Исследователи представили метод Activation Steering, позволяющий управлять процессом рассуждения больших языковых моделей на уровне их внутренних состояний. В отличие от стандартных промпт-инжиниринговых подходов, работающих на входных данных, новый метод позволяет корректировать траектории мышления модели в реальном времени, предотвращая зацикливание и повышая точность выполнения сложных логических задач.
Современные модели часто сталкиваются с проблемой «самозацикливания» при выполнении многошаговых рассуждений, когда модель не может выйти из повторяющихся паттернов генерации. Авторы работы проанализировали скрытую динамику переходов в нейронных сетях и разработали механизм, который вмешивается в активации слоев в процессе инференса. Это дает возможность направлять модель по более эффективному пути решения, не прибегая к дорогостоящему дообучению или изменению весов всей архитектуры.
Технология базируется на выявлении конкретных векторов активации, отвечающих за определенные этапы логического вывода. Манипулируя этими векторами, разработчики могут принудительно переключать модель между различными режимами мышления или прерывать нежелательные циклы. Такой подход открывает перспективы для создания более предсказуемых и управляемых агентных систем, где критически важна стабильность цепочки рассуждений.
Ключевые факты
- Метод Activation Steering позволяет контролировать траектории рассуждений LLM без изменения входного промпта.
- Технология направлена на устранение «самозацикливания» (self-loops), характерного для моделей с расширенными цепочками рассуждений.
- Вмешательство происходит на уровне скрытых состояний (latent dynamics) модели в процессе генерации токенов.
- Метод обеспечивает более тонкий контроль над логикой модели по сравнению с традиционными методами обучения с подкреплением или системными промптами.