Исследователи представили метод коррекции временных предпочтений модели Qwen3-32B с помощью контрастного добавления активаций. Анализируя линейные представления временного горизонта в остаточном потоке модели, авторы научились направлять ответы ИИ в сторону краткосрочных или долгосрочных приоритетов. Это позволяет менять характер рекомендаций и логику принятия решений без необходимости полноценного дообучения весов нейросети.
Метод базируется на поиске специфических направлений в пространстве активаций, которые отвечают за восприятие временных интервалов. Обучая контрастные линейные зонды на ответах с принудительным выбором, исследователи выделили векторы, смещение которых позволяет «переключать» модель между фокусом на немедленном результате и стратегическим планированием. Такой подход открывает возможности для более гибкой настройки поведения моделей в задачах, требующих учета долгосрочных последствий.
Техника активационного управления (activation steering) демонстрирует эффективность в изменении склонностей модели к темпоральному дисконтированию. В отличие от традиционного fine-tuning, этот метод требует минимальных вычислительных затрат, так как воздействие происходит непосредственно на скрытые состояния модели во время инференса. Это делает инструмент перспективным для адаптации LLM под конкретные бизнес-задачи, где критически важен баланс между оперативностью и долгосрочной эффективностью.
Ключевые факты
- Исследование проведено на модели Qwen3-32B, демонстрирующей выраженные линейные представления временного горизонта.
- Метод использует контрастное добавление активаций (Contrastive Activation Addition) для изменения предпочтений модели в реальном времени.
- Техника позволяет эффективно переключать модель между краткосрочной и долгосрочной перспективой без изменения основных весов.
- Линейные зонды обучались на данных, полученных методом teacher-forced, для выявления векторов, отвечающих за временные предпочтения.