Исследователи выявили фундаментальный конфликт в современных моделях с цепочкой рассуждений (Chain-of-Thought). Для эффективного мониторинга ИИ должен строго следовать своим логическим шагам, однако высокая верность рассуждениям снижает способность модели отклонять небезопасные запросы. Это создает «напряжение алайнмента», при котором разработчикам приходится выбирать между прозрачностью логики и устойчивостью к вредоносному контенту.
Метод Chain-of-Thought часто используется для интерпретации действий модели, так как он позволяет отследить путь принятия решения. Однако авторы работы доказывают, что текущие методы обучения нацелены на достижение обоих параметров одновременно, что приводит к компромиссам. Модели, которые слишком «честно» отражают ход своих мыслей, становятся более уязвимыми к манипуляциям, так как их внутренние рассуждения могут содержать небезопасные паттерны, которые модель не успевает отфильтровать.
Проблема заключается в том, что механизмы безопасности часто работают как «поверхностный слой», блокирующий уже сформированный ответ. Если модель принуждают к строгой логической последовательности, она может выдать промежуточные опасные выводы до того, как сработает защитный фильтр. Это требует пересмотра подходов к обучению моделей, чтобы сделать их рассуждения одновременно прозрачными для аудита и устойчивыми к попыткам обхода ограничений.
Ключевые факты
- Выявлен конфликт между верностью (faithfulness) рассуждений и безопасностью (safety) ответов.
- Использование Chain-of-Thought повышает прозрачность мониторинга, но ослабляет защитные барьеры модели.
- Высокая верность рассуждениям делает модель более подверженной генерации небезопасного контента в процессе цепочки мыслей.
- Исследование подчеркивает необходимость новых методов обучения, балансирующих интерпретируемость и безопасность.