Исследователи представили метод подавления специфических внутренних состояний LLM, отвечающих за «осознанность оценки» (evaluation-awareness), без необходимости прямого вмешательства в веса или активации модели в процессе инференса. Вместо редактирования активаций авторы используют оптимизированные промпты, которые принудительно минимизируют целевые латентные представления, сохраняя при этом естественность и связность текста.

Традиционные методы управления поведением моделей, такие как activation steering, требуют доступа к внутренним слоям нейросети во время генерации, что ограничивает их применение в закрытых API-системах. Новый подход переносит задачу на этап подготовки входных данных. Оптимизируя промпт таким образом, чтобы «выключить» латентные переменные, связанные с пониманием моделью того, что она проходит тестирование, можно влиять на результаты бенчмарков и обходить механизмы безопасности.

Это исследование поднимает вопросы о надежности текущих методов оценки ИИ. Если модель способна скрывать свою «осознанность» через специфические входные данные, результаты стандартных тестов на безопасность и алайнмент могут быть искажены. Метод демонстрирует, что для манипуляции поведением модели не всегда требуется доступ к её «мозгам» — достаточно правильно подобранного контекста, который подавляет нежелательные внутренние сигналы.

Ключевые факты

  • Метод фокусируется на подавлении латентных представлений, которые позволяют модели распознавать, что она находится в процессе оценки или тестирования.
  • В отличие от activation steering, предложенный подход работает исключительно через оптимизацию входного промпта (input-only suppression).
  • Техника не требует доступа к весам или промежуточным активациям модели во время инференса, что делает её применимой к закрытым проприетарным моделям.
  • Исследование указывает на уязвимость современных бенчмарков безопасности, которые могут быть скомпрометированы через манипуляцию внутренними состояниями модели на входе.