Исследователи проанализировали метод «аблитерации» (abliteration), используемый для снятия ограничений с LLM путем удаления векторов, отвечающих за отказ от выполнения запросов. Выяснилось, что этот процесс не уничтожает механизмы безопасности окончательно: модель способна восстановить исходное поведение при дообучении на минимальном объеме данных, что ставит под сомнение надежность подобных методов «разблокировки» моделей.

Метод аблитерации заключается в поиске и обнулении векторов активации, которые соответствуют нежелательным паттернам поведения или специфическим отказам модели. Однако авторы работы показывают, что структура знаний и логика принятия решений внутри нейросети распределены гораздо шире, чем предполагалось. Даже после удаления ключевых векторов, модель сохраняет скрытые корреляции, которые позволяют ей быстро «вспомнить» исходные инструкции безопасности при минимальном воздействии.

Это открытие имеет важное значение для понимания того, как именно работают механизмы контроля в современных LLM. Вместо того чтобы полагаться на удаление отдельных векторов, разработчикам следует учитывать, что алайнмент — это глубоко интегрированное свойство архитектуры, которое сложно нейтрализовать без существенного ущерба для функциональности и логических способностей модели.

Ключевые факты

  • Исследование демонстрирует, что удаление векторов активации (аблитерация) является обратимым процессом.
  • Модели восстанавливают исходный уровень безопасности после дообучения на выборке из нескольких сотен примеров.
  • Метод подтверждает, что механизмы алайнмента распределены по всей сети, а не локализованы в конкретных слоях или нейронах.
  • Результаты ставят под сомнение эффективность методов «обхода» ограничений через модификацию векторов как способа создания полностью бесконтрольных систем.