Исследователи представили метод On-Policy Distillation, направленный на повышение безопасности LLM при дообучении. Подход решает проблему внедрения вредоносного поведения через скомпрометированные обучающие выборки. Используя механизм маршрутизации (routing), система позволяет эффективно перенастраивать модели, сохраняя их профессиональные навыки и одновременно блокируя попытки обхода этических ограничений, которые часто встречаются в стандартных сценариях fine-tuning.
Традиционные методы обеспечения безопасности часто оказываются неэффективными, так как они либо снижают полезность модели, либо не справляются с изощренными атаками через отравленные данные. Предложенный подход фокусируется на создании устойчивых шаблонов поведения, которые модель усваивает в процессе дистилляции. Это позволяет разработчикам контролировать алайнмент даже в тех случаях, когда исходные данные для дообучения могут содержать скрытые угрозы или попытки манипуляции.
Механизм маршрутизации выступает в роли фильтра, который определяет, какие аспекты поведения модели требуют корректировки, а какие должны остаться неизменными. Это минимизирует риск деградации базовых способностей модели при попытках принудительного изменения её «мировоззрения». Метод демонстрирует высокую устойчивость к попыткам внедрения вредоносных паттернов, сохраняя при этом производительность на уровне специализированных моделей.
Ключевые факты
- Метод On-Policy Distillation использует архитектуру маршрутизации для предотвращения внедрения вредоносного поведения в LLM.
- Технология защищает модели от атак через отравленные обучающие корпуса, которые сохраняют профессиональную компетенцию, но нарушают этические нормы.
- Подход решает проблему неэффективности существующих методов защиты, которые часто приводят к потере полезности модели или уязвимости перед специфическими триггерами.
- Разработка направлена на повышение надежности цепочек поставок ИИ-моделей, где сторонние данные могут быть скомпрометированы.