Исследователи изучили процесс дистилляции знаний из DeepSeek в меньшие модели, чтобы выяснить, наследуются ли встроенные механизмы цензуры. Эксперименты показали, что при переносе весов через дистилляцию ограничения безопасности не передаются автоматически. Это открывает возможности для создания компактных и производительных моделей без жестких фильтров, характерных для исходных проприетарных систем.
Процесс дистилляции позволяет эффективно переносить логику рассуждений и накопленные знания от крупных моделей к более компактным архитектурам. В ходе работы авторы использовали метод, при котором «учитель» передает свои когнитивные способности «ученику», однако специфические надстройки безопасности, внедренные через RLHF, остаются за пределами этого процесса. Это подтверждает гипотезу о том, что цензура является внешним слоем, а не фундаментальной частью структуры знаний модели.
Результаты исследования имеют значение для разработчиков, стремящихся создавать специализированные локальные решения. Отсутствие автоматического переноса ограничений упрощает настройку моделей под конкретные задачи, где требуется высокая степень автономности и отсутствие предустановленных этических фильтров, навязанных разработчиками исходных моделей.
Ключевые факты
- Исследование сфокусировано на переносе знаний из DeepSeek в архитектуру GPT-OSS.
- Метод дистилляции позволяет передавать способности к рассуждению без наследования механизмов цензуры.
- Установлено, что ограничения безопасности, внедренные через RLHF, не являются неотъемлемой частью весов модели.
- Работа демонстрирует способ получения компактных моделей с высокой производительностью и отсутствием внешних фильтров.