Новое исследование arXiv показывает, что модели с удаленными фильтрами безопасности («uncensored») демонстрируют статистически значимый сдвиг в сторону более оптимистичного тона по сравнению с их базовыми версиями. Анализ выявил, что снятие ограничений меняет не только готовность отвечать на запрещенные запросы, но и общую эмоциональную окраску генерируемого текста, делая ответы более позитивными.
Авторы работы проанализировали поведение популярных открытых моделей, подвергшихся процедуре «децензурирования» (удаления RLHF-слоев или специфических системных промптов). Выяснилось, что такие модели чаще используют лексику, связанную с положительными эмоциями, и реже прибегают к нейтральным или осторожным формулировкам, характерным для стандартных версий, прошедших через жесткое обучение с подкреплением на основе отзывов людей.
Этот феномен ставит вопросы о том, как именно механизмы алайнмента влияют на «личность» модели. Традиционное обучение безопасности часто делает ответы более сухими и формальными, что может подавлять естественную вариативность языка. В то же время, искусственное удаление этих барьеров приводит к непредсказуемым изменениям в стиле, которые могут влиять на качество и тональность взаимодействия с пользователем в прикладных задачах.
Ключевые факты
- Исследование основано на сравнительном анализе базовых LLM и их «нецензурированных» версий, полученных путем удаления фильтров безопасности.
- Установлено, что удаление ограничений коррелирует с ростом показателей оптимизма в ответах согласно лингвистическим метрикам.
- Базовые модели, прошедшие RLHF, демонстрируют более сдержанный и нейтральный тон из-за специфики процесса обучения безопасности.
- Изменение эмоционального фона моделей после снятия фильтров происходит без прямой настройки на позитивность, что указывает на побочный эффект процесса алайнмента.