Исследователи проанализировали новую версию модели DeepSeek V4-Flash-0731 и выявили рост уровня цензуры на 12 процентных пунктов по сравнению с превью-версией. Анализ показал, что ограничения носят избирательный характер и затрагивают специфические темы, что влияет на поведение модели при выполнении запросов, требующих нейтрального или объективного освещения спорных вопросов в рамках тестирования.
В ходе исследования использовалась методология оценки «отказа от ответа» (refusal rate) на наборах данных, имитирующих провокационные или чувствительные запросы. Авторы отмечают, что разработчики внесли корректировки в систему безопасности, которые привели к более частому срабатыванию фильтров. Это изменение демонстрирует тренд на ужесточение политики безопасности в последних итерациях моделей, что может ограничивать полезность инструмента в исследовательских задачах.
Данная работа подчеркивает проблему «дрейфа» поведения моделей после обновлений. Даже при сохранении архитектурных характеристик, изменения в процессе дообучения (RLHF) могут существенно менять границы допустимого контента. Для пользователей это означает необходимость повторной калибровки промптов и оценки надежности ответов при переходе на новые версии весов, так как модель становится более склонной к уклонению от прямых ответов.
Ключевые факты
- Уровень цензуры в версии V4-Flash-0731 вырос на 12 процентных пунктов относительно превью-версии.
- Изменения носят избирательный характер и сфокусированы на конкретных тематических категориях.
- Исследование базируется на метрике частоты отказов (refusal rate) при обработке чувствительных запросов.
- Наблюдаемый эффект связывают с корректировками в алгоритмах безопасности и процессах дообучения модели.