Модель Kimi K3 от компании Moonshot AI значительно уступает ведущим американским разработкам в задачах, связанных с кибербезопасностью. Исследование, проведенное институтами безопасности ИИ Великобритании и США, показало, что модель не только демонстрирует низкую эффективность в создании эксплойтов, но и не справляется с блокировкой вредоносных запросов, несмотря на высокие показатели в общих бенчмарках.

Разрыв в производительности эксперты связывают с процессом дистилляции моделей. При обучении Kimi K3 на основе более крупных систем, модель, вероятно, теряет глубокие знания, необходимые для выполнения узкоспециализированных и сложных задач, таких как поиск уязвимостей. Это подчеркивает проблему «деградации» навыков при попытке сжать возможности мощных LLM в более компактные и быстрые решения.

Результаты тестирования ставят под сомнение надежность систем безопасности в современных китайских моделях при работе с критическими сценариями. Отсутствие эффективных фильтров для предотвращения генерации вредоносного кода делает Kimi K3 уязвимой перед использованием в злонамеренных целях, что требует пересмотра подходов к обучению и настройке защитных механизмов (guardrails) для подобных моделей.

Ключевые факты

  • Kimi K3 набрала 32% в тесте ExploitBench, тогда как ведущие модели США достигают 76%.
  • Исследование проведено совместно Британским институтом безопасности ИИ и Центром стандартов и инноваций в области ИИ США.
  • Модель продемонстрировала неспособность блокировать создание эксплойтов и имитацию кибератак.
  • Одной из вероятных причин отставания эксперты называют потерю компетенций при дистилляции моделей.
  • Высокие баллы в общих бенчмарках не коррелируют с реальной устойчивостью модели в специфических задачах кибербезопасности.