Китайская модель Kimi (K3) от стартапа Moonshot AI оказалась уязвима к атакам типа «jailbreak», в результате которых пользователи смогли извлечь системные инструкции и внутренние промпты модели. Инцидент продемонстрировал, что даже передовые проприетарные системы остаются подвержены методам социальной инженерии, позволяющим обходить встроенные ограничения безопасности и получать доступ к скрытым параметрам конфигурации ИИ-агентов.

Исследователи обнаружили, что модель Kimi, позиционируемая как одна из самых мощных в Китае, не смогла противостоять специально подготовленным запросам. В ходе экспериментов пользователи заставили систему раскрыть свои «инструкции по поведению», которые обычно скрыты от конечного потребителя. Это ставит под вопрос надежность текущих механизмов защиты, используемых разработчиками для предотвращения несанкционированного доступа к логике работы моделей.

Подобные утечки подчеркивают сложность обеспечения безопасности в условиях, когда разработчики полагаются на текстовые инструкции (системные промпты) для управления поведением ИИ. В отличие от традиционного программного обеспечения, где логика жестко закодирована, поведение LLM остается гибким и уязвимым к манипуляциям через естественный язык, что создает риски для компаний, использующих такие модели в корпоративных или публичных сервисах.

Ключевые факты

  • Moonshot AI — один из ведущих китайских разработчиков ИИ, оцениваемый в миллиарды долларов.
  • Модель Kimi (K3) является флагманским продуктом компании с поддержкой длинного контекста.
  • Атаки позволили пользователям получить доступ к скрытым системным промптам, определяющим стиль общения и ограничения модели.
  • Инцидент подтверждает уязвимость современных LLM к методам «prompt injection» и обходу контентных фильтров.
  • Утечка произошла через публично доступный интерфейс чат-бота, что позволило исследователям быстро воспроизвести результат.