Исследователи безопасности подтвердили критическую уязвимость современных систем защиты ИИ-моделей, позволяющую обходить встроенные ограничения с помощью простых текстовых промптов. Даже базовые методы манипуляции, доступные пользователям без глубоких технических навыков, позволяют принуждать модели к генерации запрещенного контента, что ставит под вопрос надежность существующих фильтров безопасности в крупных языковых моделях.

Проблема заключается в фундаментальной архитектуре обучения моделей, где механизмы «guardrails» часто накладываются поверх основной архитектуры, а не являются её неотъемлемой частью. Злоумышленники используют методы «джейлбрейка» (jailbreak), которые эксплуатируют логические разрывы в инструкциях модели. Это позволяет обходить этические фильтры, заставляя систему игнорировать правила безопасности ради выполнения деструктивного запроса.

Эксперты отмечают, что текущие подходы к фильтрации контента на уровне промптов не обеспечивают защиты от целенаправленных атак. Разработчики вынуждены постоянно обновлять списки запрещенных слов и паттернов, однако это лишь временная мера, так как новые способы обхода появляются быстрее, чем системы успевают адаптироваться к ним. Это создает значительные риски для корпоративных решений, использующих ИИ в публичном доступе.

Ключевые факты

  • Исследование подтвердило, что большинство популярных LLM уязвимы к простым атакам типа «jailbreak».
  • Механизмы защиты часто игнорируются моделью, если запрос сформулирован как ролевая игра или гипотетическая ситуация.
  • Отсутствие глубокой интеграции безопасности в процесс обучения моделей делает фильтры легко обходимыми.
  • Разработчики систем безопасности вынуждены использовать реактивный подход, постоянно догоняя новые методы атак.
  • Уязвимости позволяют генерировать вредоносный код, инструкции по созданию опасных веществ и дезинформацию.