Исследователи доказали, что механизмы безопасности, полагающиеся на вставку инструкций в контекстное окно модели, не обеспечивают надежной защиты. Анализ показал, что такие «системные промпты» легко обходятся с помощью атак типа «инъекция», так как модель не может гарантированно отличить защитные инструкции от пользовательского ввода, что ставит под сомнение текущие методы обеспечения безопасности ИИ.

Авторы работы проанализировали архитектурные ограничения современных больших языковых моделей при обработке контекста. Основная проблема заключается в том, что модель воспринимает все данные в окне контекста как равнозначные токены. В результате злоумышленник может использовать методы манипуляции, чтобы переопределить или полностью проигнорировать правила безопасности, внедренные разработчиками через системные промпты или RAG-системы.

Данное исследование подчеркивает необходимость перехода от поверхностных методов защиты к более глубоким архитектурным изменениям. Текущие подходы, основанные на фильтрации или добавлении правил в промпт, являются лишь временным решением, которое не защищает от целенаправленных атак на логику поведения модели. Специалисты рекомендуют внедрять многоуровневые системы проверки, которые не зависят исключительно от контекстного окна.

Ключевые факты

  • Исследование демонстрирует, что инструкции безопасности, передаваемые через контекст, не имеют приоритета над пользовательским вводом.
  • Основной вектор атаки заключается в перехвате управления моделью через инъекции, которые заставляют LLM игнорировать ранее заданные ограничения.
  • Метод «копируемого контекста» признан ненадежным для предотвращения генерации вредоносного или запрещенного контента.
  • Работа указывает на критическую уязвимость в популярных фреймворках, использующих RAG для управления поведением агентов.