Исследователи опубликовали детальный разбор векторов атак на системы, использующие большие языковые модели. Основное внимание уделено рискам, связанным с инъекциями промптов, утечками данных через контекстное окно и манипуляциями с агентными цепочками. Авторы предлагают конкретные стратегии защиты, включая строгую валидацию входных данных и изоляцию сред исполнения для предотвращения несанкционированного доступа к внешним API.

Внедрение LLM в бизнес-процессы создает новые поверхности для атак, которые выходят за рамки классических веб-уязвимостей. В частности, злоумышленники могут использовать «отравленные» данные в RAG-системах или эксплуатировать отсутствие контроля над тем, какие инструменты агент вызывает в процессе выполнения задачи. Безопасность теперь требует многоуровневого подхода, сочетающего фильтрацию на уровне промптов и мониторинг поведения агентов в реальном времени.

Особую сложность представляет недетерминированность ответов моделей, что затрудняет создание жестких правил безопасности. Разработчикам рекомендуется внедрять механизмы «человека в контуре» (human-in-the-loop) для критически важных операций и использовать специализированные фреймворки для оценки безопасности промптов перед их отправкой в модель. Такой подход позволяет минимизировать риск выполнения вредоносного кода или раскрытия конфиденциальной информации.

Ключевые факты

  • Основные векторы угроз включают прямые и косвенные инъекции промптов, а также манипуляции с системными инструкциями.
  • Использование RAG-архитектур требует проверки источников данных на наличие вредоносного контента, способного исказить ответы модели.
  • Рекомендуется реализация принципа минимальных привилегий для ИИ-агентов при доступе к внешним базам данных и API.
  • Мониторинг вызовов инструментов (tool use) является обязательным этапом для предотвращения выполнения неавторизованных действий в инфраструктуре.
  • Валидация выходных данных модели (output sanitization) необходима для предотвращения атак типа «отравление контекста» в последующих итерациях диалога.