Компания Anthropic опубликовала практическое руководство для руководителей по информационной безопасности (CISO), посвященное безопасной интеграции агентных систем в корпоративную среду. Основной посыл документа заключается в переходе от стратегии «нулевого риска» к управлению рисками, где фокус смещается на контроль доступа, прозрачность действий агентов и минимизацию потенциального ущерба при сохранении продуктивности бизнес-процессов.

Внедрение автономных агентов требует пересмотра традиционных моделей безопасности, ориентированных на статические приложения. Anthropic предлагает внедрять многоуровневую защиту, начиная с жесткого ограничения прав доступа агентов к критическим системам и заканчивая внедрением механизмов «человека в контуре» (human-in-the-loop) для операций, несущих высокие риски. Важным аспектом является логирование всех действий агента для последующего аудита и анализа аномалий.

Документ подчеркивает необходимость создания среды, в которой агенты работают в рамках четко определенных «песочниц» с ограниченными полномочиями. Такой подход позволяет компаниям использовать преимущества автоматизации, не подвергая угрозе целостность данных или стабильность инфраструктуры. Особое внимание уделяется проверке входных данных и защите от атак типа «инъекция промптов», которые могут скомпрометировать логику принятия решений агентом.

Ключевые факты

  • Anthropic рекомендует принцип «наименьших привилегий», при котором агенту предоставляется доступ только к тем инструментам и данным, которые необходимы для выполнения конкретной задачи.
  • Внедрение обязательного подтверждения человеком (human-in-the-loop) предлагается как основной метод контроля для операций, связанных с изменением данных или финансовыми транзакциями.
  • Рекомендуется создание изолированных сред исполнения для агентов, чтобы предотвратить несанкционированный доступ к внутренним API компании.
  • Стратегия безопасности должна включать непрерывный мониторинг и аудит действий агентов для выявления отклонений от заданных бизнес-сценариев.
  • Акцент сделан на защите от состязательных атак, направленных на манипуляцию поведением LLM через вредоносные инструкции.