Interlock представляет собой новый подход к безопасности ИИ-агентов, работающий как runtime-фаервол. В отличие от традиционных методов фильтрации промптов, система исходит из того, что инъекция неизбежна. Инструмент контролирует выполнение агента в реальном времени, предотвращая несанкционированную эксфильтрацию данных и блокируя вредоносные действия на этапе исполнения команд, а не на этапе ввода текста.
Архитектура решения сфокусирована на изоляции критических операций, которые совершает агент при взаимодействии с внешними API или базами данных. Вместо того чтобы пытаться распознать «злой» умысел в запросе пользователя, Interlock анализирует контекст выполнения и ограничивает область доступа агента к системным ресурсам. Это позволяет минимизировать риски, даже если злоумышленнику удалось успешно внедрить вредоносную инструкцию через промпт.
Такой подход критически важен для систем, где агенты имеют доступ к конфиденциальным данным или инструментам записи. Фаервол выступает в роли посредника, который проверяет каждое действие агента на соответствие заданным политикам безопасности, обеспечивая дополнительный слой защиты для агентных систем, работающих в открытых или слабо защищенных средах.
Ключевые факты
- Interlock работает по принципу «нулевого доверия» к входящим промптам, фокусируясь на защите среды исполнения.
- Система предотвращает эксфильтрацию данных, блокируя подозрительные вызовы API в режиме реального времени.
- Инструмент предназначен для интеграции в пайплайны агентных систем, где LLM имеют доступ к внешним инструментам и базам данных.
- Основная задача фаервола — ограничение прав агента в процессе выполнения, что минимизирует последствия успешных атак типа prompt injection.