Исследователи предложили метод повышения безопасности кода, создаваемого ИИ-агентами, через анализ внутренних активаций вспомогательных моделей. Вместо проверки только итогового текста программы, предложенный подход считывает скрытые сигналы в «активационных зондах» (activation probes) модели-рецензента. Это позволяет выявлять потенциальные уязвимости, которые остаются незамеченными при обычном анализе вывода модели, обеспечивая дополнительный слой контроля в разработке.
Современные ИИ-агенты генерируют значительную часть промышленного кода, однако возможности человеческого аудита не успевают за темпами автоматизации. Поскольку большинство популярных моделей являются закрытыми, разработчики не имеют доступа к их внутренним состояниям. Использование открытых моделей в качестве рецензентов позволяет заглянуть «под капот» процесса генерации, где модель-рецензент может сигнализировать о небезопасных паттернах на основе своих внутренних представлений, даже если сам код выглядит синтаксически корректным.
Метод фокусируется на извлечении информации из промежуточных слоев нейронной сети, которые содержат семантические признаки безопасности. Это позволяет классифицировать фрагменты кода как потенциально опасные с более высокой точностью, чем при использовании традиционных статических анализаторов или простых промптов для проверки безопасности. Такой подход особенно актуален для интеграции в CI/CD пайплайны, где требуется автоматизированная фильтрация кода перед его попаданием в репозиторий.
Ключевые факты
- Метод использует активационные зонды для извлечения сигналов безопасности из внутренних слоев моделей-рецензентов.
- Подход позволяет выявлять уязвимости, которые пропускают стандартные методы проверки текста, генерируемого ИИ.
- Технология ориентирована на работу с открытыми моделями (open-weight), что решает проблему «черного ящика» при использовании закрытых агентных систем.
- Исследование направлено на масштабирование безопасности в условиях, когда объемы кода, написанного ИИ, превышают возможности ручного аудита.