Исследователи обнаружили новый метод противодействия автоматизированному анализу вредоносного кода с помощью LLM. Злоумышленники начали внедрять в исполняемые файлы фрагменты текста, которые вызывают срабатывание фильтров безопасности или политик использования ИИ-моделей. Это заставляет инструменты анализа блокировать обработку кода, что затрудняет автоматическую детекцию угроз и замедляет работу специалистов по кибербезопасности.
Данная техника использует уязвимости в механизмах фильтрации контента, которыми оснащены современные ИИ-системы. Внедряя «запрещенные» слова или фразы, связанные с насилием, незаконной деятельностью или нарушением авторских прав, разработчики вредоносного ПО создают своего рода «цифровой щит». Когда система анализа пытается просканировать такой файл, она сталкивается с триггером безопасности и отказывается продолжать работу, классифицируя запрос как нарушение правил платформы.
Этот подход создает серьезную проблему для компаний, внедряющих ИИ-агентов в процессы мониторинга безопасности. Если модель настроена на жесткую фильтрацию входных данных, она становится уязвимой к подобным манипуляциям. В результате злоумышленники получают возможность скрывать вредоносный функционал, просто добавляя в код строки, которые гарантированно остановят процесс автоматического анализа.
Ключевые факты
- Метод основан на вставке в код строк, которые активируют встроенные фильтры безопасности LLM.
- Использование запрещенного контента заставляет ИИ-модели прерывать анализ файла из-за нарушения политик использования.
- Техника эффективно обходит автоматизированные системы проверки, которые полагаются на генеративные модели для интерпретации кода.
- Подобные манипуляции требуют от разработчиков систем безопасности пересмотра подходов к фильтрации данных и обработки исключений в ИИ-пайплайнах.