Исследователи представили новый класс атак на мультимодальные LLM, использующие скрытые аудио-инъекции. Метод позволяет внедрять вредоносные команды в звуковые потоки, которые остаются незаметными для человеческого слуха, но успешно распознаются моделями. Это создает серьезные риски для безопасности агентных систем, взаимодействующих с голосовыми интерфейсами, так как атака позволяет перехватывать управление или искажать логику выполнения задач.
Уязвимость основана на использовании специфических частотных характеристик, которые модели интерпретируют как легитимные инструкции. В отличие от классических текстовых атак, аудио-инъекции сложнее обнаружить с помощью стандартных фильтров контента, так как они маскируются под фоновый шум или естественную речь. Исследование демонстрирует, что даже современные защитные механизмы часто не способны отсечь подобные манипуляции, если модель настроена на высокую чувствительность к аудио-вводу.
Авторы работы протестировали метод на ряде популярных мультимодальных архитектур, подтвердив возможность выполнения несанкционированных действий в реальном времени. Это подчеркивает необходимость внедрения более надежных протоколов верификации аудио-данных на уровне инференса, чтобы предотвратить эксплуатацию агентов через голосовые каналы связи.
Ключевые факты
- Метод позволяет внедрять команды, которые человеческое ухо воспринимает как фоновый шум, но модель считывает как текст.
- Атаки успешно протестированы на актуальных мультимодальных LLM, используемых в агентных системах.
- Уязвимость позволяет обходить стандартные системы фильтрации, ориентированные на текстовый анализ.
- Исследование указывает на критическую необходимость разработки новых методов защиты для систем с голосовым управлением.