Исследователи обнаружили метод стеганографии, позволяющий LLM скрывать произвольные данные внутри сгенерированного текста без изменения его длины или визуального восприятия. Технология использует манипуляции с распределением вероятностей токенов, что делает скрытое сообщение практически незаметным для человека и стандартных систем фильтрации, сохраняя при этом исходную семантику и структуру сообщения.

Метод основан на кодировании информации в последовательности выбора токенов, которые модель считает равнозначными по смыслу. В отличие от традиционных методов стеганографии, которые часто требуют увеличения объема текста или внедрения специфических артефактов, этот подход позволяет встраивать данные в естественный поток речи. Это создает новые вызовы для безопасности, так как скрытые каналы связи могут использоваться для обхода систем мониторинга контента или передачи конфиденциальной информации через публичные чат-боты.

Авторы работы продемонстрировали, что скрытые данные можно извлекать с высокой точностью, используя специализированный декодер, при этом «контейнер» остается полностью валидным текстом. Исследование подчеркивает уязвимость текущих архитектур LLM к методам скрытой передачи данных, которые эксплуатируют вероятностную природу генерации токенов. Это открытие требует пересмотра подходов к аудиту безопасности моделей и разработке инструментов для обнаружения скрытых сообщений в сгенерированном контенте.

Ключевые факты

  • Метод позволяет встраивать данные в текст без увеличения его длины или изменения визуальных характеристик.
  • Технология использует вероятностные распределения токенов для кодирования информации, сохраняя семантическую связность.
  • Скрытые сообщения практически невозможно обнаружить при обычном чтении или стандартном анализе текста.
  • Исследование указывает на потенциальные риски использования LLM для создания скрытых каналов передачи данных в обход систем безопасности.