Исследователи выявили новый вектор атак на LLM, получивший название «token torching». Метод заключается в намеренной перегрузке контекстного окна модели специально подобранными токенами, что приводит к принудительному сбросу памяти или обходу системных инструкций. Это создает критические уязвимости в безопасности, позволяя злоумышленникам манипулировать поведением агентов и получать доступ к защищенным данным.

Атака эксплуатирует фундаментальные принципы работы механизмов внимания (attention mechanisms) в архитектуре трансформеров. Заполняя контекст «мусорными» данными, атакующий заставляет модель вытеснять из оперативной памяти важные системные промпты или инструкции безопасности. В результате модель теряет контекст своих ограничений и становится восприимчивой к инъекциям, которые ранее блокировались фильтрами.

Проблема особенно актуальна для корпоративных RAG-систем и автономных агентов, которые работают с длинными цепочками рассуждений. Поскольку современные модели стремятся оптимизировать использование токенов для экономии ресурсов, механизмы управления памятью становятся слабым звеном. Разработчикам рекомендуется пересмотреть подходы к изоляции системных инструкций от пользовательского ввода и внедрить более строгие методы валидации контекста.

Ключевые факты

  • Token Torching использует переполнение контекстного окна для вытеснения системных инструкций из «рабочей памяти» модели.
  • Атака позволяет обходить встроенные фильтры безопасности, заставляя модель «забыть» свои ограничения.
  • Уязвимость представляет особую опасность для сложных агентных систем, использующих RAG и длительные сессии взаимодействия.
  • Основной метод защиты заключается в архитектурной изоляции системных промптов от динамически загружаемых данных пользователя.