Исследователи выявили новый вектор атак на LLM, получивший название «token torching». Метод заключается в намеренной перегрузке контекстного окна модели специально подобранными токенами, что приводит к принудительному сбросу памяти или обходу системных инструкций. Это создает критические уязвимости в безопасности, позволяя злоумышленникам манипулировать поведением агентов и получать доступ к защищенным данным.
Атака эксплуатирует фундаментальные принципы работы механизмов внимания (attention mechanisms) в архитектуре трансформеров. Заполняя контекст «мусорными» данными, атакующий заставляет модель вытеснять из оперативной памяти важные системные промпты или инструкции безопасности. В результате модель теряет контекст своих ограничений и становится восприимчивой к инъекциям, которые ранее блокировались фильтрами.
Проблема особенно актуальна для корпоративных RAG-систем и автономных агентов, которые работают с длинными цепочками рассуждений. Поскольку современные модели стремятся оптимизировать использование токенов для экономии ресурсов, механизмы управления памятью становятся слабым звеном. Разработчикам рекомендуется пересмотреть подходы к изоляции системных инструкций от пользовательского ввода и внедрить более строгие методы валидации контекста.
Ключевые факты
- Token Torching использует переполнение контекстного окна для вытеснения системных инструкций из «рабочей памяти» модели.
- Атака позволяет обходить встроенные фильтры безопасности, заставляя модель «забыть» свои ограничения.
- Уязвимость представляет особую опасность для сложных агентных систем, использующих RAG и длительные сессии взаимодействия.
- Основной метод защиты заключается в архитектурной изоляции системных промптов от динамически загружаемых данных пользователя.