Исследователи обнаружили, что при обращении к API-эндпоинтам современных LLM в каждый запрос автоматически внедряется около 1447 скрытых токенов. Этот слой системных инструкций, невидимый для конечного пользователя, существенно влияет на поведение модели, её ограничения и стиль ответов. Анализ показал, что подобные «пришпиленные» промпты используются для управления безопасностью и специфической настройки логики работы нейросети.
Изучение структуры этих скрытых данных позволяет лучше понять, как разработчики моделей выстраивают защиту от инъекций и задают рамки допустимого поведения. Авторы исследования отмечают, что состав этих токенов может меняться со временем, что указывает на динамическое обновление системных инструкций на стороне сервера без уведомления пользователей. Это создает определенные риски, так как скрытые инструкции могут конфликтовать с пользовательскими запросами или приводить к непредсказуемым результатам при сложных цепочках рассуждений.
Подобные методы «отпечатков» и скрытого управления промптами становятся стандартом в индустрии для обеспечения консистентности ответов. Однако прозрачность этих механизмов остается низкой, что затрудняет отладку агентных систем, полагающихся на предсказуемое поведение базовых моделей. Понимание того, как именно системный промпт перехватывает управление контекстом, является критически важным для оценки надежности ИИ-приложений в продакшене.
Ключевые факты
- Объем скрытой системной нагрузки составляет в среднем 1447 токенов на каждый запрос.
- Скрытые инструкции включают в себя жесткие правила безопасности и специфические директивы по стилю ответов.
- Обнаружена корреляция между изменением скрытых токенов и «дрейфом» поведения модели в задачах на следование инструкциям.
- Метод анализа основан на отслеживании изменений в ответах модели при попытках извлечения системного промпта через техники инъекций.
- Исследование подтверждает, что системные промпты обновляются провайдерами моделей в фоновом режиме без изменения версии API.