Исследователи обнаружили уязвимость в API проприетарных LLM, позволяющую восстанавливать скрытые цепочки рассуждений (chain-of-thought). Провайдеры шифруют эти данные на стороне клиента, чтобы защитить интеллектуальную собственность, однако новый метод атаки позволяет обходить эту защиту. Это ставит под угрозу конфиденциальность внутренних логических процессов моделей, которые разработчики стремятся скрыть от пользователей и конкурентов.
Современные модели часто используют скрытые этапы рассуждения для повышения точности ответов. Чтобы избежать утечек, провайдеры передают эти данные клиенту в зашифрованном виде, требуя их возврата при последующих запросах. Исследователи доказали, что при определенных условиях эти «блоки рассуждений» могут быть расшифрованы или интерпретированы, что дает злоумышленникам доступ к проприетарным методам генерации ответов.
Данная работа подчеркивает фундаментальную проблему безопасности в архитектуре «клиент-сервер» для ИИ-сервисов. Даже при использовании шифрования, передача метаданных процесса мышления модели на сторону клиента создает вектор атаки, который может быть использован для реверс-инжиниринга или извлечения чувствительной информации, заложенной в логику работы модели.
Ключевые факты
- Разработчики API используют шифрование цепочек рассуждений, передавая их клиенту как непрозрачные блоки данных для последующих запросов.
- Исследование демонстрирует возможность восстановления этих данных, несмотря на попытки провайдеров скрыть внутреннюю логику работы моделей.
- Уязвимость позволяет сторонним лицам анализировать пошаговый процесс мышления модели, что является интеллектуальной собственностью провайдера.
- Метод опирается на анализ взаимодействия клиента и сервера при передаче зашифрованных контекстных блоков в рамках многошаговых диалогов.