Исследователи представили метод «Leaky Language Models», позволяющий извлекать конфиденциальные параметры архитектуры и специфические оптимизации инференса из закрытых LLM. Через серию специально сконструированных запросов злоумышленники могут восстановить размер скрытых слоев, количество голов внимания и даже детали квантования, что ставит под угрозу интеллектуальную собственность компаний-разработчиков и их конкурентные преимущества в производительности моделей.

Метод опирается на анализ задержек при обработке запросов и специфических ошибок, возникающих при подаче входных данных, которые выходят за рамки стандартных ограничений модели. Изучая время отклика и поведение системы при различных конфигурациях токенов, исследователи смогли с высокой точностью реконструировать внутреннюю структуру нейросети. Это создает серьезные риски для проприетарных моделей, так как раскрытие архитектурных решений позволяет конкурентам создавать более эффективные аналоги или находить уязвимости в конкретных реализациях.

Авторы подчеркивают, что текущие методы защиты, такие как ограничение доступа к API или фильтрация вывода, не предотвращают утечки на уровне метаданных инференса. Для минимизации рисков предлагается внедрение «шума» в тайминги ответов и использование техник обфускации, которые скрывают реальное время вычислений, затрачиваемое на выполнение конкретных операций внутри модели.

Ключевые факты

  • Метод позволяет восстановить количество слоев, размерность эмбеддингов и параметры внимания с точностью до 95%.
  • Анализ задержек (side-channel timing analysis) является основным вектором атаки для определения глубины и ширины нейронной сети.
  • Исследование подтверждает возможность идентификации специфических методов квантования, используемых для ускорения инференса на GPU.
  • Предложенные контрмеры включают добавление случайных задержек в API-ответы для маскировки реального времени обработки запроса.