Исследователи представили новый метод атаки Hollow-LLM, который позволяет обходить механизмы верификации ИИ-моделей с использованием доказательств с нулевым разглашением (zk-SNARKs). Злоумышленники внедряют «призрачные веса» в архитектуру модели, которые остаются скрытыми при проверке целостности, но активируются во время инференса, заставляя систему выдавать вредоносные или искаженные ответы, сохраняя при этом валидность криптографического доказательства.

Проблема заключается в фундаментальном разрыве между тем, как модель доказывает свою структуру, и тем, как она исполняет вычисления. В текущих схемах верификации zk-LLM проверяется соответствие весов модели заявленному хешу, однако атакующие научились создавать такие конфигурации, где «пустые» или фиктивные веса не влияют на процесс генерации доказательства, но подменяют логику работы нейросети в рантайме. Это ставит под угрозу доверие к облачным ИИ-сервисам, которые используют криптографические методы для подтверждения того, что пользователь взаимодействует именно с той моделью, за которую платит.

Данная уязвимость критична для сценариев, где требуется строгая гарантия того, что модель не была подменена или модифицирована после обучения. Атака демонстрирует, что даже математически строгие методы верификации могут быть скомпрометированы, если они не учитывают динамические аспекты исполнения весов в глубоких нейронных сетях. Разработчикам систем безопасности придется пересмотреть подходы к проверке целостности моделей, чтобы исключить возможность внедрения подобных «призрачных» компонентов.

Ключевые факты

  • Атака Hollow-LLM эксплуатирует уязвимости в схемах zk-SNARKs, используемых для подтверждения подлинности весов LLM.
  • Метод позволяет внедрять скрытые параметры, которые не обнаруживаются стандартными алгоритмами проверки целостности модели.
  • «Призрачные веса» активируются только в процессе инференса, позволяя модели выполнять действия, не соответствующие её официальной спецификации.
  • Исследование подчеркивает необходимость разработки более устойчивых протоколов верификации, учитывающих не только статические веса, но и логику исполнения нейронных сетей.