Исследователи представили Caliber — метод защиты API моделей от атак по извлечению знаний (model extraction). Система использует механизм добавления шума в выходные данные, который калибруется для баланса между точностью ответов и стоимостью восстановления оригинальных логитов злоумышленником. Это затрудняет обучение суррогатных моделей через дистилляцию знаний, сохраняя при этом полезность сервиса для легитимных пользователей.
Основная проблема, которую решает Caliber, заключается в том, что многие API возвращают не только финальные ответы, но и вероятностные распределения (логиты). Злоумышленники используют эти данные для обучения компактных моделей-копий, которые перенимают функциональность дорогостоящих проприетарных систем. Новый подход переводит задачу защиты в плоскость калибровки шума, где каждый запрос получает уникальную «стоимость» восстановления, делая процесс кражи экономически невыгодным.
В отличие от простых методов обфускации, Caliber позволяет математически доказать сложность восстановления чистых данных. Метод адаптируется под архитектуру модели и специфику запросов, минимизируя влияние на пользовательский опыт. Это решение направлено на защиту интеллектуальной собственности компаний, предоставляющих доступ к мощным LLM через публичные интерфейсы, предотвращая несанкционированное копирование их возможностей.
Ключевые факты
- Caliber использует технику возмущения выходных данных (output-perturbation) для защиты от дистилляции знаний.
- Метод формулирует выбор шума как задачу калибровки, связывая качество защиты с затратами атакующего на восстановление логитов.
- Подход обеспечивает доказуемую стоимость восстановления для каждого конкретного запроса.
- Технология направлена на противодействие атакам, использующим скоринговые API для обучения суррогатных моделей.