Исследователи представили метод Gradient Immunity, направленный на защиту открытых весов LLM от злонамеренного дообучения. Технология использует проекцию градиентов в нулевое пространство, что позволяет провайдерам моделей ограничивать возможности пользователей по изменению ключевых параметров безопасности. Это решение обеспечивает защиту в сценариях, где полный контроль над процессом дообучения со стороны разработчика модели невозможен.
Основная проблема существующих методов защиты заключается в их ориентации на облачные сервисы (FTaaS), где провайдер полностью контролирует среду исполнения. В случае с открытыми моделями (open-weights) злоумышленники могут легко обойти стандартные фильтры безопасности, выполнив дообучение на специфических наборах данных. Новый подход предлагает математический барьер, который делает попытки «разблокировки» модели или изменения её этических установок вычислительно неэффективными или невозможными.
Метод работает на уровне архитектуры, внедряя ограничения в процесс обновления весов. Это позволяет сохранить функциональность модели для легитимных задач, одновременно блокируя попытки внедрения вредоносного поведения. Исследование демонстрирует, что такой подход значительно повышает устойчивость моделей к атакам типа «jailbreak» через дообучение, сохраняя при этом исходные характеристики производительности и точности ответов.
Ключевые факты
- Метод Gradient Immunity использует проекцию градиентов в нулевое пространство для предотвращения нежелательных изменений весов.
- Технология разработана специально для моделей с открытыми весами (PPOW), где провайдер не имеет прямого доступа к среде дообучения пользователя.
- Подход эффективно противодействует попыткам обхода встроенных механизмов безопасности через дообучение на вредоносных датасетах.
- Метод обеспечивает защиту без необходимости введения дополнительных процедур безопасности на стороне конечного пользователя.