Исследователи представили метод «атрибутивного разучивания» (attribute unlearning) для мультимодальных больших языковых моделей (MLLM). В отличие от традиционного удаления данных на уровне целых профилей, этот подход позволяет избирательно стирать конкретные концепции или чувствительную информацию из весов модели, сохраняя при этом её общую производительность и визуально-языковые способности без необходимости полного переобучения нейросети.

Современные мультимодальные модели часто запоминают конфиденциальные данные, что создает риски безопасности при их развертывании. Существующие методы машинного разучивания (machine unlearning) обычно работают грубо, удаляя информацию о целых объектах или пользователях. Новый подход фокусируется на «тонкой настройке» забывания, позволяя точечно исключать специфические атрибуты, такие как конкретные визуальные детали или приватные метаданные, которые модель могла усвоить в процессе обучения.

Авторы работы протестировали эффективность метода на различных сценариях, демонстрируя, что модель успешно перестает генерировать ответы, связанные с удаляемыми атрибутами, при этом сохраняя точность выполнения базовых задач. Это решение критически важно для соблюдения требований приватности и защиты авторских прав, так как позволяет компаниям оперативно реагировать на запросы об удалении данных, не тратя вычислительные ресурсы на повторное обучение моделей с нуля.

Ключевые факты

  • Метод направлен на удаление конкретных атрибутов из MLLM вместо удаления целых профилей данных.
  • Технология позволяет избежать дорогостоящего переобучения модели при необходимости удаления чувствительной информации.
  • Исследование подтверждает сохранение общей функциональности и точности модели после процесса «разучивания».
  • Подход решает проблему утечки конфиденциальных данных, которые модели непреднамеренно запоминают в процессе обучения.