Исследователи представили метод Multimodal Model Diffing, позволяющий выявлять и контролировать конкретные внутренние признаки в мультимодальных LLM. В отличие от традиционных разреженных автокодировщиков (SAE), которые анализируют скрытые состояния постфактум, новый подход изолирует изменения в признаках, вызванные мультимодальными стимулами, обеспечивая более точную интерпретацию того, как именно модель обрабатывает визуальные и текстовые данные.
Основная проблема существующих методов интерпретируемости заключается в сложности отделения визуальных признаков от текстовых внутри единого латентного пространства модели. Авторы работы предлагают механизм «диффинга», который сравнивает активации модели при различных модальных воздействиях. Это позволяет исследователям локализовать конкретные нейронные пути, отвечающие за распознавание объектов или интерпретацию изображений, и эффективно управлять ими без нарушения общей логики работы нейросети.
Технология открывает возможности для более глубокого аудита моделей, склонных к галлюцинациям при анализе изображений. Вместо того чтобы полагаться на «черный ящик», разработчики получают инструмент для точечной настройки поведения модели, что критически важно для систем, требующих высокой точности в задачах компьютерного зрения и мультимодального анализа.
Ключевые факты
- Метод Multimodal Model Diffing позволяет изолировать специфические признаки, активируемые визуальными данными.
- Подход решает проблему нечеткой интерпретации скрытых состояний, возникающую при использовании стандартных разреженных автокодировщиков.
- Технология обеспечивает прямой контроль над внутренними представлениями модели, что позволяет корректировать её реакцию на конкретные визуальные стимулы.
- Метод направлен на повышение прозрачности и управляемости мультимодальных больших языковых моделей (MLLM).