Исследователи представили метод VAD (Visual Attribution for Distillation), решающий проблему «смешанных сигналов» при обучении мультимодальных моделей методом on-policy дистилляции. Новый подход позволяет точно определять, какие корректировки предсказаний модели основаны на реальных визуальных данных, а какие — на языковых априорных знаниях или особенностях учителя, что значительно повышает качество реконструкции объектов.
В процессе мультимодальной дистилляции ученик обучается на траекториях, генерируемых учителем с привилегированным доступом к данным. Однако текущие методы часто не могут разделить вклад визуальных признаков и текстовых закономерностей в итоговый результат. VAD вводит механизм атрибуции, который изолирует визуальные доказательства, обеспечивая более точную передачу знаний от учителя к ученику.
Применение этого метода позволяет минимизировать галлюцинации и ошибки, возникающие из-за избыточного полагания модели на лингвистические паттерны в ущерб визуальному контексту. Это критически важно для задач, требующих высокой точности реконструкции объектов на основе изображений, где визуальная достоверность является приоритетом.
Ключевые факты
- Метод VAD (Visual Attribution for Distillation) предназначен для фильтрации корректировок в процессе on-policy дистилляции.
- Технология разделяет визуальные сигналы и языковые априорные знания, предотвращая искажения при обучении.
- Подход направлен на повышение точности реконструкции объектов в мультимодальных системах.
- Исследование сфокусировано на решении проблемы «смешанных источников» при обучении моделей с учителем.