Исследователи представили метод VAD (Visual Attribution for Distillation), решающий проблему «смешанных сигналов» при обучении мультимодальных моделей методом on-policy дистилляции. Новый подход позволяет точно определять, какие корректировки предсказаний модели основаны на реальных визуальных данных, а какие — на языковых априорных знаниях или особенностях учителя, что значительно повышает качество реконструкции объектов.

В процессе мультимодальной дистилляции ученик обучается на траекториях, генерируемых учителем с привилегированным доступом к данным. Однако текущие методы часто не могут разделить вклад визуальных признаков и текстовых закономерностей в итоговый результат. VAD вводит механизм атрибуции, который изолирует визуальные доказательства, обеспечивая более точную передачу знаний от учителя к ученику.

Применение этого метода позволяет минимизировать галлюцинации и ошибки, возникающие из-за избыточного полагания модели на лингвистические паттерны в ущерб визуальному контексту. Это критически важно для задач, требующих высокой точности реконструкции объектов на основе изображений, где визуальная достоверность является приоритетом.

Ключевые факты

  • Метод VAD (Visual Attribution for Distillation) предназначен для фильтрации корректировок в процессе on-policy дистилляции.
  • Технология разделяет визуальные сигналы и языковые априорные знания, предотвращая искажения при обучении.
  • Подход направлен на повышение точности реконструкции объектов в мультимодальных системах.
  • Исследование сфокусировано на решении проблемы «смешанных источников» при обучении моделей с учителем.