Исследователи представили метод Credit Assignment для дистилляции мультимодальных моделей, решающий проблему неоднозначности при обучении. Новый подход позволяет точно определять, на каком этапе произошла ошибка — при визуальном восприятии данных или в процессе логического вывода. Это повышает эффективность обучения моделей, разделяя ответственность за неудачи между модулем зрения и когнитивным блоком.

Традиционные методы дистилляции на основе вознаграждения за итоговый ответ часто не могут выявить истинную причину провала. Если модель ошибается, сложно понять, не увидела ли она важную деталь на изображении или неверно интерпретировала её. Предложенный алгоритм Perception Success Rate (PSR) позволяет изолировать ошибки восприятия, что дает возможность точечно корректировать обучение компонентов модели, не затрагивая при этом корректные логические цепочки.

Такой подход значительно улучшает качество обучения моделей, работающих с визуально-языковыми задачами. Вместо того чтобы штрафовать всю модель за неверный ответ, система теперь может «понять», что именно нужно улучшить: способность распознавать объекты или навыки рассуждения. Это снижает шум при обучении и позволяет быстрее достигать высокой точности в сложных мультимодальных сценариях.

Ключевые факты

  • Метод направлен на решение проблемы распределения ответственности (credit assignment) в мультимодальных системах.
  • Алгоритм разделяет ошибки на две категории: дефекты визуального восприятия и ошибки в логических рассуждениях.
  • Использование предложенного метода позволяет избежать смешивания факторов при оценке успешности выполнения задачи.
  • Техника ориентирована на улучшение процесса on-policy дистилляции, обеспечивая более плотное и точное обучение моделей.