Исследователи представили метод Credit the Right Box, решающий проблему неточности мультимодальных моделей при выполнении задач структурированного визуального восприятия. Новый подход позволяет более эффективно распределять веса обучения между конкретными объектами на изображении, устраняя разрыв между общим текстовым ответом модели и необходимостью точной локализации, сегментации и подсчета элементов в сложных визуальных сценах.
Современные мультимодальные модели (MLLM) часто сталкиваются с трудностями при связывании языка с конкретными объектами, что приводит к ошибкам в задачах, требующих высокой детализации. Стандартные методы обучения с подкреплением, основанные на групповых оценках, не позволяют модели понять, какой именно фрагмент визуальных данных привел к правильному или ошибочному результату. Предложенный алгоритм Marginal Contribution Assignment перераспределяет «кредит» за успех между отдельными объектами, что значительно улучшает качество привязки текста к визуальным координатам.
Этот метод особенно важен для задач, где критически важна точность: от автоматизированного анализа медицинских снимков до управления робототехникой. Внедрение такого подхода позволяет моделям лучше справляться с подсчетом объектов и их точным выделением, что ранее было слабым местом даже у продвинутых архитектур. Исследование демонстрирует, что гранулярный подход к обучению значительно повышает метрики точности локализации без необходимости увеличения объема обучающих данных.
Ключевые факты
- Метод Credit the Right Box направлен на решение проблемы несоответствия гранулярности при обучении MLLM.
- Алгоритм использует технику Marginal Contribution Assignment для точного распределения весов обучения между объектами.
- Решение улучшает показатели в задачах визуального распознавания, локализации, сегментации и подсчета объектов.
- Подход устраняет ограничения традиционного обучения с подкреплением, которое ранее давало лишь общую оценку ответа модели.