Исследователи выявили критическую проблему в современных видео-языковых моделях (VLM): неспособность точно отслеживать частоту и последовательность событий. Модели часто попадают в «ловушку низких частот», полагаясь на статистические закономерности вместо реального анализа видеоряда. Новый метод оценки, использующий трассировку событий, позволяет выявлять эти ошибки, которые скрыты в стандартных бенчмарках из-за их сложности и отсутствия контроля над параметрами.

Существующие наборы данных для оценки видеомоделей часто смешивают такие характеристики, как длительность, визуальная сложность и количество событий, что затрудняет диагностику конкретных сбоев. Авторы работы предлагают подход, основанный на параметрических видео, где каждое событие имеет четкую «исполняемую» истину (ground truth). Это позволяет проверять не только финальный ответ модели, но и процесс логического вывода при подсчете объектов или действий.

Результаты показывают, что даже продвинутые модели демонстрируют значительные провалы в задачах на «бухгалтерию событий». Ошибки возникают из-за того, что модели склонны игнорировать редкие или быстро сменяющиеся события, отдавая предпочтение наиболее вероятным сценариям, заложенным в их обучающей выборке. Новый бенчмарк помогает изолировать эти недостатки, предоставляя разработчикам инструмент для более точной настройки механизмов внимания и временной обработки данных.

Ключевые факты

  • Исследование выявило, что VLM систематически ошибаются в подсчете событий из-за зависимости от частотных характеристик обучающих данных.
  • Предложен новый метод оценки «trace-grounded parametric benchmarks», который позволяет отслеживать точность модели на каждом этапе обработки видео.
  • Стандартные бенчмарки признаны недостаточно эффективными, так как они оценивают только итоговый результат, игнорируя логику распознавания отдельных событий.
  • Метод позволяет изолировать влияние таких факторов, как темп событий, их длительность и визуальная сложность, на итоговую ошибку модели.