Исследователи представили Video-DeepResearch (Video-DR) — мультимодальный агент, способный анализировать непрерывные видеопотоки вместо статичных изображений. Система объединяет пространственно-временное обоснование с возможностями поиска в открытом вебе. Разработка направлена на решение проблем текущих моделей, которые часто игнорируют визуальные данные в пользу текстовых запросов, ограничиваясь лишь параметрическими знаниями при выполнении сложных исследовательских задач.
Переход от анализа отдельных кадров к обработке видео требует от агентов понимания динамики событий и способности сопоставлять визуальные изменения с контекстом из внешних источников. Video-DR использует специализированные инструменты для извлечения информации из видео, что позволяет ему выполнять более глубокий анализ в сценариях, где текстового описания недостаточно для принятия решений.
Авторы проекта выявили два ключевых препятствия, ограничивающих эффективность современных мультимодальных систем. Во-первых, это «модальное смещение», при котором агент игнорирует визуальные инструменты, отдавая предпочтение текстовому поиску даже при наличии видеоконтента. Во-вторых, зависимость от ограниченных параметрических знаний, которые не позволяют модели эффективно интерпретировать новые или специфические визуальные данные без обращения к актуальным внешним базам знаний.
Ключевые факты
- Video-DeepResearch расширяет возможности агентов с обработки статических изображений до анализа непрерывных видеопотоков.
- Основной упор сделан на плотное пространственно-временное обоснование (spatiotemporal grounding) в сочетании с поиском в открытом вебе.
- Выявлена проблема «модального смещения», при которой агенты необоснованно игнорируют визуальные инструменты в пользу текста.
- Модель демонстрирует необходимость преодоления зависимости от статических параметрических знаний для повышения точности исследовательских задач.