Исследователи представили Sci-VBench — специализированный бенчмарк для оценки качества генерации видео в научных дисциплинах. Набор данных включает 1 253 примера, требующих от моделей глубоких знаний и логических рассуждений. Инструмент охватывает 60 предметных областей, включая медицину, инженерию и естественные науки, проверяя способность ИИ создавать визуально и фактологически точный контент для сложных академических задач.
Современные модели генерации видео часто демонстрируют впечатляющие визуальные эффекты, но испытывают трудности с передачей точных научных процессов, требующих строгой временной последовательности и соблюдения физических законов. Sci-VBench фокусируется на устранении этого пробела, предлагая экспертно размеченные данные, которые заставляют модели не просто имитировать движение, а демонстрировать понимание предметной области.
Бенчмарк разделен на четыре ключевых блока: естественные науки, здравоохранение, гуманитарные дисциплины и инженерия. Для каждого примера модель должна сгенерировать видеоряд, который соответствует научным стандартам и логике описываемого процесса. Это позволяет разработчикам точнее определять границы возможностей генеративных систем при работе со сложным специализированным контентом, где цена ошибки или галлюцинации критически высока.
Ключевые факты
- Общий объем датасета составляет 1 253 примера, размеченных экспертами в соответствующих областях.
- В бенчмарк включено 60 различных дисциплин, охватывающих четыре фундаментальных направления науки.
- Основной упор сделан на проверку способности моделей к логическому обоснованию и передаче сложных временных процессов.
- Sci-VBench предназначен для тестирования генеративных моделей на соответствие строгим научным требованиям и фактологическую точность.