Китайский разработчик MiniMax выпустил модель H3 — универсальное мультимодальное решение, способное генерировать 15-секундные видеоролики в разрешении 2K с нативным стереозвуком. В отличие от узкоспециализированных инструментов, H3 обрабатывает текст, изображения, видео и аудио как единый контекст, что позволяет создавать видеоряд, синхронизированный с аудиодорожкой на уровне архитектуры модели.
Разработчики подчеркивают, что H3 не является классическим «text-to-video» генератором с наложенными эффектами. Модель обучалась на принципах омнимадальности, где аудио и визуальные данные интегрированы в процесс предсказания следующего токена. Это обеспечивает высокую когерентность между действиями в кадре и звуковым сопровождением, что критически важно для создания реалистичного контента.
Технология ориентирована на профессиональное использование, предлагая пользователям гибкость в настройке длительности клипов. Благодаря нативной поддержке стереозвука, отпадает необходимость в сторонних инструментах для пост-обработки звука, что значительно ускоряет пайплайн производства коротких видеороликов для маркетинга и медиа-индустрии.
Ключевые факты
- Модель генерирует видеоролики длительностью от 4 до 15 секунд.
- Максимальное разрешение выходного контента составляет 2K.
- Система поддерживает нативную генерацию стереозвука, синхронизированного с видеорядом.
- Входные данные включают комбинацию текста, изображений, видео и аудио в едином контексте.
- H3 позиционируется как универсальная мультимодальная модель, а не надстройка над существующими видео-генераторами.
