Компания Black Forest Labs анонсировала Flux 3 — новую мультимодальную модель, способную генерировать видеоролики длительностью до 20 секунд с синхронным аудиосопровождением. Разработчики позиционируют новинку как значительный шаг к созданию полноценной «мировой модели» (world model), способной понимать физические взаимодействия, что подтверждается текущими экспериментами по применению технологии в задачах робототехники.
В основе Flux 3 лежит архитектура, обучавшаяся на комплексных данных, включающих изображения, видеопотоки и аудиодорожки. В отличие от предыдущих итераций, модель обеспечивает нативную интеграцию звука, который генерируется одновременно с визуальным рядом. Это позволяет создавать более реалистичный контент без необходимости использования сторонних инструментов для наложения аудиоэффектов или фоновой музыки.
Внутренние тесты компании показывают, что производительность Flux 3 превосходит показатели модели Seedance 2.0, которая на текущий момент считается одним из лидеров рынка генеративного видео. Несмотря на отсутствие независимых бенчмарков, амбиции Black Forest Labs направлены на интеграцию модели в системы управления роботами, где понимание динамики окружающего пространства является критически важным фактором.
Ключевые факты
- Flux 3 поддерживает генерацию видеороликов длительностью до 20 секунд с нативным звуком.
- Модель обучалась на мультимодальных данных, объединяющих видео, изображения и аудио.
- Black Forest Labs проводит тестирование технологии в прикладных задачах робототехники.
- По внутренним оценкам разработчика, модель опережает по качеству генерации Seedance 2.0.
