Компания Black Forest Labs анонсировала Flux 3 — новую мультимодальную модель, способную генерировать видеоролики длительностью до 20 секунд с синхронным аудиосопровождением. Разработчики позиционируют новинку как значительный шаг к созданию полноценной «мировой модели» (world model), способной понимать физические взаимодействия, что подтверждается текущими экспериментами по применению технологии в задачах робототехники.

В основе Flux 3 лежит архитектура, обучавшаяся на комплексных данных, включающих изображения, видеопотоки и аудиодорожки. В отличие от предыдущих итераций, модель обеспечивает нативную интеграцию звука, который генерируется одновременно с визуальным рядом. Это позволяет создавать более реалистичный контент без необходимости использования сторонних инструментов для наложения аудиоэффектов или фоновой музыки.

Внутренние тесты компании показывают, что производительность Flux 3 превосходит показатели модели Seedance 2.0, которая на текущий момент считается одним из лидеров рынка генеративного видео. Несмотря на отсутствие независимых бенчмарков, амбиции Black Forest Labs направлены на интеграцию модели в системы управления роботами, где понимание динамики окружающего пространства является критически важным фактором.

Ключевые факты

  • Flux 3 поддерживает генерацию видеороликов длительностью до 20 секунд с нативным звуком.
  • Модель обучалась на мультимодальных данных, объединяющих видео, изображения и аудио.
  • Black Forest Labs проводит тестирование технологии в прикладных задачах робототехники.
  • По внутренним оценкам разработчика, модель опережает по качеству генерации Seedance 2.0.