Компания Black Forest Labs анонсировала Flux 3 — новую мультимодальную модель, объединяющую возможности генерации изображений, видео и аудио с функцией предсказания действий. Архитектура системы направлена на создание консистентного контента в различных медиаформатах, что позволяет модели не только визуализировать объекты, но и прогнозировать их поведение в динамических сценах.

Разработка Flux 3 знаменует переход от узкоспециализированных генераторов к универсальным моделям, способным обрабатывать сложные кросс-модальные задачи. Интеграция функции предсказания действий (Action-Prediction) открывает возможности для более точного управления движением в видео и создания интерактивных сред, где ИИ учитывает физические свойства и логику взаимодействия объектов в кадре.

Новый подход к архитектуре позволяет модели лучше понимать контекст запросов, обеспечивая высокую точность следования инструкциям при работе с видеорядом и аудиосопровождением. Это решение ориентировано на профессиональные задачи по созданию контента, требующие глубокой синхронизации между визуальными эффектами и звуковым рядом, а также предсказуемого поведения объектов в сгенерированных сценах.

Ключевые факты

  • Flux 3 поддерживает одновременную обработку изображений, видео, аудио и предсказание действий.
  • Модель использует единую архитектуру для всех типов медиа, что повышает консистентность генерации.
  • Функция Action-Prediction позволяет модели моделировать физические взаимодействия и предсказывать развитие событий в видео.
  • Разработчик модели — компания Black Forest Labs, известная своими достижениями в области открытых генеративных моделей.