Компания Black Forest Labs анонсировала FLUX 3 — мультимодальную модель, объединяющую обработку изображений, видео, аудио и прогнозирование действий роботов в единой архитектуре. Это первый релиз серии FLUX, использующий общий набор весов для генерации контента разных типов и управления физическими агентами, что знаменует переход к универсальным фундаментальным моделям для кросс-модальных задач.
Разработчики подчеркивают, что использование единой архитектуры позволяет модели лучше улавливать взаимосвязи между различными типами данных. В отличие от узкоспециализированных нейросетей, FLUX 3 обучается на комплексных наборах данных, что повышает точность предсказаний в динамических средах. Такой подход упрощает интеграцию ИИ в робототехнику, где требуется мгновенная интерпретация визуальных и звуковых сигналов для принятия решений.
Технология базируется на методах потокового моделирования (flow matching), которые обеспечивают высокую скорость и качество генерации. Интеграция управления роботами в фундаментальную модель открывает новые возможности для создания автономных систем, способных взаимодействовать с физическим миром на основе мультимодального понимания контекста, а не только текстовых инструкций.
Ключевые факты
- FLUX 3 объединяет обработку изображений, видео, аудио и предсказание действий роботов в одной архитектуре.
- Модель использует единый набор весов для всех поддерживаемых модальностей.
- В основе архитектуры лежит технология потокового моделирования (flow matching).
- Релиз направлен на создание универсальных систем, способных к кросс-модальному обучению и управлению физическими объектами.
