Компания xAI анонсировала выход Grok-1.5 Vision — мультимодальной модели, способной обрабатывать и генерировать видеоконтент. Новая архитектура расширяет возможности текущей линейки Grok, позволяя системе анализировать визуальные данные в реальном времени и создавать видеоролики на основе текстовых запросов пользователей. Релиз направлен на усиление конкуренции в сегменте генеративного видео и глубокую интеграцию мультимодальности в экосистему платформы X.
Модель демонстрирует улучшенные показатели в понимании физических свойств объектов и пространственных отношений в видеоряде. Разработчики сфокусировались на повышении связности кадров и качестве визуальной генерации, что позволяет создавать более реалистичные сцены по сравнению с предыдущими итерациями. Интеграция модели в платформу X (ранее Twitter) позволит пользователям создавать контент непосредственно внутри социальной сети.
Технологический стек Grok-1.5 Vision опирается на оптимизированные методы обработки визуальных токенов, что сокращает время инференса при работе с тяжелыми видеофайлами. Это обновление является частью стратегии xAI по созданию универсального ИИ-ассистента, способного работать с текстом, кодом, изображениями и видео в едином интерфейсе.
Ключевые факты
- Модель Grok-1.5 Vision поддерживает обработку и генерацию видео на основе текстовых промптов.
- Архитектура обеспечивает улучшенное понимание физики объектов и пространственной логики в динамических сценах.
- Интеграция реализована в рамках платформы X, принадлежащей Илону Маску.
- Обновление направлено на расширение мультимодальных возможностей ИИ-ассистента Grok.