Microsoft расширила линейку своих генеративных моделей, выпустив MAI-Image-2.5-Pro для работы с визуальным контентом и MAI-Voice-2-Flash для высокоскоростной обработки аудио. Новые решения ориентированы на повышение качества генерации изображений и снижение задержек при распознавании и синтезе речи, что позволяет интегрировать их в real-time приложения и сложные мультимодальные системы автоматизации.
Модель MAI-Image-2.5-Pro демонстрирует улучшенную точность следования сложным промптам и повышенную детализацию при создании графики, что критично для профессиональных инструментов дизайна и маркетинговых задач. Обновление архитектуры позволило сократить количество артефактов и улучшить композиционную связность изображений, делая модель более пригодной для создания контента корпоративного уровня.
В свою очередь, MAI-Voice-2-Flash оптимизирована для сценариев, требующих мгновенного отклика, таких как голосовые ассистенты и интерактивные системы поддержки клиентов. Модель показывает значительный прирост в скорости инференса при сохранении высокой разборчивости речи, что снижает нагрузку на вычислительные ресурсы при развертывании в облачных или гибридных инфраструктурах.
Ключевые факты
- MAI-Image-2.5-Pro обеспечивает повышенную точность соблюдения инструкций и детализацию визуальных объектов.
- MAI-Voice-2-Flash ориентирована на минимизацию задержек (latency) в задачах обработки аудио в реальном времени.
- Новые модели предназначены для интеграции в мультимодальные бизнес-приложения и системы автоматизации.
- Релиз направлен на оптимизацию производительности и качества генерации в рамках экосистемы инструментов Microsoft AI.