Команда Alibaba представила Qwen-Image-3.0 — новую модель генерации изображений, способную создавать сложные макеты, включая инфографику и научные статьи, за один проход. Система поддерживает промпты объемом до 4500 токенов и обеспечивает высокую четкость текста размером от десяти пикселей, работая с двенадцатью языками на нативном уровне.
Ключевой особенностью модели стала способность к точной верстке. В отличие от многих аналогов, Qwen-Image-3.0 корректно обрабатывает сетки, таблицы и мелкие текстовые элементы, что позволяет генерировать полноценные страницы газет или технические документы. Это значительно расширяет возможности использования генеративных моделей в задачах, требующих высокой детализации и структурированного визуального представления данных.
Несмотря на технический прогресс, эксперты отмечают ограничение формата: на выходе пользователь получает растровое изображение, а не редактируемый файл. Это затрудняет последующую правку контента, что может стать препятствием для полноценного внедрения модели в профессиональные редакционные или дизайнерские процессы, где требуется работа с исходными слоями или векторными объектами.
Ключевые факты
- Модель поддерживает работу с промптами длиной до 4500 токенов.
- Реализована нативная поддержка 12 языков для генерации текста.
- Система способна отображать читаемый текст размером от 10 пикселей.
- Модель ориентирована на создание сложных визуальных структур: инфографики, макетов страниц и LaTeX-документов.
- Генерация контента происходит за один проход, без необходимости пошаговой доработки.
