Команда Alibaba представила Qwen-Image-3.0 — новую модель генерации изображений, способную создавать сложные макеты, включая инфографику и научные статьи, за один проход. Система поддерживает промпты объемом до 4500 токенов и обеспечивает высокую четкость текста размером от десяти пикселей, работая с двенадцатью языками на нативном уровне.

Ключевой особенностью модели стала способность к точной верстке. В отличие от многих аналогов, Qwen-Image-3.0 корректно обрабатывает сетки, таблицы и мелкие текстовые элементы, что позволяет генерировать полноценные страницы газет или технические документы. Это значительно расширяет возможности использования генеративных моделей в задачах, требующих высокой детализации и структурированного визуального представления данных.

Несмотря на технический прогресс, эксперты отмечают ограничение формата: на выходе пользователь получает растровое изображение, а не редактируемый файл. Это затрудняет последующую правку контента, что может стать препятствием для полноценного внедрения модели в профессиональные редакционные или дизайнерские процессы, где требуется работа с исходными слоями или векторными объектами.

Ключевые факты

  • Модель поддерживает работу с промптами длиной до 4500 токенов.
  • Реализована нативная поддержка 12 языков для генерации текста.
  • Система способна отображать читаемый текст размером от 10 пикселей.
  • Модель ориентирована на создание сложных визуальных структур: инфографики, макетов страниц и LaTeX-документов.
  • Генерация контента происходит за один проход, без необходимости пошаговой доработки.