Qwen-Image-3.0: Что нового и как использовать

Последнее обновление: 2026-07-21 07:22:28

В примерах запуска Qwen-Image-3.0 одним проходом создаёт девятипанельную инфографику: вывод в физике, доказательство из теории групп, медицинскую схему, сравнение в клеточной биологии — в каждой панели свои подписанные диаграммы и подписи, и даже каждая строка мелкого текста остаётся читаемой. Это изображение — самое наглядное краткое описание того, для чего на самом деле предназначена модель изображения Qwen третьего поколения, выпущенная 21 июля 2026 года.

Qwen-Image-3.0 official sample: a nine-panel infographic, each cell a separate complex diagram, generated as one image

*Официальный пример Qwen-Image-3.0 (через qwen.ai). Qwen говорит, что вся сетка была получена из одного промпта, а не собрана из девяти рендеров.*

Qwen подводит итог релиза одним словом: «实», примерно *основательный* или *практичный*. Если 1.0 стремилась к точности, а 2.0 — к широте возможностей, то 3.0 нацелена на производственную работу: газеты, сториборды, экзаменационные материалы, многоуровневые UI-макеты и академические иллюстрации, которые выглядят цельно с первого взгляда. Речь уже не об одной красивой картинке, а о плотных, насыщенных информацией макетах, которые остаются корректными вплоть до самого мелкого текста.

Что такое Qwen-Image-3.0 на самом деле

Qwen-Image-3.0 — это foundation model text-to-image от команды Qwen компании Alibaba, третья модель в серии, чьей фирменной сильной стороной долгое время было отображение текста. Qwen описывает поколения как последовательное развитие: 1.0 была «точной», 2.0 — «точной, разнообразной, полной, красивой, реалистичной», а 3.0 — «содержательной». На практике это означает, что она нацелена на сцены, с которыми многие генераторы изображений всё ещё справляются плохо (целая газетная полоса, многорамочный сториборд, скриншот внутри скриншота), чтобы результат можно было сразу использовать в рабочих процессах дизайна, образования, e-commerce или контент-создания.

Три обновления, которые имеют значение

Qwen выстраивает выпуск вокруг трех столпов. Если отбросить маркетинг, каждый из них дает вам что-то конкретное.

Насыщенный контент: промпты на 4,5 тыс. токенов и сложные макеты в режиме one-shot

Главный показатель — длина промпта. Qwen-Image-3.0 принимает до 4.5k tokens входных данных, что значительно больше примерно 1k-token длины инструкции, с которой справлялось предыдущее поколение. Токен — это фрагмент текста, который читает модель, поэтому большее число токенов означает, что вы можете описать более плотную и структурированную сцену за один раз.

Max prompt input tokens: Qwen-Image-2.0 vs 3.0

Этот бюджет открывает две возможности. Первая — то, что Qwen называет *горизонтальной* компоновкой: девятипанельная сетка выше, где каждая ячейка — это отдельная детализированная инфографика, а всё изображение генерируется за один проход. По словам Qwen, полное описание этой сетки заняло около 3,7 тыс. токенов, и именно поэтому повышение лимита имеет значение: старый предел не мог вместить инструкцию.

Второй — это *глубина*: вложение интерфейсов в интерфейсы. В примере Qwen отображается окно VS Code, содержащее окно чата Qwen, содержащее чат WeChat, содержащий постер с кофе, и каждый слой сохраняет свой собственный реалистичный интерфейс. Если ваша работа связана с макетами, дашбордами или многослойными сценами, это то улучшение, за которым стоит следить.

Реалистичная детализация: мелкий текст, который остаётся разборчивым

Отрисовка текста долгое время была сильнейшей стороной серии Qwen, а 3.0 опускает нижнюю планку до 10px мелкого текста, который остаётся читаемым. В примерах это выдерживается и в сложных случаях: целая страница академического LaTeX с корректными верхними и нижними индексами, греческими буквами и нумерацией теорем; газета с плотным основным текстом на реалистичной бумаге; крошечные подписи-аннотации на научной иллюстрации.

Qwen-Image-3.0 official sample: an English-language research plate with fine labels, scale bars, and macro-level texture

*Официальный пример Qwen-Image-3.0 (через qwen.ai): пластина в стиле таксономии, построенная вокруг фотографии, с небольшими подписями и шкалами 0.5mm, которые остаются резкими.*

Главное во всех этих примерах — мелкий шрифт не превращается в шум. Подписи, сноски и метки осей сохраняют свою форму при размерах, на которых обычно текст становится нечитаемым. Детализация выходит за рамки текста: Qwen показывает текстуру кожи на уровне пор и волос, близкую к фотографическому реализму, а также редактирование, которое восстанавливает повреждённую традиционную тушевую живопись, заполняя утраченные области и сохраняя при этом оригинальную манеру мазка.

Богатые знания: 12 языков, 100+ стилей и вывод с подключением к вебу

Третий столп — это широта. Qwen-Image-3.0 изначально рендерит 12 языков (в демо представлены японский, корейский и испанский), поддерживает 100+ художественных стилей и несколько шрифтов, а также создаёт убедительные имитации интерфейсов для веба, игр и прямых трансляций.

Qwen-Image-3.0 official sample: a dense, multi-section knowledge infographic with dozens of small captions

*Официальный пример Qwen-Image-3.0 (через qwen.ai): одностраничный постер с знаниями по одному изображению с восемью разделами и десятками мелких подписей, все разборчиво.*

Две возможности особенно выделялись. Он создаёт подробные справочные инфографики на основе реальной фотографии: на изображение выше добавляются таксономические подписи, выноски с морфологическими особенностями, увеличенный фрагмент и масштабная линейка. А Qwen демонстрирует получение актуальной информации из веба, создавая в одном демо графику прогноза погоды для конкретного города и даты. Это выходит за рамки «нарисуй то, что я описываю» и приближается к «нарисуй то, что актуально» — хотя, как и с любым сгенерированным изображением, перед использованием всё равно стоит проверить факты.

Как он сравнивается с другими моделями для генерации изображений с сильной текстовой составляющей

Если вы выбираете модель для задач с большим объёмом текста или сложной версткой, вот реалистичные альтернативы. Оценки ниже носят ориентировочный характер, а не основаны на бенчмарках: Qwen не публиковала никаких результатов для 3.0, поэтому воспринимать любые прямые сравнения как факт означало бы гадать.

МодельРендеринг текстаСложные макетыРедактированиеКак получить доступ
Qwen-Image-3.0Очень сильный; разборчиво при 10px, уровня LaTeXОчень сильный; 4.5k-token, 9-панельный one-shotДа (аннотации, восстановление)Qwen Studio, Qwen API
Qwen-Image-2.0СильныйХороший; ~1k-tokenДа (унифицированное)Qwen Studio, сторонние endpoints
Nano Banana ProХорошийХорошийДаGoogle; unified API
Seedream 5 ProХорошийХорошийДаByteDance; unified API
GPT-Image-2ХорошийХорошийДаOpenAI; unified API

Когда вы сравниваете эти модели самостоятельно, три теста отделяют модель, «умеющую работать с текстом», от надежной: остается ли мелкий шрифт разборчивым при масштабировании до формата постера, сохраняют ли многопанельные макеты свою структуру вместо того, чтобы сливаться в одно размытое пятно, и сохраняет ли модель настоящий алфавит языка, а не лишь его приблизительное подобие. Qwen построила релиз 3.0 именно вокруг этих трех критериев. Если вы уже используете Nano Banana Pro, Seedream 5 или GPT-Image-2 через единый API, такой как AIReiter, имейте в виду, что Qwen-Image-3.0 пока не входит в этот каталог; на данный момент он доступен только на собственной платформе Qwen.

Как попробовать Qwen-Image-3.0 уже сегодня

В день запуска надежнее всего использовать собственную платформу Qwen:

  • Qwen Studio на chat.qwen.ai, в web, iOS, Android, macOS и Windows. Это самый прямой путь к модели в день запуска; откройте инструмент для работы с изображениями и задайте запрос там.
  • Платформа API Qwen (Qwen Cloud) для программного доступа.
  • Карточки модели Qwen-Image на Hugging Face для технических подробностей семейства.

Чтобы использовать сильную сторону 4.5k-token, напишите промпт, который явно задаёт структуру: назовите каждую панель, её заголовок и точный текст, который вы хотите видеть внутри, а не одну расплывчатую фразу. Шаблон для адаптации:

Создайте один инфографический постер 2x2, "Способы приготовления кофе".
Верхний левый — "Pour Over": 3 шага с подписями (промойте фильтр, bloom 30s, лейте по кругу), маленькая подпись "1:16 ratio, 92°C".
Верхний правый — "French Press": подписанная схема, подпись "4 min steep, coarse grind".
Нижний левый — "Espresso": поперечный разрез порции с подписями слоёв (crema, body, heart), подпись "9 bar, 25-30s".
Нижний правый — "AeroPress": нумерованные шаги, подпись "inverted method".
Единый стиль плоской иллюстрации, разборчивые маленькие подписи, белый фон.

Чем конкретнее инструкция по компоновке, тем больше новой возможности вы действительно используете.

Одно замечание по итогам тестирования в день запуска: 21 июля сторонняя конечная точка qwen/text-to-image, которую я попробовал (через маркетплейс Kie), после принятия задания несколько раз возвращала ошибки 500. Это один провайдер, а не доказательство сбоя на всей платформе, но если сегодня у вас не работает downstream Qwen endpoint, безопаснее перейти напрямую в Qwen Studio, пока зеркала не стабилизируются.

Что мы до сих пор не знаем

Поскольку это было запущено всего несколько часов назад, некоторые вещи пока не являются публичными, и вам следует скептически относиться к любому, кто утверждает их как факт:

  • Цены. В анонсе Qwen нет тарифной сетки API. Любая конкретная стоимость за изображение, которую вы видите сегодня, — это лишь предположение.
  • Открытые веса. Ранее модели Qwen для изображений можно было скачать, но Qwen не сообщала, будут ли опубликованы веса версии 3.0. Сообщество открыто обсуждало, движется ли Qwen к закрытым моделям, так что пока не стоит считать, что вы сможете развернуть 3.0 у себя.
  • Параметры и бенчмарки. Этот релиз не сопровождался ни числом параметров, ни результатами бенчмарков. Цифры, которые сейчас ходят, обычно относятся к 2.0.

Часто задаваемые вопросы

Бесплатен ли Qwen Image 3?

Вы можете использовать Qwen-Image-3.0 через Qwen Studio на chat.qwen.ai, который предоставляет бесплатный доступ к чат- и image-инструментам Qwen. Qwen пока не опубликовал цены на API, поэтому стоимость платного уровня для программного использования пока неизвестна.

Могу ли я скачать Qwen-Image-3.0?

Не подтверждено. В публикации о запуске Qwen не указано, будут ли веса версии 3.0 доступны для загрузки. Предыдущие версии были доступны на Hugging Face, но считайте 3.0 доступной только в облаке, пока Qwen не сообщит иное.

Чем Qwen Image 3 отличается от 2.0?

Самые большие изменения — это увеличение входного промпта примерно с 1k до 4.5k токенов, разборчивый рендеринг мелкого текста 10px, сложные макеты за один проход, например девятипанельная сетка, нативный текст на 12 языках и генерация с подключением к вебу. Qwen описывает это как переход от «красиво выглядящего» к «полезному».

Обрабатывает ли Qwen Image 3 текст не на английском языке?

Да. Qwen говорит, что он изначально отображает 12 языков, а в демонстрациях представлены японский, корейский и испанский, отображённые на каждом языке в его собственной письменности, а не приближёнными символами.

Где я могу использовать Qwen Image 3 онлайн?

Qwen Studio (chat.qwen.ai) — это официальный онлайн-канал с веб- и мобильными приложениями. Программный доступ доступен через API-платформу Qwen.