Qwen-Image-3.0:有什么新变化以及如何使用

最后更新: 2026-07-21 07:22:01

在其发布示例中,Qwen-Image-3.0 一次性渲染出一张九宫格信息图:包含物理推导、群论证明、医学图示、细胞生物学对比,每个面板都填满了各自带有标注的图表和说明文字,连小号文字的每一行都依然清晰可读。这一张图最清楚地概括了第三代 Qwen 图像模型的实际用途,于 2026 年 7 月 21 日发布

Qwen-Image-3.0 official sample: a nine-panel infographic, each cell a separate complex diagram, generated as one image

*官方 Qwen-Image-3.0 示例(通过 qwen.ai)。Qwen 表示,完整网格来自单个提示词,并非由九次渲染拼接而成。*

Qwen 用一个词概括这次发布:“实”,大致可理解为 *扎实* 或 *务实*。如果说 1.0 追求的是准确性,2.0 追求的是覆盖范围,那么 3.0 面向的就是生产级工作:报纸、分镜脚本、试卷、嵌套式 UI 线框图,以及那种一眼看去就能成立的学术图表。它不再只是追求一张好看的图片,而是更关注信息密集、布局复杂的内容,并且连小字部分也要保持准确。

Qwen-Image-3.0 实际上是什么

Qwen-Image-3.0 是来自阿里巴巴 Qwen 团队的文生图基础模型,也是该系列的第三个版本;这个系列长期以来的标志性优势一直是文本渲染。Qwen 将这些版本的生成能力描述为逐步演进:1.0 是“准确”,2.0 是“准确、多样、完整、精美、真实”,而 3.0 则是“扎实”。在实践中,这意味着它瞄准的是许多图像生成器仍然容易出错的场景(整版报纸、多分镜故事板、嵌套在截图中的截图),从而让输出可以直接投入设计、教育、电商或内容工作流中使用。

最重要的三项升级

Qwen 围绕三大支柱组织发布。去掉营销包装后,每一项都能为你带来切实的价值。

丰富内容:4.5k-token 提示词和一次性复杂布局

最重要的数字是提示词长度。Qwen-Image-3.0 最多可接受4.5k tokens的输入,这比上一代大约 1k-token 的指令长度有了大幅提升。token 是模型读取的文本片段,因此更多的 tokens 意味着你可以一次性描述更密集、更结构化的场景。

Max prompt input tokens: Qwen-Image-2.0 vs 3.0

这个预算解锁了两件事。Qwen 所说的第一种是 *horizontal* 布局:上方的九宫格,每个单元格都是一张各自独立的详细信息图,而且整张图一次生成。按照 Qwen 的说法,完整描述这个网格大约用了 3.7k 个 token,这就是为什么提高上限很重要:旧限制无法容纳这条指令。

第二个是*深度*:在接口内部嵌套接口。Qwen 的示例渲染了一个 VS Code 窗口,里面包含一个 Qwen 聊天窗口,聊天窗口里又包含一个微信聊天界面,微信聊天界面里还有一张咖啡海报,每一层都保持着各自逼真的 UI。如果你的工作涉及原型图、仪表盘或分层场景,这就是值得关注的升级。

逼真的细节:依然清晰可读的小字

文本渲染一直是 Qwen 系列最强的特质,而 3.0 将下限提升到了10px 仍可读的小号文本。在示例中,这一点在困难场景下也经得起考验:一整页学术 LaTeX,带有正确的上标、下标、希腊字母和定理编号;一份在逼真纸张上的密集正文报纸;科学图版上的微小标注标签。

Qwen-Image-3.0 official sample: an English-language research plate with fine labels, scale bars, and macro-level texture

*官方 Qwen-Image-3.0 示例(通过 qwen.ai):围绕一张照片构建的分类学风格版面,带有小标签和保持清晰的 0.5mm 比例尺。*

这些示例中最突出的特点是,小字号并不会沦为噪点。说明文字、脚注和坐标轴标签在通常会出现乱码的尺寸下,仍能保持清晰可辨。细节也不只体现在文字上:Qwen 展现出接近摄影级真实感的皮肤纹理,细致到毛孔和发丝;它还能修复受损的传统水墨画,在保留原有笔触的同时补全缺失区域。

丰富的知识:12 种语言、100+ 种风格,以及联网输出

第三个支柱是广度。Qwen-Image-3.0 可原生渲染 12 种语言(演示中包括日语、韩语和西班牙语),支持100 多种艺术风格和多种字体,并能为网页、游戏和直播生成令人信服的模拟 UI。

Qwen-Image-3.0 official sample: a dense, multi-section knowledge infographic with dozens of small captions

*官方 Qwen-Image-3.0 示例(通过 qwen.ai):一张单图知识海报,包含八个部分和数十个小标签,全部清晰可读。*

有两个能力尤其突出。它能从一张真实照片构建详细的参考信息图:上面的图板在源图像上添加了分类标签、形态学标注、放大细节视图和比例尺。而且 Qwen 展示了它从网络获取实时信息的能力,在一个演示中为特定城市和日期生成了一张天气预报图表。这意味着它不再只是“画我描述的内容”,而是迈向了“画出当前真实情况”——不过,和任何生成图表一样,在依赖它们之前,你仍然需要核实事实。

它与其他文本能力强的图像模型相比如何

如果你正在为文本密集型或布局密集型工作选择模型,这些是现实可行的替代方案。下面的评分仅供参考,并非基于基准测试:Qwen 尚未公布 3.0 的任何分数,因此将任何一对一的数字当作事实都只能是猜测。

模型文本渲染复杂布局编辑如何访问
Qwen-Image-3.0非常强;10px 清晰可读,达到 LaTeX 级别非常强;4.5k-token,9 面板一键生成是(标注、修复)Qwen Studio, Qwen API
Qwen-Image-2.0良好;约 1k-token是(统一)Qwen Studio, third-party endpoints
Nano Banana Pro良好良好Google; unified API
Seedream 5 Pro良好良好ByteDance; unified API
GPT-Image-2良好良好OpenAI; unified API

当你亲自比较这些模型时,有三个测试能将一个“具备文本处理能力”的模型与一个可靠的模型区分开来:小字号在海报尺寸下是否仍然清晰可读,多面板布局是否能保持其结构而不是糊成一团,以及模型是否保留了某种语言的真实文字体系,而不是用近似形式代替。Qwen 正是围绕这三个方面构建了 3.0 版本。如果你已经通过像 AIReiter 这样的单一 API 运行 Nano Banana Pro、Seedream 5 或 GPT-Image-2,请注意,Qwen-Image-3.0 目前还不在该目录中;目前它只在 Qwen 自家的平台上提供。

今天如何试用 Qwen-Image-3.0

在发布当天,最稳妥的方式是使用 Qwen 自己的平台:

  • Qwen Studio 位于 chat.qwen.ai,支持 web、iOS、Android、macOS 和 Windows。它是在发布当天最直接访问该模型的途径;打开图像工具并在其中输入提示词即可。
  • Qwen's API platform(Qwen Cloud),用于程序化访问。
  • Hugging Face 上的 Qwen-Image model cards,提供该系列的技术细节。

要发挥 4.5k token 的优势,请编写一个明确指定结构的 prompt:逐一命名每个面板、其标题以及你希望其中包含的确切文本,而不是只用一句松散的话。可调整的骨架如下:

创建一张单一的 2x2 信息图海报,“Coffee Brew Methods”。
左上角 — “Pour Over”:3 个步骤并带有标签(冲洗滤纸、闷蒸 30 秒、画圈注水),小标题“1:16 ratio, 92°C”。
右上角 — “French Press”:带标签的示意图,标题“4 min steep, coarse grind”。
左下角 — “Espresso”:一杯浓缩咖啡的剖面图,分层标注(crema、body、heart),标题“9 bar, 25-30s”。
右下角 — “AeroPress”:编号步骤,标题“inverted method”。
统一的扁平插画风格,易读的小标题,白色背景。

布局指令越具体,你实际使用的新功能就越多。

启动日测试中的一个注意事项:7月21日,我尝试的一个第三方 qwen/text-to-image 端点(通过 Kie marketplace)在接受作业后反复返回 500 错误。这只是一个提供商的问题,并不能证明是整个平台范围的故障,但如果你今天遇到下游 Qwen 端点失败,稳妥的做法是直接前往 Qwen Studio,直到各镜像稳定下来。

我们仍然不知道什么

由于这项功能是数小时前才发布的,有些内容目前尚未公开,因此对于任何将其断言为事实的人,你都应保持怀疑:

  • 定价。 Qwen 的公告没有包含任何 API 费率卡。你今天看到的任何具体单图成本都只是猜测。
  • 开放权重。 早期的 Qwen 图像模型可供下载,但 Qwen 尚未说明 3.0 的权重是否会发布。社区一直公开讨论 Qwen 是否正在转向闭源模型,因此不要想当然地认为你现在就可以自托管 3.0。
  • 参数和基准测试。 这次发布没有附带参数数量或基准分数。外界流传的那些数字通常属于 2.0。

常见问题

Qwen Image 3 是免费的吗?

您可以通过 Qwen Studio 在 chat.qwen.ai 使用 Qwen-Image-3.0,该平台提供对 Qwen 聊天和图像工具的免费访问。Qwen 目前尚未公布 API 定价,因此用于程序化使用的付费套餐成本仍然未知。

我可以下载 Qwen-Image-3.0 吗?

尚未确认。Qwen 的发布文章并未说明 3.0 的权重是否会开放下载。先前版本可在 Hugging Face 上获取,但在 Qwen 明确说明之前,请将 3.0 视为仅限云端使用。

Qwen Image 3 与 2.0 有什么不同?

最大的变化包括:prompt 输入从大约 1k tokens 提升到 4.5k tokens、10px 小号文字也能清晰渲染、像九宫格这样的复杂布局可一次生成、支持 12 种语言的原生文本,以及联网生成。Qwen 将其定义为从“好看”迈向“实用”的转变。

Qwen Image 3 是否支持非英语文本?

是的。Qwen 表示它原生渲染 12 种语言,演示中包括日语、韩语和西班牙语,且都是以各自语言的真实文字脚本渲染,而不是近似字符。

我可以在哪里在线使用 Qwen Image 3?

Qwen Studio (chat.qwen.ai) 是官方在线入口,提供网页和移动应用。可通过 Qwen 的 API 平台进行程序化访问。