AIREITER

Qwen Image 2.1 评测:本地显存、许可证与实测表现

最后更新: 2026-09-20 18:59:42

Qwen Image 2.1 已经不只是早期传闻。Qwen 于 2026 年 9 月 20 日宣布开放权重版本,眼下真正值得问的问题是:在商业使用受限的前提下,它原生支持透明图像和编辑工作流,是否值得为本地部署准备约 33 GB 的空间?

Qwen Image 2.1:先说结论

如果你想在本地完成图像生成、编辑、透明素材制作或多参考图合成,Qwen Image 2.1 值得一试。但我不会把它作为商业生产流程的默认推荐,因为目前的 Qwen Research License 仅允许非商业用途,而且它的实际内存需求远高于“7B”这个标签给人的印象。

它最适合拥有 16 GB–48 GB NVIDIA GPU、同时重视工作流控制权的创作者或开发者。对于需要立即获得商业使用权、稳定的托管吞吐量,或不想维护本地推理环境的团队来说,它就不太合适。

Qwen Image 2.1 结合本地 GPU 和参考图的透明图像工作流

2026 年 9 月 20 日发布的到底是什么

官方Qwen 公告将 Qwen Image 2.1 描述为一款开放权重、统一支持生成与编辑的模型,其中包含一个紧凑的 7B 视觉生成组件。官方代码仓库不仅展示样例图,也记录了具体实现和本地运行方式。

下面三个事实需要分开理解:

问题目前的答案为什么重要
Qwen Image 2.1 正式发布了吗?是,已经发布并以开放权重形式提供你可以直接评估真实模型,而不是围绕传闻做判断
它在广义商业语境下算“开源”吗?不要想当然地这么认为许可证才是决定能否使用的关键条件
它是一个总共 7B 的完整安装包吗?不是;7B 指的是视觉组件,此外还有独立的大型文本/视觉编码器规划显存和存储时必须按完整工作流计算

ComfyUI 已宣布 Day-0 支持,生态中也列出了 Diffusers 及相关集成。兼容性当然有帮助,但你仍然需要根据具体用途匹配工作流、权重版本、量化方案和许可证。

真正会改变工作流的功能

一个检查点,同时负责生成和编辑

Qwen Image 2.1 用同一套流程处理文生图和图像条件编辑。你可以用提示词从零创建场景,也可以提供输入图像,让模型根据指令在原有视觉上下文上进行修改。对于经常在生成与编辑之间切换的工作流来说,这比来回更换生成器和独立编辑器更方便。

它的实际优势在于一致性:同一个模型家族可以创建产品场景、修改场景,并保留指定的视觉参考。不过,这并不意味着每次编辑都能完美保留细节。早期用户仍然反馈过噪点、对比度变化,以及偶尔出现的合成感。

原生透明输出与多参考图编辑

最突出的功能是原生 RGBA 输出。Qwen 的公告和生态文档都介绍了透明图像的生成与编辑,也就是说模型可以直接输出带 Alpha 通道的图像,而不是先生成平面图片、再额外进行抠图。模型还支持最多 10 张参考图,并可通过蒙版或其他空间指令对局部区域进行编辑。

这套组合对于产品抠图、合成、包装样机、角色设定表,以及需要持续编辑的素材都很有价值。透明产品图可以直接继续修改,不必先把整个流程转换成背景移除工作流。

不过,支持透明输出不等于拥有完美抠图能力。细小边缘、头发、玻璃和半透明物体,在进入生产素材库前仍然需要人工检查。

文字、产品与分镜式内容

发布材料重点提到了更好的文字渲染、人物、产品还原、全景图、信息图和分镜式连续画面。这些都是不错的测试方向,因为它们同时考验构图、可读文字和参考一致性,不会只奖励一张好看的肖像图。

第一次评估时,可以用同一个提示词做四组测试:带精确文字的海报、基于两张参考图的产品图、带蒙版的局部编辑,以及棋盘格背景上的透明主体。相比连续生成十张互不相关的风景图,这样更容易暴露真正有用的失败模式。

16 GB 显卡能跑 Qwen Image 2.1 吗?

可以,但“能运行”和“能以原生 2K 分辨率舒适运行”是两回事。社区测试显示,16 GB 的 RTX 5070 Ti 可以运行 1024×1024 流程,峰值显存约 13.9 GB,20 步生成耗时约 25 秒。另一项 RTX 4090 测试显示,BF16 模式下常驻显存约 30.2 GB,生成 1024×1024 图像约需 21 秒,1536×1536 图像约需 56 秒。

这些都是用户实测数据,并非官方性能保证。硬件、精度、卸载策略、步数和软件版本,都可能改变最终结果。

“这是我在 NVIDIA 5070 Ti 显卡(16 GB 显存)上对 Qwen-Image-2.1 的测试。它能装下,而且速度还不错。生成一张 1024² 图像、20 步,大约需要 25 秒。”——@BenjaminDEKR,X

可以参考下面这份硬件预期:

显存实际使用预期
12 GB只有配合激进的量化或卸载才有可能运行,使用上会有明显妥协
16 GB可以现实地进行 1024×1024 测试;到了 2K,显存和速度可能明显恶化
24 GB使用更轻松,但完整精度工作流仍可能需要优化
48 GB最适合 BF16 实验和使用大量参考图的较大任务

“7B”这个标签低估了实际部署规模,因为完整流程还会用到 Qwen3-VL 文本/视觉编码器及其他组件。下载前,至少要为约 33 GB 的模型文件预留空间,并额外留出缓存、量化版本和输出文件所需的空间。

真正卡住生产落地的是许可证

技术层面的开放,并不等于可以不受限制地商业使用 Qwen Image 2.1。发布材料显示,它采用的是限制用途的研究许可证,只允许非商业使用。社区讨论也反复将这一点视为最主要的现实问题,尤其是因为此前 Qwen 的图像模型曾让用户形成更宽松的授权预期。

因此,本地测试、学术实验或个人项目,与付费产品图、客户交付物、托管服务或商业素材库,完全是不同的决策。不要因为权重可以下载,就默认生成出来的图像已经获得商业使用许可。

如果用于商业工作,应向 Qwen 确认适用的商业条款,或者选择许可证明确覆盖目标用途的模型和 API。相比上线后重建整套图像生产流程,提前做法律审查的成本要低得多。

早期测试肯定了什么,又暴露了什么

目前最积极的反馈,重点在工作流控制,而不是模型在所有画质维度上都实现了绝对领先。用户反馈称,它可以运行在消费级 GPU 上,保留透明通道,使用多张参考图,而且文字处理能力优于不少本地替代方案。另一位用户则表示,在提供多张参考图后,模型能把一张质量不佳的手机产品照片处理成更专业的产品图。

它的缺点同样需要认真看待。社区测试提到过颗粒感、偏黄或对比度过高的输出,以及修复和编辑过程中细节发生变化。目前可获得的证据也主要集中在发布初期的样例上,因此现在还不适合把任何单项基准分数当成稳定的生产排名。

Qwen-Image-Bench 论文可以提供有用背景,因为它从 56 个细粒度评价维度考察真实世界还原度和创意生成能力。不过,目前搜索结果中展示的公开 SOTA2 基准表列出的是 Qwen Image 2.0 及相邻模型,并不是对 Qwen Image 2.1 的确定性独立结论。不要拿邻近模型的分数,来证明 2.1 的表现。

Qwen Image 2.1 与托管图像 API 怎么选

核心取舍是本地控制力与运维简单性,而不是“开放模型一定胜过托管模型”。

需求更适合作为起点的方案原因
马上交付商业客户项目具备商业许可证的托管 API授权范围和吞吐量更容易界定
本地研究或离线实验Qwen Image 2.1不依赖按图计费的 API,工作流也更透明
原生 Alpha 和反复进行透明图编辑Qwen Image 2.1,前提是先测试边缘效果透明输出本来就是它设计中的工作流能力
没有 GPU 团队,却需要高吞吐生产托管 API容量、计费和可用性更简单
最大程度控制参考图和节点Qwen Image 2.1本地工具能暴露更多工作流细节

Qwen Image 2.1 的核心优势,并不是已经确定全面超越所有闭源模型,而是本地用户可以在同一个开放权重工作流中组合生成、编辑、参考图、蒙版和 Alpha 输出。如果许可证无法覆盖你的业务,这项优势就失去了意义。

Qwen Image 2.1 常见问题

Qwen Image 2.1 正式发布了吗?

是。Qwen 于 2026 年 9 月 20 日宣布开放权重模型,官方代码仓库和生态集成也提供了相应发布材料。部署下载的文件前,请确认代码仓库版本和许可证。

Qwen Image 2.1 需要多少显存?

根据社区测试,16 GB 显卡可以运行受限的 1024×1024 工作流;而 RTX 4090 的 BF16 测试约占用 30.2 GB 常驻显存。量化和卸载策略会改变结果,原生 2K 分辨率的要求则高得多。

Qwen Image 2.1 能生成透明 PNG 吗?

可以。原生 RGBA 输出是该模型的核心能力之一。但仍应检查边缘和半透明细节,不能把拥有 Alpha 通道直接等同于达到生产质量。

Qwen Image 2.1 支持多张参考图吗?

官方发布材料显示,它最多支持 10 张参考图。不过,参考图的顺序、分辨率和视觉关系仍然可能影响最终一致性。

Qwen Image 2.1 能配合 ComfyUI 使用吗?

ComfyUI 已在发布前后宣布支持。请使用维护中的工作流,以及集成所要求的准确检查点版本;随便找来的工作流 JSON 可能依赖不兼容的自定义节点或版本。

Qwen Image 2.1 可以商用吗?

不要默认可以。目前的研究许可证仅允许非商业用途,商业使用需要单独获得许可或授权。可以下载,不代表已经获得商业使用权。

Qwen Image 2.1 比 GPT Image 2 或其他托管模型更好吗?

不存在一个对所有场景都成立的赢家。Qwen 更适合本地透明图编辑和多参考图控制;对于商业部署、稳定运维,以及没有本地 GPU 基础设施的团队,托管模型依然更省事。

Qwen Image 2.1 适合照片修复吗?

在用自己的图片测试之前,应把照片修复视为较弱或尚未证实的用途。早期社区反馈提到,修复类编辑可能改变精细细节,并产生合成颗粒感。

下一步:先确认权利,再做小规模测试

如果用途是个人项目或研究,下载 Qwen Image 2.1 后,可以按四类案例进行测试:透明产品抠图、双参考图产品合成、带蒙版的局部编辑,以及文字密集型海报。同时记录显存占用、单张图耗时、失败提示词和边缘质量。

如果用途是商业项目,应先完成许可证审查,再投入时间优化 ComfyUI。Qwen Image 2.1 可能在技术上非常适合你的需求,但在商业权利得到明确之前,它仍可能不是正确的生产选择。