Qwen Image 2.1 目前可以下載權重自行部署,也能透過第三方託管路由呼叫;但不同服務商的端點、定價、請求格式與輸出結果都可能不同。若要把它用在正式的影像編輯流程,先分清楚「官方模型」與「第三方包裝服務」,比只看模型名稱更重要。
先用一張表看懂 API 現況
官方資料目前主要說明模型權重、程式碼與本地服務整合,沒有找到由第一方提供、公開列出單張影像價格的託管端點。官方公告與 GitHub 儲存庫介紹了 7B 視覺生成模型、Qwen3-VL 8B 編碼器、原生透明度支援,以及多參考圖編輯能力。
| 問題 | 實際答案 |
|---|---|
| 官方託管 API | 目前沒有找到清楚記載的第一方端點或單張影像價格 |
| 官方存取方式 | 模型權重、程式碼、Diffusers、ComfyUI 與服務整合 |
| 託管服務 | 已有第三方路由,但各自的服務契約不同 |
| 影像編輯 | 生成與編輯採統一流程;官方文件描述的工作流程最多支援 10 張參考圖 |
| 透明度 | 模型權重支援 RGBA,但託管路由可能改回 RGB |
| 商業使用 | 正式上線前應查看目前的 Qwen Research License |
所謂「有 API」到底代表什麼?
你可以自行託管模型權重,把本地推論包成內部 HTTP 服務,或呼叫第三方端點。但服務商使用某個模型 ID,不代表該路由就是 Qwen 官方服務。
SpicyAPI 的 Qwen Image 2.1 指南記錄了該服務的基礎文字生圖、基礎編輯、LoRA 文字生圖與 LoRA 編輯路由。文件提到 aspect_ratio 與 resolution、1k、1.5k 和 2k 三種解析度級別、最多 10 張參考圖,以及最多三個 LoRA。這些細節屬於 SpicyAPI 自己的服務契約,不能直接套用到所有 Qwen 部署方式。
建議在應用程式內部加上一層轉接器:
| 內部欄位 | 用途 |
|---|---|
prompt | 編輯指令與需要保留的內容 |
references[] | 依順序排列的影像,並標註主體或服裝等角色 |
edit_region | 圓圈、標註或獨立遮罩 |
aspect_ratio / resolution | 構圖比例與交付解析度級別 |
output_format | PNG、JPEG 或 WebP 輸出格式 |
seed | 追蹤變體,不代表能做到確定性重現 |
provider_metadata | 路由、模型 ID、請求 ID、成本與實際回傳格式 |
SpicyAPI 的指南指出,2.1 版本的 schema 會拒絕舊版 Qwen Image 2.0 的 size 欄位,而不是直接忽略它。這類欄位應該在轉接器邊界完成轉換,避免讓服務商特有的格式散落在整個應用程式裡。
適合正式環境的影像編輯流程
1. 先定義修改內容,再分配參考圖角色
先寫清楚要改什麼、哪些內容必須保留,以及什麼情況算失敗。為每張參考圖標註角色,並從最少的圖片開始;參考圖太多可能帶來互相衝突的特徵,也會增加服務商成本。
2. 先給區域提示,再檢查是否越界
官方的 Qwen 公告展示了以彩色圓圈、繪製標註與獨立遮罩進行局部編輯的方式。如果服務路由支援獨立遮罩,通常優先使用它,因為不必直接在原圖上畫提示;圓圈和塗鴉比較像方便模型理解的語意提示,並不是嚴格的像素邊界。
提示詞應同時說明目標與不可變動的內容:
「將藍色標記區域內的外套改成深綠色。移除藍色標記。保留臉部、雙手、背景、標誌與光線。」
SpicyAPI 表示,使用圓圈引導的編輯可能會影響標記範圍之外的像素。接受結果前,應把受保護區域與輸入影像逐一比對。
3. 先用 1K 草稿,再把選中的結果升到 2K
先以 1k 探索,確認方向後,只重新執行已接受的版本並輸出 2k。引用的服務路由表示,在該路由上,解析度會影響價格,而長寬比不會;不要把這項計費規則直接套用到其他服務商。
拿到輸出檔後,至少要檢查以下項目:
- MIME 類型與實際像素尺寸。
- 真正的 alpha 通道,而不只是檔名用了
.png副檔名。 - 臉部、雙手、標誌、產品文字與細小字體。
- 指定編輯區域以外的像素。
- 每張參考圖要求保留的特徵。
- 結果是否確實不同於先前已接受的版本。
模型權重支援原生 RGBA,但 SpicyAPI 表示,其路由在 PNG 請求中回傳的是三通道 RGB,並以白色作為背景。若工作流程依賴透明度,務必檢查影像通道,並實際進行疊圖測試。
4. 保留足夠資訊,才能比較哪些結果值得採用
每張已接受的影像都應一併保存正規化後的提示詞、參考圖順序、編輯素材、模型與服務商 ID、解析度、seed、請求 ID,以及回傳檔案的中繼資料。SpicyAPI 指出,seed 並不能保證產生逐像素完全相同的結果。
評測背景:品質與部署之間的取捨
在 Qwen 公布的 Qwen-Image-Bench 評測中,Qwen Image 2.1 的分數是 60.28;引用的比較裡,Nano Banana 2.0 為 59.82,GPT Image 1.5 則是 59.65。這些是 Qwen 公布的基準測試結果,不是獨立的跨服務商排名;比較適合把它當成特定測試集上的訊號,而不是宣稱它在所有情境都是贏家。
本地部署的資源需求,也比「7B」這個標籤看起來更高。完整管線包含 7B 視覺生成器、Qwen3-VL 8B 編碼器與 VAE。APIMaster 表示,BF16 權重約需 33 GB,而量化後的 ComfyUI 組合約為 14 GB;不過實際速度與硬體適配仍取決於量化方式和 offloading 設定。
哪些情況不適合用 Qwen Image 2.1 上線?
最主要的阻礙是授權。Qwen-Image-2.1 授權條款採用 Qwen Research License;發布資料也說明,商業使用需要另外取得商業授權。無論是付費 SaaS 功能、交付給客戶的專案,還是轉售推論 API,上線前都應先完成法務審查。
第二個問題是服務契約的不確定性。服務商可能不保留原生 RGBA、以不同方式實作遮罩,或調整模型 ID 與價格。評估時應計算每張「最終接受影像」的成本,同時納入 GPU 或服務商費用,以及驗證失敗所產生的重試成本。
如果本地控制、統一的編輯流程與透明素材足以抵銷部署工作和授權程序,Qwen Image 2.1 會是合理選項。若你更重視清楚的服務條款與穩定計費,而不是自行掌控整套模型堆疊,則應選擇託管式商業影像 API。
常見問題
API 能回傳透明 PNG 嗎?
模型支援原生 RGBA 生成,但託管路由可能回傳 RGB。若流程依賴透明度,使用前先檢查回傳影像的通道。
一次編輯應該使用幾張參考圖?
文件描述的工作流程最多支援 10 張。建議先使用能提供必要資訊、數量最少且角色標示清楚的參考圖。
固定 seed 能保證輸出完全一致嗎?
不能。可重現性還會受到服務商、執行環境、模型版本、scheduler 與其他設定影響。
可以把 Qwen Image 2.1 用在付費產品裡嗎?
不能直接假定可以。使用模型投入營利工作流程前,請查看目前的 Qwen Research License,並取得所需的商業授權。
正式上線前,先做出這個決定
只有在確認服務路由、授權、schema、alpha 行為、編輯區域行為,以及每張接受影像的實際成本後,才適合上線。在此之前,應把 Qwen Image 2.1 留在研究或 staging 環境,不要把第三方包裝服務當成官方 API。