Qwen Image 2.1は、ダウンロード可能なモデルウェイトとして提供されているほか、複数のサードパーティー経由でも利用できます。ただし、エンドポイントや料金、スキーマ、生成結果は提供元ごとに異なります。プロダクションで画像編集に使うなら、モデル名だけで判断せず、公式提供なのかラッパー経由なのかを見極めることが重要です。
APIの結論を一覧で確認
公式資料で確認できるのは、モデルウェイトとローカル推論向けの連携方法です。画像1枚あたりの料金を公開した、ファーストパーティーのホステッドAPIは確認できませんでした。公式発表とGitHubリポジトリでは、7Bの画像生成モデル、Qwen3-VL 8Bエンコーダー、ネイティブ透過、複数画像を使った編集が説明されています。
| 疑問 | 実際のところ |
|---|---|
| 公式ホステッドAPI | 公式のエンドポイントや画像1枚あたりの料金は明確に文書化されていない |
| 公式の利用方法 | モデルウェイト、コード、Diffusers、ComfyUI、サービング連携 |
| ホスティング経由の利用 | サードパーティーのエンドポイントが存在するが、契約内容は提供元ごとに異なる |
| 画像編集 | 生成と編集を統合。文書化されたワークフローでは最大10枚の参照画像に対応 |
| 透過 | チェックポイントはRGBAに対応するが、ホスティング経由ではRGBで返る場合がある |
| 商用利用 | リリース時点のQwen Research Licenseを確認してから利用する |
「APIが使える」とは、具体的にどういうことか
モデルウェイトを自分でホストすることも、ローカル推論を社内向けのHTTPサービスでラップすることも、サードパーティーのエンドポイントを呼び出すこともできます。ただし、プロバイダー側のモデルIDがQwen公式サービスであることを意味するわけではありません。
SpicyAPIのQwen Image 2.1ガイドでは、同サービスの基本的なテキスト・トゥ・イメージ、基本編集、LoRAテキスト・トゥ・イメージ、LoRA編集の各ルートが説明されています。aspect_ratioとresolution、1k、1.5k、2kの解像度ティア、最大10枚の参照画像、最大3個のLoRAに対応するとされています。ただし、これらはSpicyAPIの契約内容であり、Qwenを使うすべての環境に共通する仕様ではありません。
アプリケーション側には直接持ち込まず、アダプターの内側に閉じ込めておきましょう。
| 内部フィールド | 用途 |
|---|---|
prompt | 編集内容と保持すべき要素の指定 |
references[] | 被写体や衣服などの役割を付けた、順序付きの画像リスト |
edit_region | 円、注釈、または別ファイルのマスク |
aspect_ratio / resolution | 構図と納品解像度の指定 |
output_format | PNG、JPEG、WebPの出力形式 |
seed | バリエーションの追跡。完全な再現を保証するものではない |
provider_metadata | ルート、モデルID、リクエストID、コスト、返却形式 |
SpicyAPIのガイドによると、2.1向けのスキーマでは、旧Qwen Image 2.0のsizeフィールドを無視せず、エラーとして拒否します。こうした差分はアダプターの境界で変換し、アプリケーション全体にプロバイダー固有のフィールドを広げないようにしましょう。
プロダクション向け画像編集ワークフロー
1. 変更内容を決め、参照画像に役割を与える
まず、何を変更するのか、何を残すのか、どの状態を失敗とみなすのかを定義します。参照画像には役割を付け、最初は必要最小限の枚数から始めてください。画像を増やしすぎると、属性同士が衝突したり、プロバイダーへのコストが増えたりします。
2. 編集範囲を示し、はみ出しを検証する
公式のQwen発表資料では、色付きの円、ペイントによる注釈、別ファイルのマスクを使ったローカル編集が紹介されています。利用するルートが対応しているなら、元画像にガイドを書き込まずに済む別マスクが扱いやすいでしょう。一方、円やペイントは便利な意味的ガイドであって、ピクセル単位の厳密な境界ではありません。
プロンプトでは、変更対象と保持すべき要素を明確に指定します。
「青いマークの内側にあるジャケットをダークグリーンに変更する。青いマークは削除する。顔、手、背景、ロゴ、ライティングは保持する。」
SpicyAPIの報告では、円で指定した編集がマークの外側のピクセルにまで影響することがあります。結果を採用する前に、保護対象の領域を入力画像と比較しましょう。
3. 1Kで試し、採用候補だけを2Kに上げる
まずは1kで試行し、内容を確定したものだけ2kで再実行します。引用したルートでは、アスペクト比は変えずに解像度を変更すると料金が変わるとされています。ただし、この課金ルールを別のプロバイダーにもそのまま適用してはいけません。
返却されたアセットは、次の項目を確認します。
- MIMEタイプとピクセル寸法。
.pngという拡張子ではなく、実際のアルファチャンネル。- 顔、手、ロゴ、商品テキスト、細かなタイポグラフィ。
- 指定した編集範囲の外側にあるピクセル。
- すべての参照画像に含まれる必要な属性。
- 直前に採用したバージョンから、意味のある差分があるかどうか。
チェックポイント自体はネイティブRGBAに対応しています。しかしSpicyAPIによると、同サービスのルートではPNGを指定しても、白背景の3チャンネルRGBが返されました。透過を前提にする前に、画像のチャンネルを検査し、実際に重ね合わせるテストを行ってください。
4. 採用結果を比較できるだけの情報を残す
採用した画像ごとに、正規化済みプロンプト、参照画像の順序、編集用アセット、モデルIDとプロバイダーID、解像度、シード、リクエストID、返却ファイルのメタデータを保存します。SpicyAPIは、シードを固定してもピクセル単位で同一の結果になるとは限らないと説明しています。
レビューの前提:品質とデプロイのトレードオフ
Qwenが公開したQwen-Image-Benchのスコアは60.28です。引用されている比較では、Nano Banana 2.0が59.82、GPT Image 1.5が59.65でした。ただし、これはQwenが実施したベンチマーク結果であり、プロバイダーを横断した独立ランキングではありません。絶対的な勝者を決める材料ではなく、テストセット上の一つの指標として扱うべきです。
ローカル環境に必要なリソースも、「7B」という数字から受ける印象より大きくなります。フルパイプラインには7Bの画像生成モデル、Qwen3-VL 8Bエンコーダー、VAEが含まれます。APIMasterの報告では、BF16ウェイトでおよそ33 GB、量子化したComfyUI構成でおよそ14 GBとされています。ただし、実際の速度やハードウェアへの適合性は、量子化方式やオフロードの設定によって変わります。
Qwen Image 2.1をプロダクションで選ぶべきでないケース
最大の障壁はライセンスです。Qwen-Image-2.1 licenseはQwen Research Licenseであり、リリース資料では商用利用に別途商用ライセンスが必要と説明されています。有料SaaS機能、クライアント向け納品物、再販する推論APIに組み込む場合は、デプロイ前に法務確認を済ませてください。
もう一つの問題は、サービス契約の不確実性です。プロバイダーによってはネイティブRGBAを維持しない、マスクの扱いが異なる、モデルIDや料金を変更するといった可能性があります。GPU費用やプロバイダー料金、検証に失敗した試行分まで含め、採用画像1枚あたりのコストを比較しましょう。
ローカル環境の制御、統合された編集機能、透過アセットが、導入作業とライセンス対応に見合うならQwen Image 2.1を選ぶ価値があります。一方、モデルスタックを自前で管理することより、文書化されたサービス条件と安定した課金を重視するなら、商用のマネージド画像APIが適しています。
FAQ
透過PNGをAPIから返せますか?
モデルはネイティブRGBA生成に対応していますが、ホスティング経由ではRGBで返る場合があります。透過を前提にする前に、返却画像のチャンネルを確認してください。
編集には参照画像を何枚使うべきですか?
文書化されたワークフローでは最大10枚に対応しています。必要な情報を含む、明確に役割付けした最小限の構成から始めましょう。
シードを固定すれば同一の出力になりますか?
なりません。再現性は、プロバイダー、実行環境、モデルのリビジョン、スケジューラー、その他の設定にも左右されます。
Qwen Image 2.1を有料プロダクトで使えますか?
自動的に利用できるわけではありません。収益が発生するワークフローに組み込む前に、現行のQwen Research Licenseを確認し、必要な商用許諾を取得してください。
出荷前に確認すべきこと
利用するルート、ライセンス、スキーマ、アルファチャンネルの挙動、編集範囲の挙動、採用画像1枚あたりのコストを検証してから出荷してください。それまでは、Qwen Image 2.1を研究またはステージング用途にとどめ、ラッパーを公式APIとして扱わないことが重要です。