Qwen Image 2.1は、もはや早期アクセス版のうわさではない。Qwenは2026年9月20日、オープンウェイトモデルとして正式にリリースした。いま問うべきなのは、モデルが存在するかどうかではない。ネイティブの透明出力や編集機能のために、商用利用が制限される約33 GBのローカル環境を用意する価値があるかどうかだ。
Qwen Image 2.1の結論:試す価値はあるが、商用利用には注意
画像生成、編集、透明素材、複数リファレンスを使った合成をローカルで行いたいなら、Qwen Image 2.1は試す価値がある。ただし、商用の本番パイプラインに無条件でおすすめできるモデルではない。現在のQwen Research Licenseは非商用であり、「7B」という数字から想像するよりも多くのメモリを必要とするためだ。
相性がいいのは、ワークフローを自分で管理したいクリエイターや開発者、そして16 GB~48 GBのNVIDIA GPUを持つ人だ。一方、すぐに使える商用権、安定したホスティング性能、ローカル推論の面倒を見ずに一定以上の画質を得たいチームには向いていない。
2026年9月20日に実際にリリースされたもの
公式のQwenの発表では、Qwen Image 2.1を、7Bの視覚生成コンポーネントを備えたオープンウェイトの統合型生成・編集モデルとして説明している。公式リポジトリには、サンプル画像だけでなく実装やローカル環境での使い方も記載されている。
ここでは、次の3点を混同しないことが重要だ。
| 確認したいこと | 現時点での答え | 重要な理由 |
|---|---|---|
| Qwen Image 2.1は正式リリース済みか | はい。オープンウェイトとして発表・配布されている | うわさではなく実際のモデルを評価できる |
| 広い意味での「オープンソース」なのか | そう決めつけないほうがいい | 利用条件を左右するのはライセンスだから |
| インストール全体が7Bなのか | 違う。7Bなのは視覚コンポーネントで、別途、大規模なテキスト・ビジョンエンコーダーも必要 | VRAMとストレージはパイプライン全体で見積もる必要がある |
ComfyUIはDay-0対応を発表しており、エコシステムにはDiffusersなどの連携も含まれている。ただし、対応しているからといって、ワークフロー、チェックポイントのリビジョン、量子化方式、ライセンスを用途に合わせて確認する必要がなくなるわけではない。
ワークフローを変える3つの特徴
生成と編集を1つのチェックポイントで処理
Qwen Image 2.1は、テキストからの画像生成と、画像を条件にした編集を1つのパイプラインで扱う。プロンプトだけで新しいシーンを作ることもできるし、入力画像を視覚的な基準にして、指示どおりの変更を加えることも可能だ。生成と編集を行き来する作業では、生成モデルと編集モデルを切り替えるより扱いやすい。
実務上のメリットは、ワークフロー全体の一貫性にある。同じモデルファミリーで商品シーンを作成し、そのシーンを修正し、指定したビジュアルリファレンスを維持できる。ただし、細部が毎回きれいに保たれるわけではない。初期ユーザーからは、ノイズ、コントラストの変化、合成感の強い仕上がりも報告されている。
ネイティブの透明出力と複数リファレンス編集
最大の特徴は、ネイティブなRGBA出力だ。Qwenの発表やエコシステムのドキュメントによれば、背景を後から切り抜くのではなく、アルファチャンネルを持つ透明画像を直接生成・編集できる。最大10枚のリファレンス画像にも対応し、マスクなどの空間的な指示を使って局所編集も行える。
この組み合わせは、商品切り抜き、合成、パッケージのモックアップ、キャラクターシート、後から編集しやすい素材の作成で特に役立つ。透明な商品画像を修正する際も、まず背景除去の工程に変換する必要がない。
ただし、これは完璧なマッティングを意味しない。細い輪郭、髪の毛、ガラス、半透明のオブジェクトは、制作素材のライブラリに入れる前に必ず確認したい。
文字入り画像、商品写真、絵コンテ風の制作
リリース資料では、文字の描画、人、商品の再現性、パノラマ、インフォグラフィック、絵コンテ風の連続画像が改善点として強調されている。これらは、単に魅力的なポートレートを1枚出すよりも、構図、読みやすい文字、リファレンスの一貫性をまとめて検証できるテスト対象だ。
最初の評価では、1つのプロンプトを4パターンで試すといい。正確な文字を入れたポスター、2枚のリファレンスから作る商品画像、マスクを使った局所編集、チェッカーボード背景に置いた透明な被写体だ。関係のない風景を10枚生成するより、実用的な失敗パターンを把握しやすい。
16 GBのGPUでQwen Image 2.1は動くのか
動かすことはできる。ただし、「動く」と「ネイティブ2Kで快適に動く」は別の話だ。コミュニティのテストでは、16 GBのRTX 5070 Tiで1024平方のワークフローを実行でき、ピークVRAMは約13.9 GB、20ステップの処理時間は約25秒だった。別のRTX 4090のテストでは、BF16で常駐メモリが約30.2 GB、1024平方で約21秒、1536平方で約56秒という結果が報告されている。
これらはユーザーによる計測であり、公式の性能保証ではない。ハードウェア、精度、オフロード戦略、ステップ数、ソフトウェアのバージョンによって結果は変わる。
「NVIDIA 5070 Ti(16 GB VRAM)でQwen-Image-2.1をテストした。収まり、速度もかなり速い。1024²、20ステップの画像が約25秒」— @BenjaminDEKR、X
ハードウェアの目安は次のとおりだ。
| GPUメモリ | 現実的な見込み |
|---|---|
| 12 GB | 積極的な量子化やオフロードが前提。妥協は避けにくい |
| 16 GB | 1024平方のテストは現実的。2Kではメモリと速度の壁にぶつかりやすい |
| 24 GB | より余裕があるが、フル精度のワークフローでは最適化が必要になる場合がある |
| 48 GB | BF16での実験や、リファレンスを多用する大規模な処理に最適 |
「7B」という表記だけでは、実際の導入規模を判断できない。パイプラインにはQwen3-VLのテキスト・ビジョンエンコーダーなど、別のコンポーネントも含まれるからだ。ダウンロード前に、約33 GBのストレージに加え、キャッシュ、量子化版、生成結果を保存するための余裕も確保しておきたい。
本番利用を止める本当の問題はライセンス
技術的にオープンであることと、商用利用を無制限に認めていることは別だ。Qwen Image 2.1のリリース資料では、非商用利用に制限された研究ライセンスが示されている。以前のQwen画像モデルには、より寛容な利用条件を期待する向きもあったため、コミュニティではこの点が実務上の最大の懸念として繰り返し議論されている。
つまり、ローカルでのテスト、学術研究、個人プロジェクトと、有償の商品画像、クライアント納品物、ホスティングサービス、商用素材ライブラリでは判断がまったく違う。ウェイトをダウンロードできるからといって、生成した画像まで商用利用が許可されているとは考えないほうがいい。
商用利用を想定するなら、Qwenに適用可能な商用条件を確認するか、利用目的を明確にカバーするライセンスのモデルやAPIを選ぶべきだ。リリース後に画像生成パイプラインを作り直すより、事前に法務確認を済ませるほうが安く済む。
初期テストで評価された点と、まだ弱い点
初期の評価で目立つのは、あらゆるモデルを画質で上回ったという話ではなく、ワークフローを細かく制御できる点だ。コンシューマー向けGPUで動かせること、透明出力を維持できること、複数のリファレンスを使えること、そして多くのローカルモデルより文字を扱いやすいことが報告されている。別のユーザーは、複数のリファレンスを与えることで、質の低いスマートフォンの商品写真をプロ品質の商品画像に仕上げられたと説明している。
弱点も同じくらい重要だ。コミュニティのテストでは、粒状感、黄色がかった出力、コントラストが強すぎる結果、復元や編集時のディテール変化が指摘されている。また、現時点の検証結果はリリース直後のサンプルに大きく偏っている。すべてのベンチマークスコアを、安定した本番向けランキングとして扱うのはまだ早い。
Qwen-Image-Benchの論文は、現実的な忠実度とクリエイティブ生成を56の細かな評価基準で検証しており、参考になる。ただし、現在の検索結果に表示される公開のSOTA2ベンチマーク表にはQwen Image 2.0や近接するモデルが掲載されているものの、Qwen Image 2.1について決定的な独立評価が示されているわけではない。別モデルのスコアを、2.1の品質を証明する材料として使わないようにしたい。
Qwen Image 2.1とホスト型画像APIの違い
これは「オープンモデルなら常にホスト型モデルより優れているか」という話ではない。主な選択基準は、ローカルでの制御性を取るか、運用の手軽さを取るかだ。
| 目的 | 最初に選ぶなら | 理由 |
|---|---|---|
| 今すぐ商用クライアント向けの納品物を作る | 商用ライセンスのあるホスト型API | 利用権と処理量を定義しやすい |
| ローカルでの研究やオフライン実験 | Qwen Image 2.1 | 画像ごとのAPI依存がなく、ワークフローを確認できる |
| ネイティブアルファと透明画像の反復編集 | Qwen Image 2.1。ただし輪郭を検証してから | 透明出力が想定されたパイプラインの一部だから |
| GPUチームなしで大量の本番処理を行う | ホスト型API | キャパシティ、課金、稼働状況を管理しやすい |
| リファレンスやノードを最大限に制御する | Qwen Image 2.1 | ローカルツールのほうがワークフローを細かく扱える |
Qwen Image 2.1の強みは、クローズドモデルをすべて明確に上回ったことではない。生成、編集、リファレンス、マスク、アルファ出力を、ローカルユーザーが1つのオープンウェイトワークフローに組み込めることにある。ただし、その強みもライセンスがビジネスをカバーしていなければ意味を失う。
Qwen Image 2.1 FAQ
Qwen Image 2.1は正式リリース済みですか?
はい。Qwenは2026年9月20日にオープンウェイトモデルを発表しており、公式リポジトリやエコシステムの連携先からリリース関連の情報を確認できる。ダウンロードしたファイルを導入する前に、リポジトリのリビジョンとライセンスを確認しておこう。
Qwen Image 2.1にはどのくらいのVRAMが必要ですか?
コミュニティのテストによれば、16 GBのGPUでも制約のある1024平方ワークフローは実行できる。一方、RTX 4090でのBF16テストでは、常駐メモリが約30.2 GBに達した。量子化やオフロードによって結果は変わるが、ネイティブ2Kはかなり重い。
Qwen Image 2.1で透明なPNGを生成できますか?
はい。ネイティブRGBA出力は、このモデルを代表する機能のひとつだ。ただし、アルファチャンネルがあるからといって、そのまま本番品質だとは考えないこと。輪郭や半透明部分は確認が必要になる。
Qwen Image 2.1は複数のリファレンス画像に対応していますか?
公式のリリース資料では、最大10枚のリファレンス画像に対応すると説明されている。ただし、画像の順番、解像度、互いの視覚的な関係によって、出力の一貫性は変わる。
Qwen Image 2.1はComfyUIで使えますか?
ComfyUIはリリース前後に対応を発表している。メンテナンスされているワークフローと、連携先が想定する正確なチェックポイントを使おう。適当に入手したワークフローJSONでは、互換性のないカスタムノードやリビジョンが必要になる場合がある。
Qwen Image 2.1は商用利用できますか?
利用できると決めつけてはいけない。現在の研究ライセンスは非商用であり、商用利用には別途の許可またはライセンスが必要になる。ダウンロードできることは、商用利用が認められていることを意味しない。
Qwen Image 2.1はGPT Image 2や他のホスト型モデルより優れていますか?
単純な勝者は存在しない。Qwenは、ローカルでアルファを扱う編集や複数リファレンスの制御に魅力がある。一方、ホスト型モデルは商用展開、安定した運用、ローカルGPU基盤を持たないチームにとって扱いやすい。
Qwen Image 2.1は写真の復元に向いていますか?
自分の画像で検証するまでは、復元は弱点、あるいは実力がまだ確認できていない用途として扱いたい。初期のコミュニティ報告では、復元に近い編集で細部が変わったり、合成的な粒状感が加わったりする例が挙げられている。
次にやるべきこと:権利関係を先に確認して小規模導入する
個人利用や研究用途に限るなら、Qwen Image 2.1をダウンロードし、4つのケースで試してみよう。透明な商品切り抜き、2枚のリファレンスを使った商品合成、マスクによる局所編集、文字の多いポスターだ。VRAM使用量、1枚あたりの処理時間、失敗したプロンプト、輪郭の品質を記録しておくといい。
商用利用なら、ComfyUIの最適化より先にライセンスを確認すること。Qwen Image 2.1は技術的には非常に相性がよくても、商用権が明確になるまでは、本番環境に採用すべきでないケースがある。