発売時の例では、Qwen-Image-3.0 は1回の処理で9分割のインフォグラフィックを生成します。内容は、物理学の導出、群論の証明、医学図、細胞生物学の比較で、それぞれのパネルにはラベル付きの図やキャプションがぎっしり詰め込まれ、小さな文字の各行までもがまだ読み取れます。この1枚の画像こそが、第3世代のQwen画像モデルである、2026年7月21日に公開されたものが実際に何のためのものかを、最も明確に要約しています。
*Qwen-Image-3.0 の公式例(qwen.ai 経由)。Qwen によると、この完全なグリッドは9回のレンダリングをつなぎ合わせたものではなく、1つのプロンプトから生成されたものだそうです。*
Qwenはこのリリースをひとことで「実」と総括しており、これはおおむね *substantial* または *practical* を意味します。1.0が精度を追い、2.0が表現の幅を追ったのに対し、3.0は実運用向けを目指しています。つまり、新聞、ストーリーボード、試験問題、入れ子構造のUIモックアップ、そして一目で全体が把握できる学術図版です。狙いは、1枚のきれいな画像よりも、細かな注記まで正確さを保った、情報量の多い密なレイアウトにあります。
Qwen-Image-3.0とは実際に何か
Qwen-Image-3.0は、AlibabaのQwenチームによるtext-to-image基盤モデルであり、長らくテキストレンダリングを得意としてきたシリーズの第3弾です。Qwenは各世代を進化として位置づけており、1.0は「正確」、2.0は「正確、多様、完全、美しい、リアル」、そして3.0は「充実」とされています。実際には、ほとんどの画像生成器が今なお苦手とするシーン(全面の新聞紙面、複数パネルのストーリーボード、スクリーンショットの中に埋め込まれたスクリーンショットなど)を対象としており、その出力はデザイン、教育、e-commerce、またはコンテンツのワークフローにそのまま組み込めます。
重要な3つのアップグレード
Qwenは、3つの柱を中心にリリースを構成しています。マーケティング的な表現を取り除けば、そのそれぞれが具体的な価値をもたらします。
リッチコンテンツ: 4.5kトークンのプロンプトとワンショットの複雑なレイアウト
注目すべき数値はプロンプト長です。Qwen-Image-3.0 は最大4.5k tokensの入力を受け付け、前世代が処理していたおよそ 1k-token の指示長から大幅に増えています。トークンとはモデルが読み取るテキストの断片であり、トークン数が多いほど、より密度が高く、構造化されたシーンを一度に詳しく記述できます。
その予算で2つのことが可能になります。Qwenが*水平*レイアウトと呼ぶ最初のものは、上の9分割グリッドです。各セルがそれぞれ独自の詳細なインフォグラフィックであり、全体が一度で生成されます。Qwenによれば、そのグリッドを完全に記述するのに約3.7kトークンかかったため、上限の引き上げが重要なのです。以前の制限ではその指示を収められませんでした。
2つ目は*深さ*です。つまり、インターフェースの中にさらにインターフェースを入れ子にすることです。Qwenの例では、VS Codeのウィンドウの中にQwenのチャットウィンドウがあり、その中にWeChatのチャットがあり、さらにその中にコーヒーのポスターが表示されています。各レイヤーはそれぞれ独自のリアルなUIを保っています。あなたの仕事がモックアップ、ダッシュボード、あるいはレイヤー構造のあるシーンに関わるものなら、注目すべき進化はこれです。
現実的なディテール:判読性を保つ小さな文字
テキスト描画は長らくQwenシリーズの最も強い特長であり、3.0では10pxの小さな文字でも読みやすさを保つところまで下限が引き下げられています。例では、難しいケースでもそれが確認できます。正しい上付き文字、下付き文字、ギリシャ文字、定理番号を備えた学術LaTeXの1ページ全体、現実的な紙面上で密度の高い本文を載せた新聞、科学図版上の非常に小さな注釈ラベルなどです。
*qwen.ai 経由の公式 Qwen-Image-3.0 例:写真を中心に構成された分類学スタイルのプレートで、小さなラベルと 0.5mm のスケールバーが鮮明さを保っている。*
これらの例全体で際立っているのは、小さな文字が雑音に埋もれてしまわないことです。キャプション、脚注、軸ラベルは、文字化けが通常の失敗モードとなるサイズでも、その形を保っています。細部はテキストだけにとどまりません。Qwenは、毛穴や産毛のレベルまで写真的なリアリズムに迫る肌の質感を示し、損傷した伝統的な墨絵を修復する編集では、元の筆致を保ちながら欠損部分を補っています。
豊富な知識:12言語、100以上のスタイル、そしてウェブ接続された出力
第3の柱は幅広さです。Qwen-Image-3.0は12言語をネイティブに(デモには日本語、韓国語、スペイン語などが含まれます)レンダリングし、100種類以上のアートスタイルと複数のフォントをサポートし、ウェブ、ゲーム、ライブ配信向けに説得力のあるシミュレートされたUIを生成します。
*公式の Qwen-Image-3.0 の例(qwen.ai 経由):8つのセクションと数十の小さなラベルを含む単一画像の知識ポスターで、すべて判読可能。*
2つの機能が際立っていました。実在の写真から詳細な参考インフォグラフィックを作成します。上のプレートでは、元画像に分類学上のラベル、形態学的な注釈、拡大詳細ビュー、スケールバーが追加されています。そしてQwenは、ウェブからのライブ情報を取得する様子を示し、あるデモでは特定の都市と日付の天気予報グラフィックを生成していました。これは「私が説明したものを描く」を超えて、「現在のものを描く」ことを示しています。ただし、生成された図表はどれもそうですが、信頼する前に事実確認は必要です。
他のテキストに強い画像モデルとの比較
テキスト中心の作業やレイアウト中心の作業に向けてモデルを選ぶなら、これらが現実的な代替候補です。以下の評価は目安であり、ベンチマークに基づくものではありません。Qwen は 3.0 のスコアを公開していないため、1対1の数値を事実として扱うのは推測にすぎません。
| モデル | テキスト描画 | 複雑なレイアウト | 編集 | アクセス方法 |
|---|---|---|---|---|
| Qwen-Image-3.0 | 非常に強力; 10pxでも判読可能、LaTeX級 | 非常に強力; 4.5k-token、9パネルを一発生成 | はい(注釈、復元) | Qwen Studio、Qwen API |
| Qwen-Image-2.0 | 強い | 良好; 約1k-token | はい(統合) | Qwen Studio、サードパーティのエンドポイント |
| Nano Banana Pro | 良好 | 良好 | はい | Google; unified API |
| Seedream 5 Pro | 良好 | 良好 | はい | ByteDance; unified API |
| GPT-Image-2 | 良好 | 良好 | はい | OpenAI; unified API |
これらを自分で比較すると、「テキスト対応」をうたうモデルと信頼できるモデルを分ける3つのテストがあります。小さな文字がポスターサイズでも判読性を保つか、複数パネルのレイアウトが一体化してぼやけずに構造を保てるか、そしてモデルがその言語の実際の文字体系を近似ではなく保持できるか、です。Qwenは3.0リリースをまさにこの3点を中心に構築しました。すでに AIReiter のような単一API経由で Nano Banana Pro、Seedream 5、または GPT-Image-2 を利用している場合、Qwen-Image-3.0 はまだそのカタログには含まれていないことにご注意ください。現時点では、Qwen独自のプラットフォーム上でのみ利用できます。
Qwen-Image-3.0 を今すぐ試す方法
リリース当日には、確実な方法は Qwen の公式プラットフォームです:
- Qwen Studio は chat.qwen.ai にあり、web、iOS、Android、macOS、Windows で利用できます。これはローンチ日にモデルへアクセスする最も直接的な方法です。画像ツールを開いて、そこでプロンプトを入力してください。
- プログラムによるアクセスのための Qwen's API platform(Qwen Cloud)。
- ファミリーの技術詳細については、Hugging Face 上の Qwen-Image モデルカードをご覧ください。
4.5kトークンの強みを活かすには、構造を明示的に指定するプロンプトを書いてください。各パネル、その見出し、そして中に入れたい正確な文言を、それぞれ単一の曖昧な文ではなく個別に指定します。以下は応用できるひな形です:
「コーヒー抽出法」という単一の2x2インフォグラフィックポスターを作成する。
左上 — 「ポアオーバー」:ラベル付きの3ステップ(フィルターをすすぐ、30秒ブルーム、円を描くように注ぐ)、小さなキャプション「1:16比率、92°C」。
右上 — 「フレンチプレス」:ラベル付きの図、キャプション「4分抽出、粗挽き」。
左下 — 「エスプレッソ」:ショットの断面図で、層にラベル(クレマ、ボディ、ハート)、キャプション「9バール、25-30秒」。
右下 — 「エアロプレス」:番号付きの手順、キャプション「逆さま方式」。
統一されたフラットイラスト風、読みやすい小さなキャプション、白い背景。
レイアウトの指示が具体的であるほど、新しい機能を実際により多く活用できます。
ローンチ当日のテストでの注意点があります。7月21日、私が試したサードパーティのqwen/text-to-imageエンドポイント(Kie marketplace 経由)は、ジョブを受け付けた後に 500 エラーを繰り返しました。これは1つのプロバイダーでの問題であり、プラットフォーム全体の障害の証拠ではありませんが、もし今日ダウンストリームの Qwen エンドポイントが失敗するなら、ミラーが安定するまでは直接 Qwen Studio にアクセスするのが安全です。
私たちがまだ知らないこと
これが公開されたのは数時間前なので、まだ公表されていないことがいくつかあります。これらを事実として断言する人がいたら、疑ってかかるべきです:
- 価格. Qwenの発表にはAPI料金表が含まれていません。今日目にする画像1枚あたりの具体的なコストは、いずれも推測にすぎません。
- オープンウェイト. 以前のQwenの画像モデルはダウンロード可能でしたが、Qwenは3.0のウェイトが公開されるかどうかを明言していません。コミュニティでは、Qwenがクローズドモデルへ移行しているのではないかと公然と議論されているため、3.0をまだ自前でホストできると考えないでください。
- パラメータとベンチマーク. 今回の発表にはパラメータ数やベンチマークスコアは付随していません。出回っている数値は通常2.0のものです。
よくある質問
Qwen Image 3は無料ですか?
Qwen Studio at chat.qwen.ai を通じて Qwen-Image-3.0 を使用できます。Qwen Studio では Qwen のチャットおよび画像ツールに無料でアクセスできます。Qwen はまだ API 料金を公開していないため、プログラムからの利用における有料プランの費用は現時点では不明です。
Qwen-Image-3.0をダウンロードできますか?
未確認です。Qwenの発表投稿では、3.0のweightsがダウンロード可能として公開されるかどうかは明記されていません。以前のバージョンはHugging Faceで利用可能でしたが、Qwenが別途明言するまでは3.0はクラウド専用として扱ってください。
Qwen Image 3は2.0とどう違いますか?
最大の変化は、プロンプト入力が約1kトークンから4.5kトークンへ増加したこと、10pxの小さな文字でも読みやすくレンダリングできること、9分割グリッドのような単一パスの複雑なレイアウト、12言語のネイティブテキスト、そしてWeb接続型生成です。Qwenはこれを「見栄えが良い」から「役に立つ」への移行だと位置づけています。
Qwen Image 3 は英語以外のテキストを扱えますか?
はい。Qwenによると、12言語をネイティブにレンダリングでき、デモには日本語、韓国語、スペイン語が含まれており、各言語の実際の文字体系で、近似文字ではなく表示されています。
Qwen Image 3 はどこでオンラインで使えますか?
Qwen Studio (chat.qwen.ai) は公式のオンライン利用手段であり、Web アプリとモバイルアプリがあります。プログラムによるアクセスは Qwen の API プラットフォームを通じて利用できます。
