AIREITER

文字を正確に描けるAI画像モデルはどれか(2026年テスト)

最終更新日: 2026-08-04 09:17:15

AI画像モデルの「文字もきれいに出せます」という宣伝は、いまや珍しくない。ただし、短い単語を1つ書けることと、実務で使える精度で褸数の文字領域を扱えることは別の話だ。GPT Image 2、Nano Banana 2、Nano Banana Pro、Seedream 5 Proに、4領域を含むパッケージ画像と6ラベルのUIモックアップという同一プロンプトを投げて比較した。結論から言うと、1回の生成で4つすべての文字ブロックを崩さず出せたのはGPT Image 2だけだった。ただし、どんな用途でもこれ一択というわけではない。

4モデルを同条件で比較したテスト内容

「HELLO」とだけ書かれたポスターを正しく生成できても、文字描画が強いとは判断できない。実際の制作では、複数の文字を異なるサイズで1枚に収める場面こそ問題になる。そこで今回は、1フレーム内にサイズの異なる複数のテキストブロックを置くという、実運用で起こりやすい失敗を引き出す2種類のプロンプトを用意した。

テスト1:コーヒー袋のパッケージ:「PREMIUM ROAST」(大きなタイトル)、「Single Origin Colombia」(サブタイトル)、「340g / 12 oz」(小さな表記)、「Ethically Sourced Since 2019」(タグライン)。1つの商品上に、4つの独立した文字領域を指定した。

テスト2:モバイル向けログインUI:「Welcome Back」(見出し)、「Sign in to your account」(補足文)、「Email Address」と「Password」(入力欄ラベル)、「Sign In」(ボタン)、「Forgot your password?」と「Don't have an account? Sign Up」(フッターテキスト)。計6つのテキスト要素を含めた。

各プロンプトはモデルごとに1024×1024(または同等サイズ)で1回だけ実行した。都合のよい生成結果を選ぶことはしていない。以下の比較画像は、5回生成したうちのベストではなく、最初の1枚だ。

検証したモデル

モデル開発元API識別子
GPT Image 2OpenAIgpt-image-2
Nano Banana 2Google DeepMindgemini-3.1-flash-image
Nano Banana ProGoogle DeepMindgemini-3-pro-image
Seedream 5 ProByteDanceseedream-v5-pro

さらにIdeogram V3とFLUX.2についても、それぞれのAPI経由で同じプロンプトを確認した。AIReiterのプラットフォームでは利用できないため、ここでは完全なテスト画像を掲載していないが、結果は後半の選び方で参照している。

コーヒー袋で検証:4つの文字領域を崩さず出せるか

コーヒー袋のプロンプトでは、サイズの異なる4つの文字ブロックを同時に求めた。単語1つが偶然きれいに出るモデルと、本当に文字描画が安定しているモデルとの差が最も出やすい条件だ。

GPT Image 2、Nano Banana 2、Nano Banana Pro、Seedream 5 Proによるコーヒー袋テキスト描画の比較

GPT Image 2は、4つのテキストブロックをすべて正しく描画した。「PREMIUM ROAST」は太字で中央に配置され、「Single Origin Colombia」も1文字も間違っていない。「340g / 12 oz」は小さなサイズでも読め、タグラインのスペルも正確だった。勝手に追加された文字も、欠けた領域もない。

Nano Banana 2はタイトルとサブタイトルを正確に出力した一方、小さい文字では精度が落ちた。「340g」は正しく描けたものの、「12 oz」の部分は周囲のデザイン要素に埋もれた。タグラインでは文字間隔にもばらつきがあった。ただしシーン品質は4モデル中でもっとも高く、テーブルの質感やライティングはレンダリング画像というより商品写真に近い。

Nano Banana Proは、もっとも目を引くデザインを生成した。タイポグラフィの演出が強く、エディトリアルな印象もある。タイトルはきれいだったが、サブタイトルでは文字の置き換わりが発生し、小さい文字も一部が創作された。Nano Banana Proはテキストを精密な出力対象というより、デザイン要素として扱う傾向がある。

Seedream 5 Proはタイトルとサブタイトルを正確に処理し、重量表記もほぼ正しかった。ただしタグラインにはスペルミスが1つあった。ByteDanceのモデルは中国語テキストで特に強く、これは別途、中国語ラベルのプロンプトでも確認している。一方で、英語の複数領域テキストではGPT Image 2に一歩届かない。

モデルタイトルは正確かサブタイトルは正確か重量表記は正確かタグラインは正確か4領域すべて問題なし
GPT Image 2はいはいはいはいはい
Nano Banana 2はいはい一部のみ文字間隔に乱れいいえ
Nano Banana Proはい文字の置き換わりいいえいいえいいえ
Seedream 5 Proはいはいほぼ正確スペルミス1件いいえ

ログインUIで比較:6つのラベルを1画面に配置

ログイン画面のプロンプトは、パッケージテストより難しい。サイズの異なる6つのテキスト要素に加えて、ボタンや入力欄といったUI構造も必要になるためだ。文字の正確さだけでなく、レイアウトを守る力も見ている。

GPT Image 2、Nano Banana 2、Seedream 5 ProによるログインUIのテキスト描画比較

GPT Image 2は、ログイン画面として認識できるUIを生成し、6つのテキスト要素をすべて正しいスペルで含めた。ボタン内の文字は中央に置かれ、入力欄ラベルはフィールドの上に配置され、フッターの文も読める。レイアウトはピクセルパーフェクトではないが、AI生成UIで完全な精度を期待するのは難しい。それでも、すべての文字が読め、配置も正しかった。

Nano Banana 2は、見た目の整ったUIを出力し、ヘッダーとボタンの文字は正確だった。入力欄ラベルも存在するものの、「Password」には拡大して見るとわかる軽微な文字崩れがある。「Forgot your password?」は読めたが、「Don't have an account? Sign Up」の行は一部が切れていた。全体のデザインはGPT Image 2よりモダンに感じる一方、テキストの完全性は低い。

Seedream 5 Proは、機能しそうな画面を良好なレイアウトで生成した。ヘッダーは正確だったが、入力欄ラベルとフッターテキストではより大きな崩れが見られた。ボタンの文字はきれいだった。6要素のうち、完全に正確だったのは4要素だ。

「AI画像モデルは、まだテキストを確実には描けない……Photoshopが必要になる」— r/StableDiffusion userによるローカルモデルへのコメント。ただし2026年には、ローカルモデルとAPIモデルの差は大きく開いている

モデルヘッダー補足文入力欄ラベルボタンフッターテキストスコア(6点満点)
GPT Image 2はいはいはいはいはい6/6
Nano Banana 2はいはい一部のみはい一部のみ4/6
Seedream 5 Proはい一部のみ一部のみはい一部のみ3.5/6

文字の多い画像で本当にかかるコスト

文字の多い画像には、見えにくいコスト増要因がある。最初の生成でスペルを間違えれば、再生成が必要になるからだ。以下は公式APIにおける1枚あたりの価格だが、文字の正確さが重要な作業での実コストは、きれいな文字が出るまでに必要な生成回数を掛けたものになる。

モデル1024×1024の料金2K以上の料金初回生成の文字精度(本テストの2プロンプト)
GPT Image 2約$0.020(medium)約$0.067(high、2K)両プロンプトとも初回で問題なし
Nano Banana 2約$0.020約$0.040(4K)タイトル/サブタイトルは問題なし、小さい文字は崩れた
Nano Banana Pro約$0.050約$0.060タイトルは問題なし、4領域中3領域にエラー
Seedream 5 Pro約$0.035—タイトル/サブタイトルは問題なし、タグラインにスペルミス

文字精度を重視するなら、モデルの実コストには再生成も含めて考える必要がある。$0.020の画像でも、正しい文字を出すために3回生成すれば$0.060になる。

出典:OpenAI API pricing(2026年8月確認)、Google Gemini API pricing(2026年8月確認)、AIReiter pricing page。

GPT Image 2がテキスト用途でコスト面でも有利なのは、再生成を減らせるためだ。今回の2つのテストプロンプトでは、どちらも最初の生成で問題のない文字を出力した。再生成は不要だった。他のモデルでは、すべての文字領域を正しくするために少なくとも1回のやり直しが必要だった。

Imagen 4はどうか? Googleは2026年8月17日にImagen 4 APIエンドポイントを終了し、開発者にはNano Bananaモデルへの移行を案内している。既存のImagen 4ワークフローがあるなら、今のうちに移行計画を立てておきたい。

用途別:どのモデルを選ぶべきか

複数の文字ブロックを正確に出したいなら:GPT Image 2

インフォグラフィック、原材料リスト入りのパッケージ、UI画面、ラベル付きの図解、多言語サインなどに向く。今回テストしたなかで、4つ以上の文字領域を1回の生成ですべてきれいに保てたのはGPT Image 2だけだった。マスクベースの編集にも対応しており、画像全体を再生成せずにスペルミスのラベル1つだけを直せる。OpenAIのドキュメントでは、長辺最大3840pxまで柔軟な出力サイズをサポートすると案内されている。

GPT Image 2で文字量の多いプロンプトを試す。

フォトリアルな写真内に短い見出しを入れるなら:Nano Banana 2

街角写真の看板、ライフスタイル写真に写るボトルのブランド名といった用途だ。Nano Banana 2は、検証したモデルのなかで最もフォトリアルなシーンを生成し、1〜2個の短いテキスト要素もきれいに扱える。ただし、独立した文字領域が3つ以上になると崩れ始める。

Nano Banana 2とNano Banana Proは、どちらもAPI経由で利用できる。

タイポグラフィをデザインの主役にするなら:Ideogram V3

ポスター、文字入りロゴ、アルバムカバーなら、Ideogram V3が有力だ。カーニング、フォントスタイルの制御、レイアウトを踏まえたプロンプト拡張など、テキストを第一級のデザイン要素として扱える。複数の独立比較でも、単一見出しのタイポグラフィでは最有力と評価されている。AIReiterでは使えないため、今回のフルテストには含めていない。

CJK・多言語テキストなら、まずGPT Image 2

競合テストとGoogle公式ドキュメントを見る限り、ラテン文字以外のスクリプトも含めて最も安定しているのはGPT Image 2だ。ByteDance製のSeedream 5 Proは、中国語の文字に限れば有力な代替候補になる。どのモデルを使う場合でも、ラテン文字以外の出力は必ずネイティブの読者に校正してもらうべきだ。

文字が最小限の大量生成なら:Nano Banana 2 LiteまたはSeedream 5 Lite

小さな透かしや単語1つなど、文字が主役ではなく、低コストで大量生成したいなら、Nano Banana 2 Lite(gemini-3.1-flash-lite-image)とSeedream 5 Liteが最安のAPI選択肢になる。これらは高密度なテキストでストレステストしていないため、文字性能はフルサイズ版の兄弟モデルより一段下と見ておきたい。

FAQ

2026年に最も正確に文字を描けるAI画像モデルは?

複数ブロックのテキストでは、明確にGPT Image 2が優位だ。パッケージテストでは、4つの独立した文字領域を最初の生成で正確に処理した。Nano Banana 2とSeedream 5 Proは、それぞれ少なくとも1つの要素が崩れた。短い見出し1つなら、Nano Banana 2とIdeogram V3もどちらも有力な選択肢だ。

AIで読める文字入りロゴは作れる?

作れる。文字入りロゴではIdeogram V3が最も強く、カーニング、整列、フォントスタイリングを、汎用モデルでは届かないレベルで扱える。GPT Image 2も有力な次点で、ロゴ内のより長いテキストに強い。それでも実制作で使う前には、必ず最大倍率ですべての文字を確認してほしい。

AI画像で単語のスペルを間違えるのはなぜ?

理由は3つが重なる。第一に、文字はエラー許容度がほぼゼロだ。「B」の線が1本違うだけで「R」や意味のない文字になり得るが、顔であれば数パーセントずれても顔として認識できる。第二に、要素数が増えるほど失敗確率は積み上がる。各文字領域は独立した精度要件なので、ラベルが5つあれば失敗する機会も5つある。第三に、ラテン文字以外の文字体系は字形の種類が大幅に多く、整った学習データも少ないため、文字単位で正確に描画する難度が大きく上がる。

Imagen 4は文字描画の選択肢としてまだ使える?

新規プロジェクト向けではない。Googleは2026年8月17日にImagen 4 APIを終了し、Nano Bananaモデルへの切り替えを推奨している。既存のImagen 4ワークフローがある場合は、移行を始めるべきだ。

AI画像で正確な文字を最も安く得る方法は?

medium品質のGPT Image 2(約$0.020/画像)が、精度に対するコスト比では最も優れている。再生成の回数が少ないためだ。Nano Banana 2も1枚あたりの価格は近いが、複数ブロックの文字をきれいに出すには通常より多くの生成が必要になり、文字精度が重要な用途では実コストが高くなる。

関連記事