AIREITER

画像生成に最適なGPTモデルは? Image 2・1.5を実機比較

最終更新日: 2026-08-06 02:16:02

OpenAIの画像生成モデルで、品質を最優先するなら現時点の答えはGPT Image 2です。Artificial AnalysisではElo 1,340を記録し、GPT Image 1.5を78ポイント引き離しています。ただし高品質設定では1枚あたり最大$0.21かかる一方、gpt-image-1-miniなら$0.01未満まで抑えられます。広告クリエイティブを仕上げたいのか、大量の試作品を作りたいのか、商品写真を編集したいのかで最適解は変わります。本記事では、現在のOpenAI画像モデルを画質、価格、解像度、編集性能から比較します。

対象はOpenAI純正の画像生成モデル、GPT Image 2、GPT Image 1.5、gpt-image-1-mini、旧世代のGPT-4oに限ります。Midjourney、FLUX、Stable Diffusionも含めて比較したい場合は、2026年版AI画像生成ツール比較を参照してください。

OpenAIの画像生成モデルは4種類。役割を整理

OpenAIはAPI経由で4つの画像生成モデルを提供しています。詳細は公式のプロンプティングガイドで確認できますが、それぞれ品質とコストの異なる層を担う構成です。

GPT Image 2は、2026年4月21日に登場したOpenAIのフラッグシップモデルです。OpenAIのガイドでは「総合的に最も強力なモデル」とされ、内部推論ステップ、実験的ながら約4Kまでの柔軟な解像度、ピクセル制約内での任意アスペクト比に対応します。OpenAIは「ほとんどの本番ワークフローのデフォルト」として推奨しています。

GPT Image 1.5は2025年12月にリリースされました。推論ステップは備えませんが、編集時に元画像のディテールをどの程度残すか調整できるinput_fidelityパラメータを利用できます。設定値はlowとhighです。解像度は1024×1024、1024×1536、1536×1024、またはautoの固定サイズに限られます。OpenAIのガイドでは、「プロンプト移行を検証する間の後方互換性のためにのみ維持」するモデルと位置づけられています。

gpt-image-1-miniは低コスト帯のモデルです。OpenAIのドキュメントでは「コストとスループット」に最適化されているとされ、バリエーションの一括生成、素早いアイデア出し、プレビュー、最高品質を必要としないドラフト素材に向いています。

GPT-4oの画像生成、すなわち初代ChatGPT Imagesは、現在もコンシューマー向けアプリで利用できます。ただし、そのAPIモデルであるGPT Image 1は、OpenAIにより「レガシー互換性のみ」と分類されており、GPT Image 2への移行が明示的に推奨されています。

画質と指示追従性:Eloスコアで見える差

画像品質を完全に客観評価するのは難しいものの、生成元を伏せて人間が良い出力を選ぶブラインド投票アリーナは、比較の有力な指標です。

2026年8月時点で、GPT Image 2は主要3つのリーダーボードすべてで1位を獲得しています。

アリーナGPT Image 2GPT Image 1.5差
Artificial Analysis(13,289票)1,340 Elo1,262 Elo78ポイント
arena.ai(LMArena)610~631 Elo個別ランキングなし—
llm-stats.com(13,552票)661 Arenaスコア333 Arenaスコア328ポイント

Artificial Analysisにおける78ポイント差は、同リーダーボードで記録された1位と2位の差として過去最大です。

文字描画では、両者の差が特に明確です。GPT Image 2はラテン文字やCJKを含む多言語テキストを高精度に扱い、Artificial Analysisはその性能を「ほぼ完璧」と評価しています。ロゴ、インフォグラフィック、文字入りの画像なら、まず選ぶべきモデルです。GPT Image 1.5もシンプルなレイアウトの文字には強い一方、複数フォントを使う情報量の多い構図では文字が抜けることがあります。

「GPT-Image-2 is out the model is insanely good at rendering text and generating all the tiny details in complex software interfaces」 — u/Glittering-Neck-2505、r/singularity

フォトリアリズムも進化していますが、トレードオフはあります。Redditでは、GPT Image 2について第一印象では非常に写実的である一方、自然物に「繰り返しパターンやテクスチャ」が出る場合があるとの指摘がありました。岩肌を「ビデオゲームのプロシージャル生成テクスチャのよう」と表現したユーザーもいます。GPT Image 1.5にはこの特有のアーティファクトは見られないものの、全体的なディテール量では劣ります。

以下は、私がGPT Image 2で試した東京のカフェシーンです。「COFFEE」のネオンサインを指定し、文字描画を負荷テストしました(gpt-image-2、高品質、16:9)。

GPT Image 2のテスト:雨に濡れた窓とCOFFEEのネオンサインがある夜の東京のカフェ

ネオン文字は初回で正しく描画され、雨粒も一様なぼかしではなく、一粒ごとのディテールが表現されました。

画像1枚あたりの料金:GPT Imageモデルを比較

OpenAIの画像モデルは、画像単価ではなくトークン単価で課金されます。以下はOpenAIの料金ページに掲載されたトークン料金(2026年8月確認)と、画像1枚あたりの推定コストです。

トークン料金(100万トークンあたり)

モデルテキスト入力画像入力キャッシュ済み画像入力画像出力
gpt-image-2$5.00$8.00$2.00$30.00
gpt-image-1.5$5.00$8.00$2.00$32.00
gpt-image-1-mini$2.00$2.50$0.25$8.00

品質設定別:画像1枚あたりの推定コスト

推定値は、50~100語のプロンプトで1024×1024のテキストから画像を生成するケースを前提にしています。実際のコストは解像度とプロンプトの複雑さに応じて変動します。

品質gpt-image-2gpt-image-1.5gpt-image-1-mini
低約$0.006約$0.009約$0.003
中約$0.03~0.07約$0.04~0.08約$0.01
高約$0.10~0.21約$0.10~0.20約$0.03~0.05

「低」「中」「高」は、APIリクエストのqualityパラメータ(例:quality="low")に対応します。この設定は、ディテール描画にモデルが割り当てるトークン予算を決めるものです。低品質では出力トークンが少なくなるため、料金も下がります。

GPT画像モデルの料金比較チャート

やや意外なのは、GPT Image 1.5の画像出力トークンが$32/1Mで、GPT Image 2の$30/1Mより高い点です。低品質で素早くプロトタイプを作る場合、GPT Image 2は1枚$0.006で、GPT Image 1.5の$0.009より安くなります。

gpt-image-1-miniのコストは、おおむね3分の1です。たとえば10,000件の商品バリエーションプレビューを生成するような大量処理では、$0.003と$0.006の差によって、バッチあたり$30を節約できます。

解像度と画像編集機能の違い

GPT Image 2は、OpenAIのドキュメントにある以下の制約を満たす限り、sizeパラメータで任意の解像度を指定できます。

  • 最大辺は3,840px未満
  • 両辺は16の倍数
  • アスペクト比は3:1以下
  • 総ピクセル数は655,360~8,294,400

よく使われるサイズは、1024×1024の正方形、安定しやすい2Kの2560×1440、実験的なほぼ4Kの3824×2144です。OpenAIは、2Kを超える結果は「より変動しやすい」としています。

GPT Image 1.5は、1024×1024、1024×1536、1536×1024、autoの4種類に固定されています。カスタム解像度は指定できません。

編集では、GPT Image 2がArtificial Analysisの画像編集アリーナでElo 1,255を記録し、GoogleのNano Banana Proの1,247を上回って首位です。一方、GPT Image 1.5のinput_fidelityでは、編集時の元画像保持を明示的にコントロールできます。GPT Image 2がこのパラメータをサポートしないのは、OpenAIによれば「出力はデフォルトですでに高忠実度」だからです。

機能gpt-image-2gpt-image-1.5gpt-image-1-mini
最大解像度約4K(実験的)1536×1024(固定)1536×1024(固定)
カスタムアスペクト比対応非対応(4プリセット+auto)非対応(4プリセット+auto)
推論ステップありなしなし
input_fidelity無効(常に高忠実度)Low / HighLow / High
編集アリーナElo1,255(1位)個別ランキングなしランキングなし

用途別:どのGPT画像モデルを選ぶべきか

マーケティング素材・広告クリエイティブ

GPT Image 2を中品質または高品質で使う。推論ステップにより、クリエイティブブリーフに近いプロンプトでもレイアウトや文字をより正確に反映します。OpenAIのガイドも、このモデルでは「純粋に技術的な画像仕様ではなく、クリエイティブブリーフのように」プロンプトを書くことを勧めています。

商品モックアップ・EC

メインビジュアルはGPT Image 2、バリエーションのプレビューはgpt-image-1-mini。主力商品画像には高品質のGPT Image 2を使い、ストアフロントの正確なサイズに合わせて出力します。その後、色・角度・背景違いは1枚$0.003のgpt-image-1-miniで生成するのが効率的です。50 SKUの商品ラインで各5バリエーションを作る場合、miniの低品質なら合計約$0.75です。

インフォグラフィック・文字情報の多い画像

GPT Image 2。Artificial Analysisによれば、ラテン文字とCJK文字にまたがる文字描画はほぼ完璧です。GPT Image 1.5もシンプルな文字には対応できますが、複数フォントを詰め込んだレイアウトでは文字が欠けます。品質は中または高に設定してください。低品質では、すべてのモデルで文字の読みやすさが落ちます。

大量バッチ生成

低品質のgpt-image-1-mini。1枚$0.003なら、100,000枚生成しても$300です。スループットより品質を優先するなら、低品質で$0.006のGPT Image 2も現実的な選択肢です。GPT Image 1.5はこの用途でコスト面の利点がありません。画像出力トークンはGPT Image 2より$2/1M高いためです。

繰り返し編集するワークフロー

一般的な編集にはGPT Image 2、input_fidelityの制御が必要ならGPT Image 1.5。GPT Image 2は編集アリーナで首位ですが、GPT Image 1.5の忠実度切り替えを使えば、「すべてを保持する」と「大まかに再解釈する」の間を選べます。この制御がパイプラインの前提になっているなら、GPT Image 1.5には構造的な優位性があります。

FAQ

GPT Image 2は常にGPT Image 1.5より優れていますか?

すべてのワークフローで優れているわけではありません。GPT Image 1.5は編集用のinput_fidelity制御を備え、岩、葉、毛のような自然シーンでGPT Image 2に報告されている繰り返しテクスチャのアーティファクトもありません。元画像を厳密に保持したい場合は、GPT Image 1.5のほうが適しています。一方で文字描画、指示追従性、フォトリアリズムではGPT Image 2が優位です。

画像生成にGPT-4oをまだ使うべきですか?

APIを使わず、コンシューマー向けのChatGPTインターフェースが必要な場合を除き、使うべきではありません。OpenAIはGPT-4oの背後にあるGPT Image 1を「レガシー互換性のみ」と分類し、GPT Image 2への移行を推奨しています。

GPT Image 2は無料で使えますか?

ChatGPTの無料プランと月額$8のGoプランでは、制限付きで画像生成を利用できます。APIでは、新規OpenAIアカウントに$5の無料クレジットが付与され、品質設定に応じて約25~800枚を生成できます。

gpt-image-1-miniは何に向いていますか?

大量かつコスト重視の用途です。素早いアイデア出し、A/Bテスト用バリエーション、プレースホルダー素材、サムネイルプレビュー、一括パーソナライズなどに適しています。低品質なら1枚約$0.003で、GPT Image 2の中品質と比べておよそ10分の1のコストです。文字情報の多い画像や、初回出力の品質によってレビュー回数を減らしたいクライアント向け素材には向きません。