GPT Image 2のプロンプトは、形容詞を並べるものではありません。完成イメージを共有するための制作指示書として組み立てると、結果が安定します。
GPT Image 2で機能するプロンプトの型
まず何を作るのかを明示し、そのあとに被写体、構図、シーン、テキスト、スタイル、制約を続けます。OpenAIのCookbookでは、シーン、被写体、重要なディテール、制約という順番が推奨されています。複雑な依頼では、ラベル付きのセクションに分ける書き方も有効です(OpenAI Cookbook)。
TASK: Create a [poster / product photo / UI mockup / editorial image].
SUBJECT: [the person, object, or scene that must remain accurate].
COMPOSITION: [aspect ratio, viewpoint, framing, placement, negative space].
SCENE AND LIGHT: [location, materials, light direction, color].
TEXT: [exact words in quotes, role, placement, line count].
STYLE: [photorealistic or medium, lens feel, palette, texture].
CONSTRAINTS: [what to avoid and what must remain unchanged].
必要な項目だけ使い、うまくいかなかった部分があれば項目を追加します。
「stunning」「premium」「ultra-detailed」といった抽象的な形容詞より、具体的な視覚情報のほうが効きます。「カメラ左側から差し込む柔らかな窓光」「マットな陶器」「50mmらしい描写」「右上3分の1は余白」と書けば、GPT Image 2が処理すべき判断を明確にできます。
文字を正しく出すなら、単語ではなくレイアウトまで指定する
見出し、ラベル、看板、インターフェースなど、画像内に文字を入れたいときはGPT Image 2を試す価値があります。文言は短くし、重要なテキストは引用符で囲み、役割を示したうえで、一字一句そのまま出すよう指定しましょう。余計な文字を禁止することも重要です。
次のような型が使えます。
TEXT: Main headline reads exactly "NIGHT MARKET".
ROLE: Large condensed sans-serif headline across the upper-left.
LAYOUT: One line, white lettering, high contrast, centered vertically in its zone.
CONSTRAINTS: Render the quoted text verbatim. No extra words, duplicate text, logos, or watermark.
複数のテキストブロックがある場合は、それぞれを別の行で指定します。ポスターなら、すべての文言を一文に詰め込むのではなく、「headline」「subhead」「footer」のように役割ごとに分けます。多言語の画像では、言語を明記し、翻訳させるのではなく正確な文字列をそのまま貼り付けてください。
綴りの正確さが重要な場合は、文言を短くします。同じ文字列で何度も失敗するなら、そこだけを切り出し、次の試行ではその変数だけを変えてみましょう。
| 症状 | 考えられる原因 | 対処法 |
|---|---|---|
| 単語の綴りが間違っている | 文言が長い、または独立して指定されていない | 文字列を短くし、引用符で囲み、役割を明示する |
| 余計な文字が入る | レイアウト上のテキスト範囲が定義されていない | 「余計な文字は入れない」と書き、テキストブロック数を制限する |
| 一部の行が抜ける | 配置や行数が曖昧 | 配置する領域と行数を指定する |
ラベル、価格、URL、UIの操作部品は、必ず実寸で確認してください。法的表記や納品用のタイポグラフィは、最後にデザインツールで仕上げるのが安全です。
複数の参照画像と部分編集の進め方
参照画像にはそれぞれ役割を与え、何を取り入れ、何を無視するのかを明記します。falのGPT Image 2ガイドによると、編集ワークフローでは最大16枚の参照画像を受け付けられます。ただし、実際の上限は利用しているプロバイダーの画面やAPIで確認してください(fal guide)。
REFERENCE ROLES:
Image 1: base portrait. Preserve the face, pose, body proportions, framing, and background.
Image 2: jacket reference. Copy only the jacket cut, fabric, and color.
Image 3: boots reference. Copy only the boot shape and material.
CHANGE: Dress the person in Image 1 using the jacket from Image 2 and boots from Image 3.
PRESERVE: Face, hairstyle, hands, pose, camera angle, lighting, and body proportions.
CONSTRAINTS: No extra accessories, logos, or redesigned clothing.
部分編集では、対象となる領域と変更内容を1つずつ指定します。マスクに対応しているなら対象範囲をマスクし、その部分だけを変更するようGPT Image 2に伝えます。マスクを使えない場合は、「右上の看板」「左側の赤いカップ」のように位置関係を言葉で指定します。追加の編集を行うときも、保持する要素のリストを毎回繰り返してください。
CHANGE ONLY: Replace the red sign in the upper-right with a blank cream sign.
PRESERVE: Building geometry, window reflections, people, shadows, camera angle, and color balance.
DO NOT: Recompose the storefront or add new text.
実用的な反復手順は、「生成する」「最大のエラーを1つ特定する」「変数を1つだけ変える」「それ以外の指示は維持する」です。編集によって不要なディテールが増えた場合は、対象を変える前に保持リストを強化しましょう。
GPT Image 2にリクエストを拒否されたときの対処
禁止されている内容を婉曲表現やロールプレイで隠したり、安全機能を無視するよう指示したりしてはいけません。リスクのある要素を取り除くか、正当な制作意図が伝わる形に組み替えます。
| 依頼に含まれるもの | 安全性を高めた指示 |
|---|---|
| 性的な裸体表現、または年齢がはっきりしない人物 | 通常の非露出的な服装を着た成人にする。関係する場合は年齢を明確にする |
| 存命人物の肖像を使ったセンシティブまたは欺瞞的な場面 | 個人を特定できない特徴を持つ架空の成人キャラクターにする |
| 著作権のあるキャラクターやブランドのアイデンティティ | ロゴや商標名を使わず、一般的な外見上の特徴でオリジナルキャラクターを説明する |
| 生々しい負傷描写や性的暴力 | 非グラフィックな事後描写、象徴的な表現、または中立的なドキュメンタリー調の場面にする |
| モデレーションを回避するための指示 | 意図する場面を、ポリシーに沿った直接的な表現で説明する |
無害な依頼までブロックされた場合は、内容を簡略化し、不要なセンシティブ表現を削ります。たとえば「この人物を裸に見せて」ではなく、「ポーズと照明は維持したまま、服装を無地の長袖シャツとズボンに変えて」と指定します。それでも拒否されるなら、サービスのサポート窓口やポリシーに関する問い合わせ手段を利用してください。どんなプロンプトでも承認を保証できるわけではありません。
GPT Image 2とNano Banana 2:特別な構文ではなく、2つのプロンプト習慣
ラベル付きの行やJSON風のブロックは、整理のための書式にすぎず、特別な構文ではありません。OpenAIのCookbookでは、最小限のプロンプト、説明文、ラベル付きのセクション、JSON風の構造など、意図と制約が明確であればさまざまな書き方が使われています(OpenAI Cookbook)。GoogleのNano Bananaガイドも、被写体、動作、コンテキスト、構図、スタイル、参照画像同士の関係を自然言語で指定する方法を採用しています(Google DeepMind prompt guide)。
実際に使い分けるときの違いは、次のように整理できます。
| 用途 | GPT Image 2での習慣 | Nano Banana 2での習慣 |
|---|---|---|
| 新規のフォトリアル画像 | ラベル付きのクリエイティブブリーフを使い、リアルさが目的ならphotorealisticと明記する | 被写体、動作、コンテキスト、構図、スタイルから書き始める |
| 複数の参照画像 | 画像ごとに役割を割り当て、保持する不変条件を列挙する | 各参照画像と新しいシーンの関係を説明する |
| 部分編集 | 「Xだけを変更し、Yを保持」と書き、可能ならマスクを使う | 編集内容と保持するルールを自然な文章で指定する |
| 反復作業 | 変数を1つだけ変え、保持リストを繰り返す | 参照画像の識別情報を維持しながら、会話形式で調整する |
実務上の違いは、重視するワークフローにあります。文字入り画像や構造化した指示ならGPT Image 2から始め、参照画像への忠実さを最優先するならNano Banana 2を試す、というのが出発点です。これはベンチマーク結果ではなく、あくまで使い始める際の目安です。
用途別のプロンプト例
フォトリアルな商品画像
Create a 4:5 ecommerce hero image of a matte navy ceramic mug on a pale stone surface. Three-quarter view, mug in the lower-right third, empty upper-left for copy. Softbox from upper left, gentle fill from the right, photorealistic product photography, 50mm feel. Preserve the mug’s cylindrical shape and cream handle. No text, logo, watermark, extra products, or hands.
文字量の多いポスター
Create a vertical 9:16 event poster. A lone figure stands on an empty street under one warm lamp at twilight. Main headline reads exactly "THE NIGHT BEGINS AT EIGHT" in large gold serif type across the lower third. Subhead reads exactly "A STORY ABOUT WAITING" beneath it in small white sans serif. Two text lines only; render both verbatim. No extra text, QR code, logo, or watermark.
背景だけを編集する
Change only the background to a quiet beach at sunset. Preserve the person’s face, hair, clothing, pose, expression, camera angle, subject lighting, and framing. Match the new background perspective to the original image. Do not add people, text, logos, or extra objects.
参照画像を使った服装編集
Image 1 is the base person. Image 2 is the clothing reference. Replace only the outfit using Image 2’s jacket color, cut, and fabric. Preserve Image 1’s face, hair, body proportions, hands, pose, background, lighting, and framing. Add no jewelry, text, or logos.
FAQ
GPT Image 2のプロンプトはどのくらい長くすべきですか?
決まった文字数はありません。成果物、被写体、構図、正確なテキスト、制約を指定できる長さがあれば十分です。視覚的な判断に何も影響しない文は削りましょう。
GPT Image 2では何枚の参照画像を使えますか?
falのガイドでは、GPT Image 2の編集で最大16枚の参照画像を利用できるとされています。ただし、プロバイダーによって上限は異なる場合があります。呼び出しているエンドポイントを確認し、各画像に明確な役割を割り当ててください。
安全な依頼なのにGPT Image 2に拒否された場合はどうすればいいですか?
曖昧なセンシティブ表現を取り除き、正当なビジュアル上の目的を直接説明します。架空の人物や個人を特定できない対象に置き換えるのも有効です。安全機能を回避するよう求めてはいけません。
実際の使い分け
生成前に、正確なテキスト、被写体の同一性、保持する領域、追加したくない要素の4点を確認しましょう。そのうえで構造化したブリーフを1つ作り、重要な部分を固定しながら、1回の修正で変える変数は1つに絞ります。
モデルのAPI提供状況や現在の価格については、GPT Image 2 API pricingをご覧ください。プロンプトではなくモデル選びを比較したい場合は、GPT Image 2 vs Nano Bananaを参照してください。