AIREITER

GPT Image 2 提示詞指南:文字、局部編修與參考圖

最近更新: 2026-09-29 01:58:40

別把 GPT Image 2 的提示詞寫成形容詞清單;把它當成一份交給製作團隊的視覺 brief。

GPT Image 2 最實用的提示詞格式

先說明要完成什麼成品,再依序交代主體、構圖、場景、文字、風格與限制。OpenAI 的 Cookbook 建議按照場景、主體、關鍵細節與限制來組織內容;面對複雜需求時,也可以使用帶有標籤的區段(OpenAI Cookbook)。

TASK: Create a [poster / product photo / UI mockup / editorial image].
SUBJECT: [the person, object, or scene that must remain accurate].
COMPOSITION: [aspect ratio, viewpoint, framing, placement, negative space].
SCENE AND LIGHT: [location, materials, light direction, color].
TEXT: [exact words in quotes, role, placement, line count].
STYLE: [photorealistic or medium, lens feel, palette, texture].
CONSTRAINTS: [what to avoid and what must remain unchanged].

只使用這次工作需要的欄位;如果結果出現問題,再補上更具體的要求。

具體的視覺事實,永遠比「驚豔」「高級」或「極致細節」這類形容詞更有用。像是「從鏡頭左側照入的柔和窗光、霧面陶瓷、50mm 鏡頭感、右上三分之一留白」,才能讓 GPT Image 2 有明確、可執行的畫面決策。

文字生成:描述版面,不要只貼上文案

只要圖片裡需要出現標題、標籤、招牌或介面文字,GPT Image 2 就值得測試。文案要盡量精簡,把關鍵文字放進引號,說清楚它的用途,並要求逐字呈現、不得自行增加內容。

可以套用以下格式:

TEXT: Main headline reads exactly "NIGHT MARKET".
ROLE: Large condensed sans-serif headline across the upper-left.
LAYOUT: One line, white lettering, high contrast, centered vertically in its zone.
CONSTRAINTS: Render the quoted text verbatim. No extra words, duplicate text, logos, or watermark.

如果畫面裡有多個文字區塊,請替每個區塊各自列出一行。海報提示詞可以分成「headline」「subhead」與「footer」,不要把所有文案塞進同一句話。需要處理多語言時,標示每種語言,並直接貼上正確字元,不要只叫模型自行翻譯。

越在意拼字,就越應該縮短文案。如果某段文字一直生成錯誤,下一次只修改這個變數,先把其他設定維持不變。

問題症狀可能原因修正方式
單字拼錯文案太長,或沒有單獨隔離縮短文字、加上引號,並說明它的用途
多出額外文字版面沒有明確的文字邊界寫明「不得出現額外文字」,並限制文字區塊數量
少了一行位置或行數描述不清楚指定所在區域與文字行數

所有標籤、價格、URL 與介面控制項,都應放大檢查;法律文字或正式上線用的排版,最後仍應交給設計工具處理。

多張參考圖與局部編修

每張參考圖都要指定清楚的角色,說明要借用什麼、哪些內容要忽略。fal 的 GPT Image 2 指南指出,其編修流程最多可接受 16 張參考圖;實際限制仍應以你使用的服務介面或 API 為準(fal guide)。

REFERENCE ROLES:
Image 1: base portrait. Preserve the face, pose, body proportions, framing, and background.
Image 2: jacket reference. Copy only the jacket cut, fabric, and color.
Image 3: boots reference. Copy only the boot shape and material.

CHANGE: Dress the person in Image 1 using the jacket from Image 2 and boots from Image 3.
PRESERVE: Face, hairstyle, hands, pose, camera angle, lighting, and body proportions.
CONSTRAINTS: No extra accessories, logos, or redesigned clothing.

進行局部編修時,請明確指定一個目標區域與一個操作。如果工具支援遮罩,就把該區域遮起來,並告訴 GPT Image 2 只能修改那一塊。沒有遮罩時,改用空間描述,例如「右上方的招牌」或「左側的紅色杯子」。每次後續修改,都要再次列出需要保留的內容。

CHANGE ONLY: Replace the red sign in the upper-right with a blank cream sign.
PRESERVE: Building geometry, window reflections, people, shadows, camera angle, and color balance.
DO NOT: Recompose the storefront or add new text.

實用的反覆修正流程是:先生成,找出最大的單一錯誤,只改一個變數,其餘 brief 維持不變。如果編修結果自行捏造了細節,先加強保留清單,再去修改目標區域。

GPT Image 2 拒絕要求時,應該怎麼處理?

不要用委婉說法、角色扮演,或要求模型忽略安全機制來掩飾受限制的內容;應該移除高風險元素,或重新表達真正合法的創作目標。

如果要求包含……可以改用更安全的 brief……
性化裸露,或年齡不明的角色改成穿著一般、非露骨服裝的成年角色;必要時清楚寫明年齡
現實人物的肖像出現在敏感或欺騙性場景改用具備非識別性特徵的虛構成年角色
受版權保護的角色或品牌識別改為以一般視覺特徵描述原創角色,不使用商標或品牌名稱
血腥傷勢或性暴力改成非血腥的事後場景、象徵性敘事,或中性的紀錄片風格畫面
規避審查的指示直接、符合規範地描述想呈現的場景

如果無害的要求被擋下來,先簡化內容,刪掉不必要的敏感詞。例如,把「讓這個人看起來裸體」改成「把服裝改成樸素的長袖上衣與長褲」,同時保留姿勢與光線。如果平台仍然拒絕,就改走客服或政策申訴管道;沒有任何提示詞能保證一定獲得批准。

GPT Image 2 與 Nano Banana 2:是兩種提示習慣,不是神奇語法

帶標籤的行列或類 JSON 區塊只是整理資訊的方式,不是特殊語法。只要意圖與限制清楚,OpenAI 的 Cookbook 接受簡短提示詞、描述性段落、帶標籤的區段,以及類 JSON 結構(OpenAI Cookbook)。Google 的 Nano Banana 指南同樣採用一般自然語言,涵蓋主體、動作、情境、構圖、風格,以及參考圖之間的明確關係(Google DeepMind prompt guide)。

實際上,兩者的差異在於工作方式:

工作GPT Image 2 的做法Nano Banana 2 的做法
生成全新的寫實圖片使用帶標籤的創作 brief;如果目標是寫實效果,明確寫上 photorealistic從主體、動作、情境、構圖與風格開始描述
使用多張參考圖替每張圖片指定角色,並列出必須保留的不變項說明每張參考圖與新場景之間的關係
局部編修寫明「只修改 X;保留 Y」,可用遮罩時就使用遮罩以自然語言說清楚編修內容與保留規則
反覆修正每次只改一個變數,並重複保留清單以對話方式逐步修改,同時持續標示參考圖身分

實務上的區別在於工作重點:需要處理圖片文字或結構化 brief 時,可以先從 GPT Image 2 開始;如果最在意參考圖的還原度,則可以測試 Nano Banana 2。這只是起始判斷,不是基準測試結果。

依工作類型套用的提示詞範本

寫實產品圖片

Create a 4:5 ecommerce hero image of a matte navy ceramic mug on a pale stone surface. Three-quarter view, mug in the lower-right third, empty upper-left for copy. Softbox from upper left, gentle fill from the right, photorealistic product photography, 50mm feel. Preserve the mug’s cylindrical shape and cream handle. No text, logo, watermark, extra products, or hands.

文字資訊量高的海報

Create a vertical 9:16 event poster. A lone figure stands on an empty street under one warm lamp at twilight. Main headline reads exactly "THE NIGHT BEGINS AT EIGHT" in large gold serif type across the lower third. Subhead reads exactly "A STORY ABOUT WAITING" beneath it in small white sans serif. Two text lines only; render both verbatim. No extra text, QR code, logo, or watermark.

局部背景編修

Change only the background to a quiet beach at sunset. Preserve the person’s face, hair, clothing, pose, expression, camera angle, subject lighting, and framing. Match the new background perspective to the original image. Do not add people, text, logos, or extra objects.

以參考圖為基礎的服裝編修

Image 1 is the base person. Image 2 is the clothing reference. Replace only the outfit using Image 2’s jacket color, cut, and fabric. Preserve Image 1’s face, hair, body proportions, hands, pose, background, lighting, and framing. Add no jewelry, text, or logos.

常見問題

GPT Image 2 的提示詞應該寫多長?

沒有固定字數。實用的提示詞只要足以交代成品、主體、構圖、精確文字與限制即可;任何沒有帶來視覺決策的句子,都可以刪掉。

GPT Image 2 可以使用多少張參考圖?

fal 指南表示,GPT Image 2 的編修最多可接受 16 張參考圖,但不同服務商的限制可能不同。請確認你實際呼叫的端點,並替每張圖片指定清楚的角色。

如果 GPT Image 2 拒絕安全的要求,我該怎麼辦?

刪除含糊的敏感細節,直接描述合法的視覺目標,並改用虛構或不具識別性的主體。不要要求模型繞過安全機制。

實際該怎麼選

生成前先檢查四件事:文字是否正確、主體身分是否明確、哪些區域必須保留,以及哪些內容不應該出現。接著寫好一份結構化 brief,鎖定重要部分,再一次只修改一個變數。

如需查看模型的 API 可用性與目前價格,請參考 GPT Image 2 API pricing。如果你想比較的是模型選擇,而不是提示詞寫法,請參考 GPT Image 2 vs Nano Banana。