别把 GPT Image 2 的提示词写成形容词堆砌,而要把它当作一份制作需求 brief。
适用于 GPT Image 2 的提示词结构
先说明最终要生成的成品,再依次交代主体、构图、场景、文字、风格和限制条件。OpenAI Cookbook 建议按照场景、主体、关键细节、约束条件的顺序组织提示词;面对复杂需求时,也可以像其示例那样使用带标签的分段结构(OpenAI Cookbook)。
TASK: Create a [poster / product photo / UI mockup / editorial image].
SUBJECT: [the person, object, or scene that must remain accurate].
COMPOSITION: [aspect ratio, viewpoint, framing, placement, negative space].
SCENE AND LIGHT: [location, materials, light direction, color].
TEXT: [exact words in quotes, role, placement, line count].
STYLE: [photorealistic or medium, lens feel, palette, texture].
CONSTRAINTS: [what to avoid and what must remain unchanged].
根据任务需要使用这些字段即可;如果某个环节反复出错,再补充对应说明。
相比“惊艳”“高级”或“超高细节”这类空泛形容词,具体的视觉事实更有用。“从镜头左侧照入的柔和窗光、哑光陶瓷、50mm 镜头观感、右上方三分之一留白”,才能真正给 GPT Image 2 提供可执行的决策。
让文字准确出现:描述版式,而不只是粘贴文案
当图片需要承载标题、标签、招牌或界面时,GPT Image 2 值得一试。文案尽量简短,把关键文字放进引号,说明它的用途,并明确要求逐字呈现、不得添加其他内容。
可以采用下面这种写法:
TEXT: Main headline reads exactly "NIGHT MARKET".
ROLE: Large condensed sans-serif headline across the upper-left.
LAYOUT: One line, white lettering, high contrast, centered vertically in its zone.
CONSTRAINTS: Render the quoted text verbatim. No extra words, duplicate text, logos, or watermark.
如果有多个文字区块,就分别为每个区块单独写一行。比如制作海报时,可以明确区分“主标题”“副标题”和“页脚”,不要把所有文案揉成一句话。制作多语言内容时,为每种语言标注清楚,并直接粘贴准确字符,不要让模型自行翻译。
拼写准确性很重要时,文案越短越好。如果某段文字总是生成错误,下一次只修改这一变量,先单独处理它。
| 现象 | 可能原因 | 解决方法 |
|---|---|---|
| 单词拼写错误 | 文案过长,或没有单独隔离 | 缩短文字、加引号,并说明它的用途 |
| 出现多余文字 | 没有明确文字边界 | 写明“不得添加其他文字”,并限制文字区块数量 |
| 缺少某一行 | 位置或行数描述不清 | 指定所在区域和文字行数 |
所有标签、价格、URL 和界面控件都要放大检查;涉及法律或正式生产的排版,最后仍应交给设计工具完成。
多图参考与局部编辑怎么写
为每张参考图标明角色,并明确哪些内容需要借鉴、哪些内容必须忽略。fal 的 GPT Image 2 指南称,其编辑工作流最多可接收 16 张参考图;具体上限仍应以你所使用的服务商界面或 API 为准(fal guide)。
REFERENCE ROLES:
Image 1: base portrait. Preserve the face, pose, body proportions, framing, and background.
Image 2: jacket reference. Copy only the jacket cut, fabric, and color.
Image 3: boots reference. Copy only the boot shape and material.
CHANGE: Dress the person in Image 1 using the jacket from Image 2 and boots from Image 3.
PRESERVE: Face, hairstyle, hands, pose, camera angle, lighting, and body proportions.
CONSTRAINTS: No extra accessories, logos, or redesigned clothing.
做局部编辑时,最好只指定一个目标区域和一个操作。如果工具支持蒙版,就把蒙版限定在目标区域,并告诉 GPT Image 2 只能修改那里。没有蒙版时,可以使用空间描述,例如“右上角的招牌”或“左侧的红色杯子”。每次继续修改,都要重复列出需要保留的内容。
CHANGE ONLY: Replace the red sign in the upper-right with a blank cream sign.
PRESERVE: Building geometry, window reflections, people, shadows, camera angle, and color balance.
DO NOT: Recompose the storefront or add new text.
一个实用的迭代流程是:先生成,找出影响最大的单一问题,只改一个变量,其余 brief 保持不变。如果编辑结果凭空增加了细节,先加强保留清单,再去调整目标区域。
GPT Image 2 拒绝请求时怎么办
不要用委婉说法、角色扮演或“忽略安全规则”的指令来掩饰违规请求;应移除风险元素,或重新表达其中合理的创作目标。
| 如果请求包含…… | 可以改用这样的安全 brief…… |
|---|---|
| 性化裸露或年龄不明确的人物 | 改为穿着日常、非露骨服装的成年主体;在相关情况下明确年龄 |
| 现实人物的肖像被用于敏感或欺骗性场景 | 改为具备非识别性特征的虚构成年角色 |
| 受版权保护的角色或品牌身份 | 改为根据一般视觉特征描述的原创角色,不使用 logo 或商标名称 |
| 血腥伤害或性暴力 | 改为非血腥的事后场景、象征性叙事,或中性的纪录片风格场景 |
| 规避审核的指令 | 直接、合规地描述想要呈现的场景 |
如果一个本身无害的请求被拦截,可以先简化内容,删掉不必要的敏感词。比如把“让这个人看起来裸体”改成“把服装换成朴素的长袖衬衫和长裤”,同时保留姿势和光线。如果平台仍然拒绝,就走其支持或政策申诉渠道;没有任何提示词能够保证请求一定获批。
GPT Image 2 与 Nano Banana 2:是两种工作习惯,不是什么神奇语法
带标签的分行结构或类似 JSON 的区块只是整理信息的方式,并不是特殊语法。OpenAI Cookbook 支持简短提示词、描述性段落、带标签的分段,以及类似 JSON 的结构,前提是意图和约束条件足够清楚(OpenAI Cookbook)。Google 的 Nano Banana 指南同样采用普通自然语言,围绕主体、动作、情境、构图、风格,以及参考图之间的明确关系来组织内容(Google DeepMind prompt guide)。
真正有用的区别在于操作方式:
| 任务 | GPT Image 2 的写法 | Nano Banana 2 的写法 |
|---|---|---|
| 生成全新的写实图片 | 使用带标签的创意 brief;目标是写实时,明确写出 photorealistic | 从主体、动作、情境、构图和风格开始描述 |
| 使用多张参考图 | 为每张图分配角色,并列出必须保持不变的内容 | 说明每张参考图与新场景之间的关系 |
| 局部编辑 | 使用“只修改 X;保留 Y”的写法,并在可用时配合蒙版 | 用自然语言说明编辑内容和保留规则 |
| 反复迭代 | 一次只改一个变量,并重复保留清单 | 以对话方式逐步修改,同时持续点明参考图的身份 |
实际选择时,可以优先用 GPT Image 2 处理带文字的图片或结构化 brief;如果最看重参考图还原度,则可以测试 Nano Banana 2。这只是起步时的经验判断,并非基准测试结论。
按任务直接套用的提示词模板
写实产品图
Create a 4:5 ecommerce hero image of a matte navy ceramic mug on a pale stone surface. Three-quarter view, mug in the lower-right third, empty upper-left for copy. Softbox from upper left, gentle fill from the right, photorealistic product photography, 50mm feel. Preserve the mug’s cylindrical shape and cream handle. No text, logo, watermark, extra products, or hands.
文字密集型海报
Create a vertical 9:16 event poster. A lone figure stands on an empty street under one warm lamp at twilight. Main headline reads exactly "THE NIGHT BEGINS AT EIGHT" in large gold serif type across the lower third. Subhead reads exactly "A STORY ABOUT WAITING" beneath it in small white sans serif. Two text lines only; render both verbatim. No extra text, QR code, logo, or watermark.
局部背景替换
Change only the background to a quiet beach at sunset. Preserve the person’s face, hair, clothing, pose, expression, camera angle, subject lighting, and framing. Match the new background perspective to the original image. Do not add people, text, logos, or extra objects.
基于参考图的换装编辑
Image 1 is the base person. Image 2 is the clothing reference. Replace only the outfit using Image 2’s jacket color, cut, and fabric. Preserve Image 1’s face, hair, body proportions, hands, pose, background, lighting, and framing. Add no jewelry, text, or logos.
常见问题
GPT Image 2 的提示词应该多长?
没有固定字数。只要能交代清楚成品、主体、构图、准确文字和约束条件,就是一条有用的提示词;任何没有带来视觉决策的句子都可以删掉。
GPT Image 2 能使用多少张参考图?
fal 指南称,GPT Image 2 的编辑功能最多可以接收 16 张参考图,但不同服务商的限制可能不同。请确认所调用的接口,并为每张图片分配清晰的角色。
GPT Image 2 拒绝一个安全请求时该怎么办?
删掉含糊的敏感细节,直接描述合理的视觉目标,并尝试使用虚构或非识别性主体。不要要求模型绕过安全规则。
实际怎么选
生成前检查四件事:文字是否准确、主体身份是否明确、哪些区域必须保留,以及哪些内容不能出现。然后写好一份结构化 brief,锁定关键部分,每次只修改一个变量。
如需了解模型的 API 可用性和当前价格,请查看 GPT Image 2 API pricing。如果关注的是模型选择,而不是提示词写法,请参考 GPT Image 2 vs Nano Banana。