Промпт для GPT Image 2 лучше составлять как рабочее ТЗ, а не как набор эффектных прилагательных.
Рабочая структура промпта для GPT Image 2
Сначала опишите итоговый объект, затем — главный объект или сцену, композицию, окружение, текст, стиль и ограничения. В OpenAI Cookbook рекомендуют последовательно указывать сцену, объект, ключевые детали и ограничения. Для сложных запросов удобно использовать и отдельные размеченные блоки.
TASK: Create a [poster / product photo / UI mockup / editorial image].
SUBJECT: [the person, object, or scene that must remain accurate].
COMPOSITION: [aspect ratio, viewpoint, framing, placement, negative space].
SCENE AND LIGHT: [location, materials, light direction, color].
TEXT: [exact words in quotes, role, placement, line count].
STYLE: [photorealistic or medium, lens feel, palette, texture].
CONSTRAINTS: [what to avoid and what must remain unchanged].
Используйте только те поля, которые нужны для конкретной задачи. Если результат получается нестабильным, добавляйте новые уточнения.
Конкретные визуальные параметры работают лучше, чем слова вроде «потрясающий», «премиальный» или «ультрадетализированный». Формулировка «мягкий свет из окна слева от камеры, матовая керамика, ощущение объектива 50 мм, свободная верхняя правая треть» дает GPT Image 2 понятные решения, которые можно воплотить в изображении.
Текст на изображении: описывайте не только слова, но и макет
GPT Image 2 стоит протестировать, если на изображении должны быть заголовок, этикетка, вывеска или элементы интерфейса. Делайте текст коротким, заключайте ключевые фрагменты в кавычки, указывайте их назначение и требуйте воспроизвести их дословно — без лишних слов.
Используйте такую структуру:
TEXT: Main headline reads exactly "NIGHT MARKET".
ROLE: Large condensed sans-serif headline across the upper-left.
LAYOUT: One line, white lettering, high contrast, centered vertically in its zone.
CONSTRAINTS: Render the quoted text verbatim. No extra words, duplicate text, logos, or watermark.
Если текстовых блоков несколько, выделяйте каждый отдельной строкой. В промпте для постера лучше отдельно назвать «заголовок», «подзаголовок» и «нижнюю строку», чем описывать весь текст одним предложением. Для многоязычных макетов указывайте язык каждого блока и вставляйте точные символы — не просите модель переводить их самостоятельно.
Когда важна точность написания, держите строки короткими. Если конкретная фраза снова и снова генерируется с ошибками, вынесите ее в отдельный запрос и на следующей итерации меняйте только эту переменную.
| Проблема | Вероятная причина | Что сделать |
|---|---|---|
| Слово написано с ошибкой | Текст слишком длинный или не выделен отдельно | Сократите строку, заключите ее в кавычки и укажите ее назначение |
| Появились лишние слова | Для текста не задана четкая граница | Напишите «без дополнительного текста» и ограничьте число текстовых блоков |
| Пропущена строка | Неясны ее положение или количество строк | Укажите зону размещения и число строк |
Проверяйте каждую подпись, цену, URL и элемент интерфейса в полном размере. Финальную юридическую и производственную типографику лучше доводить в графическом редакторе.
Несколько референсов и локальное редактирование
Для каждого референса указывайте отдельную роль: что именно нужно взять из изображения, а что следует проигнорировать. В руководстве fal говорится, что режим редактирования GPT Image 2 может принимать до 16 референсных изображений; проверьте это ограничение в интерфейсе или API своего провайдера (руководство fal).
REFERENCE ROLES:
Image 1: base portrait. Preserve the face, pose, body proportions, framing, and background.
Image 2: jacket reference. Copy only the jacket cut, fabric, and color.
Image 3: boots reference. Copy only the boot shape and material.
CHANGE: Dress the person in Image 1 using the jacket from Image 2 and boots from Image 3.
PRESERVE: Face, hairstyle, hands, pose, camera angle, lighting, and body proportions.
CONSTRAINTS: No extra accessories, logos, or redesigned clothing.
Для локальной правки описывайте одну целевую область и одну операцию. Если инструмент поддерживает маску, выделите нужную зону и попросите GPT Image 2 изменить только ее. Без маски используйте пространственные ориентиры: например, «вывеска в правом верхнем углу» или «красная чашка слева». В каждом последующем запросе повторяйте список того, что должно остаться неизменным.
CHANGE ONLY: Replace the red sign in the upper-right with a blank cream sign.
PRESERVE: Building geometry, window reflections, people, shadows, camera angle, and color balance.
DO NOT: Recompose the storefront or add new text.
Полезный цикл выглядит так: сгенерировать изображение, найти одну самую заметную ошибку, изменить одну переменную и оставить остальную часть ТЗ без изменений. Если при правке модель начинает выдумывать детали, сначала расширьте список сохраняемых элементов, а уже потом уточняйте целевую правку.
Что делать, если GPT Image 2 отклоняет запрос
Не пытайтесь замаскировать запрещенный запрос эвфемизмами, ролевой игрой или инструкциями игнорировать защитные ограничения. Уберите рискованный элемент либо переформулируйте легитимную творческую задачу.
| Если в запросе есть… | Сформулируйте задачу безопаснее… |
|---|---|
| Сексуализированная нагота или человек с неоднозначным возрастом | Опишите взрослого персонажа в обычной, не откровенной одежде; если это важно, явно укажите возраст |
| Сходство с живым человеком в чувствительной или вводящей в заблуждение сцене | Используйте вымышленного взрослого персонажа с неидентифицирующими чертами |
| Персонаж, защищенный авторским правом, или фирменная айдентика | Создайте оригинального персонажа по общим визуальным признакам, без логотипов и названий товарных знаков |
| Изображение тяжелых травм или сексуальное насилие | Покажите не графичные последствия, используйте символический рассказ или нейтральную документальную сцену |
| Инструкции по обходу модерации | Дайте прямое описание нужной сцены, соответствующее правилам |
Если безобидный запрос заблокирован, упростите его и уберите необязательные чувствительные формулировки. Например, вместо «сделай этого человека обнаженным» напишите: «замени одежду на простую рубашку с длинными рукавами и брюки», сохранив позу и освещение. Если платформа все равно отказывает, обратитесь в ее поддержку или воспользуйтесь предусмотренным каналом для вопросов о правилах — ни один промпт не гарантирует одобрение.
GPT Image 2 и Nano Banana 2: разные рабочие привычки, а не магический синтаксис
Размеченные строки и блоки в стиле JSON — это просто удобный способ организовать запрос, а не особый синтаксис. В OpenAI Cookbook допускаются короткие промпты, описательные абзацы, размеченные секции и JSON-подобные структуры — при условии, что намерение и ограничения остаются понятными. В руководстве Google для Nano Banana также используется обычный естественный язык: объект, действие, контекст, композиция, стиль и явные связи между референсами (руководство Google DeepMind по промптам).
Практическая разница проявляется в рабочем процессе:
| Задача | Подход в GPT Image 2 | Подход в Nano Banana 2 |
|---|---|---|
| Новая фотореалистичная сцена | Используйте размеченное творческое ТЗ и добавляйте photorealistic, если нужен реалистичный результат | Начните с объекта, действия, контекста, композиции и стиля |
| Несколько референсов | Назначьте каждому изображению роль и перечислите неизменяемые элементы | Опишите связь каждого референса с новой сценой |
| Локальная правка | Используйте формулу «изменить только X; сохранить Y» и применяйте маску, если она доступна | Опишите правку и правила сохранения обычным естественным языком |
| Итерации | Меняйте одну переменную и повторяйте список сохраняемых элементов | Итерируйте в диалоге, каждый раз называя референсы и их роли |
На практике GPT Image 2 логично начать использовать для изображений с текстом и структурированных ТЗ, а Nano Banana 2 протестировать, если на первом месте стоит точность работы с референсами. Это стартовая эвристика, а не результат сравнительного теста.
Готовые шаблоны промптов под разные задачи
Фотореалистичное изображение товара
Create a 4:5 ecommerce hero image of a matte navy ceramic mug on a pale stone surface. Three-quarter view, mug in the lower-right third, empty upper-left for copy. Softbox from upper left, gentle fill from the right, photorealistic product photography, 50mm feel. Preserve the mug’s cylindrical shape and cream handle. No text, logo, watermark, extra products, or hands.
Постер с большим количеством текста
Create a vertical 9:16 event poster. A lone figure stands on an empty street under one warm lamp at twilight. Main headline reads exactly "THE NIGHT BEGINS AT EIGHT" in large gold serif type across the lower third. Subhead reads exactly "A STORY ABOUT WAITING" beneath it in small white sans serif. Two text lines only; render both verbatim. No extra text, QR code, logo, or watermark.
Локальная замена фона
Change only the background to a quiet beach at sunset. Preserve the person’s face, hair, clothing, pose, expression, camera angle, subject lighting, and framing. Match the new background perspective to the original image. Do not add people, text, logos, or extra objects.
Замена одежды по референсу
Image 1 is the base person. Image 2 is the clothing reference. Replace only the outfit using Image 2’s jacket color, cut, and fabric. Preserve Image 1’s face, hair, body proportions, hands, pose, background, lighting, and framing. Add no jewelry, text, or logos.
Частые вопросы
Каким по длине должен быть промпт для GPT Image 2?
Фиксированного лимита по количеству слов нет. Хороший промпт достаточно подробен, чтобы задать итоговый объект, главный объект, композицию, точный текст и ограничения. Любое предложение, которое не добавляет нового визуального решения, можно удалить.
Сколько референсных изображений может использовать GPT Image 2?
В руководстве fal указано, что режим редактирования GPT Image 2 поддерживает до 16 референсных изображений, однако ограничения у разных провайдеров могут отличаться. Проверьте используемый endpoint и назначьте каждому изображению понятную роль.
Что делать, если GPT Image 2 отклоняет безопасный запрос?
Уберите неоднозначные чувствительные детали, прямо опишите легитимную визуальную задачу и попробуйте использовать вымышленного или неидентифицируемого персонажа. Не просите модель обходить защитные ограничения.
Практический выбор
Перед генерацией проверьте четыре пункта: точность текста, идентичность объекта, области, которые нужно сохранить, и нежелательные добавления. Затем составьте одно структурированное ТЗ, зафиксируйте важные элементы и меняйте по одной переменной за раз.
Информацию о доступности модели через API и актуальной стоимости смотрите в материале GPT Image 2 API pricing. Если нужно выбрать модель, а не разобраться с промптами, пригодится сравнение GPT Image 2 vs Nano Banana.