AIREITER

Guía de prompts para GPT Image 2: texto, ediciones y referencias

Última actualización: 2026-09-29 01:54:07

Piensa en el prompt de GPT Image 2 como un briefing de producción, no como una lista de adjetivos.

El formato de prompt que mejor funciona en GPT Image 2

Empieza por definir el resultado final y después concreta el sujeto, la composición, la escena, el texto, el estilo y las restricciones. El Cookbook de OpenAI recomienda mantener un orden coherente —escena, sujeto, detalles clave y restricciones—, aunque sus ejemplos también admiten secciones etiquetadas para solicitudes complejas (OpenAI Cookbook).

TASK: Create a [poster / product photo / UI mockup / editorial image].
SUBJECT: [the person, object, or scene that must remain accurate].
COMPOSITION: [aspect ratio, viewpoint, framing, placement, negative space].
SCENE AND LIGHT: [location, materials, light direction, color].
TEXT: [exact words in quotes, role, placement, line count].
STYLE: [photorealistic or medium, lens feel, palette, texture].
CONSTRAINTS: [what to avoid and what must remain unchanged].

Usa solo los apartados que necesite cada trabajo y añade otros cuando algo falle.

Los datos visuales concretos son más útiles que “impresionante”, “premium” o “ultradetallado”. “Luz suave de ventana desde la izquierda de la cámara, cerámica mate, sensación de objetivo de 50 mm, tercio superior derecho vacío” da a GPT Image 2 decisiones visuales que puede interpretar.

Texto en imágenes: describe la maquetación, no solo las palabras

GPT Image 2 merece la pena probarlo cuando una imagen tiene que incluir un titular, una etiqueta, un cartel o una interfaz. Mantén el texto breve, entrecomilla las partes importantes, indica qué función cumplen y exige que aparezcan literalmente, sin palabras adicionales.

Usa este patrón:

TEXT: Main headline reads exactly "NIGHT MARKET".
ROLE: Large condensed sans-serif headline across the upper-left.
LAYOUT: One line, white lettering, high contrast, centered vertically in its zone.
CONSTRAINTS: Render the quoted text verbatim. No extra words, duplicate text, logos, or watermark.

Si hay varios bloques, dedica una línea a cada uno. En un póster, por ejemplo, es mejor hablar de “titular”, “subtítulo” y “pie” que describir todo el texto en una sola frase. Para trabajos multilingües, indica el idioma de cada bloque y pega los caracteres exactos en lugar de pedir al modelo que los traduzca.

Cuando la ortografía sea importante, mantén el texto corto. Si una cadena falla repetidamente, aísla ese elemento y cambia únicamente esa variable en el siguiente intento.

SíntomaCausa probableSolución
Palabra mal escritaEl texto es demasiado largo o no está aisladoAcorta la cadena, entrecomíllala e indica su función
Aparecen palabras adicionalesLa maquetación no delimita el textoIndica “sin texto adicional” y limita el número de bloques de texto
Falta una líneaNo se ha definido bien la posición o el número de líneasEspecifica la zona y el número de líneas

Revisa a tamaño completo todas las etiquetas, precios, URL y controles de la interfaz; deja la tipografía legal o de producción para una herramienta de diseño.

Referencias de varias imágenes y ediciones locales

Asigna a cada imagen de referencia una función clara: indica qué debe tomar de ella el modelo y qué debe ignorar. La guía de GPT Image 2 de fal afirma que su flujo de edición admite hasta 16 imágenes de referencia; comprueba el límite en la interfaz o la API de tu proveedor (guía de fal).

REFERENCE ROLES:
Image 1: base portrait. Preserve the face, pose, body proportions, framing, and background.
Image 2: jacket reference. Copy only the jacket cut, fabric, and color.
Image 3: boots reference. Copy only the boot shape and material.

CHANGE: Dress the person in Image 1 using the jacket from Image 2 and boots from Image 3.
PRESERVE: Face, hairstyle, hands, pose, camera angle, lighting, and body proportions.
CONSTRAINTS: No extra accessories, logos, or redesigned clothing.

Para una edición local, describe una sola región objetivo y una sola operación. Si la herramienta admite máscara, delimita la zona y dile a GPT Image 2 que modifique únicamente esa región. Sin máscara, utiliza referencias espaciales como “el cartel de la esquina superior derecha” o “el vaso rojo del lado izquierdo”. Repite la lista de elementos que deben conservarse en cada prompt de seguimiento.

CHANGE ONLY: Replace the red sign in the upper-right with a blank cream sign.
PRESERVE: Building geometry, window reflections, people, shadows, camera angle, and color balance.
DO NOT: Recompose the storefront or add new text.

Un ciclo de iteración útil es sencillo: genera la imagen, identifica el error más importante, cambia una sola variable y mantén intacto el resto del briefing. Si una edición inventa detalles, refuerza primero la lista de elementos que deben conservarse antes de modificar el objetivo.

Qué hacer cuando GPT Image 2 rechaza una solicitud

No intentes camuflar una solicitud prohibida con eufemismos, juegos de rol o instrucciones para ignorar las medidas de seguridad. Elimina el elemento de riesgo o replantea el objetivo creativo legítimo.

Si la solicitud incluye…Usa un briefing más seguro…
Desnudez sexualizada o una persona de edad ambiguaUn adulto con ropa corriente y no explícita; indica claramente la edad cuando sea relevante
La imagen de una persona viva en una escena sensible o engañosaUn personaje adulto ficticio con rasgos no identificables
Un personaje protegido por derechos de autor o una identidad de marcaUn personaje original descrito mediante rasgos visuales generales, sin logotipos ni nombres de marca registrados
Lesiones gráficas o violencia sexualConsecuencias no gráficas, narrativa simbólica o una escena documental neutra
Instrucciones para esquivar la moderaciónUna descripción directa de la escena que cumpla las políticas

Si se bloquea una solicitud inofensiva, simplifícala y elimina los términos sensibles que no sean necesarios. Por ejemplo, cambia “haz que esta persona parezca desnuda” por “cambia el vestuario por una camisa lisa de manga larga y pantalones”, manteniendo la pose y la iluminación. Si la plataforma sigue rechazándola, recurre a su canal de soporte o de consultas sobre políticas; ningún prompt puede garantizar la aprobación.

GPT Image 2 y Nano Banana 2: dos formas de trabajar, no una sintaxis mágica

Las líneas etiquetadas o los bloques similares a JSON son organizadores opcionales, no una sintaxis especial. El Cookbook de OpenAI admite prompts mínimos, párrafos descriptivos, secciones etiquetadas y estructuras similares a JSON siempre que la intención y las restricciones estén claras (OpenAI Cookbook). La guía de Nano Banana de Google también apuesta por el lenguaje natural: sujeto, acción, contexto, composición, estilo y relaciones explícitas entre las imágenes de referencia (guía de prompts de Google DeepMind).

La diferencia útil está en la forma de trabajar:

TrabajoEnfoque con GPT Image 2Enfoque con Nano Banana 2
Imagen fotorrealista nuevaUsa un briefing creativo etiquetado e indica photorealistic cuando busques realismoEmpieza por el sujeto, la acción, el contexto, la composición y el estilo
Varias referenciasAsigna una función a cada imagen y enumera los elementos que deben conservarseExplica la relación entre cada referencia y la nueva escena
Edición local“Cambia solo X; conserva Y” y usa una máscara cuando esté disponibleIndica la edición y las reglas de conservación en lenguaje natural
IteraciónCambia una variable y repite la lista de elementos que deben conservarseItera de forma conversacional, manteniendo identificadas las referencias

La diferencia práctica está en el énfasis del flujo de trabajo: empieza con GPT Image 2 cuando el texto integrado o la estructura del briefing sean prioritarios, y prueba Nano Banana 2 cuando la fidelidad a las referencias sea tu principal preocupación. Es una heurística inicial, no un resultado de benchmark.

Patrones de prompt según el trabajo

Imagen fotorrealista de producto

Create a 4:5 ecommerce hero image of a matte navy ceramic mug on a pale stone surface. Three-quarter view, mug in the lower-right third, empty upper-left for copy. Softbox from upper left, gentle fill from the right, photorealistic product photography, 50mm feel. Preserve the mug’s cylindrical shape and cream handle. No text, logo, watermark, extra products, or hands.

Póster con mucho texto

Create a vertical 9:16 event poster. A lone figure stands on an empty street under one warm lamp at twilight. Main headline reads exactly "THE NIGHT BEGINS AT EIGHT" in large gold serif type across the lower third. Subhead reads exactly "A STORY ABOUT WAITING" beneath it in small white sans serif. Two text lines only; render both verbatim. No extra text, QR code, logo, or watermark.

Edición local del fondo

Change only the background to a quiet beach at sunset. Preserve the person’s face, hair, clothing, pose, expression, camera angle, subject lighting, and framing. Match the new background perspective to the original image. Do not add people, text, logos, or extra objects.

Edición de vestuario basada en referencias

Image 1 is the base person. Image 2 is the clothing reference. Replace only the outfit using Image 2’s jacket color, cut, and fabric. Preserve Image 1’s face, hair, body proportions, hands, pose, background, lighting, and framing. Add no jewelry, text, or logos.

Preguntas frecuentes

¿Cuánto debe durar un prompt para GPT Image 2?

No existe un número fijo de palabras. Un prompt útil debe ser lo bastante largo para definir el resultado, el sujeto, la composición, el texto exacto y las restricciones; elimina cualquier frase que no aporte una decisión visual.

¿Cuántas imágenes de referencia puede usar GPT Image 2?

La guía de fal afirma que las ediciones de GPT Image 2 pueden aceptar hasta 16 imágenes de referencia, aunque los límites pueden variar según el proveedor. Comprueba el endpoint que estás utilizando y asigna una función clara a cada imagen.

¿Qué hago si GPT Image 2 rechaza una solicitud segura?

Elimina los detalles sensibles o ambiguos, describe directamente el objetivo visual legítimo y prueba con un sujeto ficticio o no identificable. No pidas al modelo que evite las medidas de seguridad.

La elección práctica

Antes de generar, comprueba cuatro aspectos: el texto exacto, la identidad del sujeto, las zonas que deben conservarse y los elementos no deseados. Después, redacta un briefing estructurado, fija las partes importantes y revisa una sola variable cada vez.

Para consultar la disponibilidad de la API y los precios actuales del modelo, visita precios de la API de GPT Image 2. Si lo que necesitas es elegir modelo y no mejorar el prompt, consulta GPT Image 2 frente a Nano Banana.