Que los modelos de imagen con IA ya saben escribir es una afirmación bastante extendida. También es, en muchos casos, demasiado optimista. Para comprobar qué hay de cierto, sometí GPT Image 2, Nano Banana 2, Nano Banana Pro y Seedream 5 Pro a dos prompts idénticos: un envase con cuatro zonas de texto y una interfaz con seis etiquetas. El resultado rápido: GPT Image 2 fue el único capaz de mantener limpios los cuatro bloques de texto en una sola generación, aunque no es la mejor elección para todos los trabajos.
La prueba: cuatro modelos ante texto de verdad
Evaluar la renderización de texto con un prompt de una sola palabra no sirve de mucho. Un modelo puede acertar con "HELLO" en un cartel y venirse abajo ante una etiqueta de producto con cuatro áreas de texto independientes. Por eso preparé dos prompts diseñados para poner a prueba el problema que realmente importa en producción: varios bloques de texto, de distintos tamaños, dentro de una misma imagen.
Prueba 1 — Envase de café: "PREMIUM ROAST" (título grande), "Single Origin Colombia" (subtítulo), "340g / 12 oz" (texto pequeño) y "Ethically Sourced Since 2019" (eslogan). Cuatro zonas de texto diferenciadas en un único producto.
Prueba 2 — UI móvil de inicio de sesión: "Welcome Back" (encabezado), "Sign in to your account" (texto secundario), "Email Address" y "Password" (etiquetas de campo), "Sign In" (botón), además de "Forgot your password?" y "Don't have an account? Sign Up" (texto del pie). En total, seis elementos de texto separados.
Ejecuté cada prompt una vez por modelo a 1024×1024, o su equivalente, sin seleccionar los mejores resultados. Las imágenes de abajo son las primeras generaciones, no la mejor de cinco intentos.
Modelos analizados:
| Modelo | Desarrollador | Identificador de API |
|---|---|---|
| GPT Image 2 | OpenAI | gpt-image-2 |
| Nano Banana 2 | Google DeepMind | gemini-3.1-flash-image |
| Nano Banana Pro | Google DeepMind | gemini-3-pro-image |
| Seedream 5 Pro | ByteDance | seedream-v5-pro |
También comprobé Ideogram V3 y FLUX.2 con estos mismos prompts a través de sus respectivas API. Sus resultados aparecen en la sección de recomendaciones, pero no incluí imágenes completas de prueba porque no están disponibles en la plataforma de AIReiter.
Texto en envases: la prueba de cuatro zonas
El prompt de la bolsa de café exige cuatro bloques de texto en tamaños distintos. Es justo el tipo de escenario que separa a los modelos que realmente renderizan texto de aquellos que simplemente aciertan alguna palabra aislada.
GPT Image 2 reprodujo correctamente los cuatro bloques. "PREMIUM ROAST" apareció en negrita y centrado; el subtítulo decía "Single Origin Colombia" sin una sola letra errónea; "340g / 12 oz" seguía siendo legible pese a su tamaño, y el eslogan estaba bien escrito. No inventó caracteres ni omitió ninguna zona.
Nano Banana 2 resolvió perfectamente el título y el subtítulo, pero perdió precisión en el texto pequeño. "340g" se generó bien; la parte de "12 oz" se mezcló con elementos del diseño circundante. El espaciado entre letras del eslogan tampoco fue consistente. A cambio, ofreció la mejor escena de los cuatro: la superficie de la mesa y la iluminación parecían más una fotografía de producto que un render.
Nano Banana Pro creó el diseño más llamativo visualmente, con una tipografía más trabajada y un aire editorial. El título quedó limpio, pero el subtítulo intercambió un carácter y el texto pequeño fue parcialmente inventado. Nano Banana Pro entiende el texto más como un recurso de diseño que como un objetivo de precisión.
Seedream 5 Pro acertó el título y el subtítulo, reprodujo el texto del peso casi por completo y cometió una falta en el eslogan. El modelo de ByteDance destaca especialmente con texto chino, algo que verifiqué con un prompt independiente de etiqueta en chino, pero con texto inglés repartido en varias zonas sigue un paso por detrás de GPT Image 2.
| Modelo | ¿Título correcto? | ¿Subtítulo correcto? | ¿Texto de peso correcto? | ¿Eslogan correcto? | ¿Las 4 zonas limpias? |
|---|---|---|---|---|---|
| GPT Image 2 | Sí | Sí | Sí | Sí | Sí |
| Nano Banana 2 | Sí | Sí | Parcial | Espaciado incorrecto | No |
| Nano Banana Pro | Sí | Carácter intercambiado | No | No | No |
| Seedream 5 Pro | Sí | Sí | Casi completo | 1 falta ortográfica | No |
Mockup de UI: seis etiquetas en una imagen
El prompt de la pantalla de inicio de sesión es más exigente que el del envase: requiere seis elementos de texto de diferentes tamaños, además de la estructura propia de una interfaz, con botones y campos de entrada. Aquí se evalúan tanto la precisión textual como la disciplina del diseño.
GPT Image 2 generó una pantalla de inicio de sesión reconocible con los seis elementos presentes y correctamente escritos. El texto del botón estaba centrado, las etiquetas de campo se situaban encima de las áreas de entrada y el texto del pie era legible. La composición no era perfecta al píxel, como sucede con cualquier UI generada por IA, pero cada texto se podía leer y estaba en su lugar.
Nano Banana 2 produjo una interfaz limpia, con el encabezado y el texto del botón correctos. Las etiquetas de campo estaban presentes, aunque "Password" tenía un leve problema de caracteres al examinarlo de cerca. El texto "Forgot your password?" se podía leer, pero la línea "Don't have an account? Sign Up" aparecía parcialmente cortada. El diseño general se sentía más moderno que el de GPT Image 2, pero el texto estaba menos completo.
Seedream 5 Pro generó una pantalla de aspecto funcional y una buena estructura de layout. El encabezado era correcto, pero las etiquetas de campo y el texto del pie mostraban desviaciones más importantes. El texto del botón quedó limpio. En conjunto, 4 de los 6 elementos de texto fueron totalmente precisos.
"Los modelos de imagen con IA todavía no pueden renderizar texto de forma fiable... necesitarás photoshop" — un usuario de r/StableDiffusion hablando de modelos locales, aunque la brecha entre los modelos locales y los de API se ha ampliado de forma notable en 2026
| Modelo | Encabezado | Texto secundario | Etiquetas de campo | Botón | Texto del pie | Puntuación (de 6) |
|---|---|---|---|---|---|---|
| GPT Image 2 | Sí | Sí | Sí | Sí | Sí | 6/6 |
| Nano Banana 2 | Sí | Sí | Parcial | Sí | Parcial | 4/6 |
| Seedream 5 Pro | Sí | Parcial | Parcial | Sí | Parcial | 3.5/6 |
Cuánto cuesta cada imagen cargada de texto
Las imágenes con mucho texto tienen un multiplicador de coste oculto: si la primera generación escribe algo mal, toca repetirla. Los precios de abajo corresponden al coste oficial de API por imagen individual, pero en trabajos donde el texto es crítico el coste práctico resulta de multiplicar esa cifra por el número de generaciones necesarias hasta conseguir texto limpio.
| Modelo | Coste a 1024×1024 | Coste a 2K+ | Precisión de texto al primer intento (nuestra prueba de 2 prompts) |
|---|---|---|---|
| GPT Image 2 | ~$0.020 (medium) | ~$0.067 (high, 2K) | Ambos prompts limpios al primer intento |
| Nano Banana 2 | ~$0.020 | ~$0.040 (4K) | Título/subtítulo limpios; el texto pequeño se desvió |
| Nano Banana Pro | ~$0.050 | ~$0.060 | Título limpio; 3 de 4 zonas tuvieron errores |
| Seedream 5 Pro | ~$0.035 | — | Título/subtítulo limpios; eslogan mal escrito |
Cuando la precisión del texto importa, el coste real de un modelo incluye las repeticiones. Una imagen de $0.020 que necesita tres regeneraciones para obtener texto limpio termina costando $0.060.
Fuentes: precios de la API de OpenAI (consultados en agosto de 2026), precios de la API de Google Gemini (consultados en agosto de 2026), página de precios de AIReiter.
La ventaja de coste de GPT Image 2 para trabajos de texto viene del ahorro en repeticiones. En nuestros dos prompts de prueba generó texto limpio a la primera, sin necesidad de repetir. Los demás modelos requirieron al menos un nuevo intento para conseguir todas las zonas de texto correctas.
¿Y qué pasa con Imagen 4? Google cerrará los endpoints de la API de Imagen 4 el 17 de agosto de 2026 y está redirigiendo a los desarrolladores hacia los modelos Nano Banana. Si ya tienes un flujo de trabajo de texto basado en Imagen 4, conviene planificar la migración desde ahora.
Qué modelo elegir según el caso
Texto denso en varios bloques: GPT Image 2
Infografías, envases con listas de ingredientes, pantallas de UI, diagramas con etiquetas o señalética multilingüe. GPT Image 2 es el único modelo probado que mantuvo limpias cuatro o más zonas de texto en una sola generación. Además, permite edición mediante máscaras: puedes corregir una etiqueta mal escrita sin regenerar la imagen completa. La documentación de OpenAI confirma tamaños de salida flexibles de hasta 3840 px en el lado más largo.
Prueba GPT Image 2 con tu propio prompt cargado de texto.
Titular corto en una escena fotorrealista: Nano Banana 2
Un cartel en una foto urbana. Una marca sobre una botella en una imagen de estilo de vida. Nano Banana 2 genera las escenas más fotorrealistas de los modelos probados y maneja bien uno o dos elementos de texto breves. Los problemas empiezan a partir de tres zonas de texto independientes.
Nano Banana 2 y Nano Banana Pro están disponibles mediante API.
Tipografía con foco en diseño: Ideogram V3
Para pósteres, logos con texto y portadas de álbumes, Ideogram V3 trata el texto como un elemento de diseño de primer nivel: kerning, control del estilo tipográfico y expansión de prompts consciente del layout. Varias comparativas independientes lo sitúan como la mejor opción para tipografía de un único titular. No está disponible en AIReiter, por lo que no lo incluí en la prueba completa.
Texto CJK o multilingüe: primero GPT Image 2
Según las pruebas de la competencia y la propia documentación de Google, GPT Image 2 es el más fiable entre escrituras no latinas. Seedream 5 Pro, desarrollado por ByteDance, es una buena alternativa específicamente para caracteres chinos. Independientemente del modelo, conviene que un hablante nativo revise cualquier resultado en escritura no latina.
Producción a gran volumen y poco texto: Nano Banana 2 Lite o Seedream 5 Lite
Si el texto es secundario, por ejemplo una marca de agua pequeña o una sola palabra, y necesitas mucho volumen al menor coste, Nano Banana 2 Lite (gemini-3.1-flash-lite-image) y Seedream 5 Lite son las opciones de API más económicas. No los sometí a una prueba intensiva con texto denso, así que considera sus capacidades tipográficas un escalón por debajo de las de sus versiones completas.
Preguntas frecuentes
¿Qué modelo de imagen con IA renderiza texto con mayor precisión en 2026?
GPT Image 2, con una ventaja clara en texto repartido en varios bloques. En nuestra prueba de envase resolvió correctamente cuatro zonas de texto independientes en la primera generación, mientras que Nano Banana 2 y Seedream 5 Pro tuvieron al menos un elemento defectuoso. Para un único titular breve, Nano Banana 2 e Ideogram V3 también son opciones muy sólidas.
¿Puede la IA generar logos con texto legible?
Sí. Ideogram V3 es el más potente para trabajos de logo con texto: resuelve el kerning, la alineación y el estilo de fuente a un nivel que los modelos de propósito general no igualan. GPT Image 2 es una segunda opción sólida y maneja mejor los textos largos dentro de logos. Aun así, revisa cada carácter al máximo zoom antes de usar el resultado en producción.
¿Por qué la IA escribe mal las palabras en las imágenes?
Se juntan tres factores. Primero, las letras apenas toleran errores: basta con cambiar un trazo de una "B" para obtener una "R" o un carácter sin sentido, mientras que un rostro puede desviarse unos pocos puntos porcentuales y seguir pareciendo un rostro. Segundo, los errores se multiplican con el número de elementos: cada zona de texto es una restricción independiente de precisión, así que un prompt con cinco etiquetas tiene cinco oportunidades de fallar. Por último, las escrituras no latinas cuentan con conjuntos de glifos mucho mayores y datos de entrenamiento menos limpios, lo que dificulta notablemente la reproducción exacta de caracteres.
¿Sigue siendo Imagen 4 una opción para renderizar texto?
No para proyectos nuevos. Google retira la API de Imagen 4 el 17 de agosto de 2026 y recomienda migrar a los modelos Nano Banana. Si cuentas con un flujo de trabajo existente basado en Imagen 4, empieza la migración ahora.
¿Cuál es la forma más barata de conseguir texto preciso en imágenes de IA?
GPT Image 2 en calidad media (~$0.020/imagen) ofrece la mejor relación entre coste y precisión porque requiere menos repeticiones. Nano Banana 2 tiene un precio por imagen similar, pero normalmente necesita más generaciones para lograr texto limpio repartido en varios bloques, por lo que su coste efectivo es mayor cuando el texto es crítico.
Lecturas relacionadas
- GPT Image 2 vs Nano Banana Pro: comparativa cara a cara sobre fotorrealismo, precios y recomendaciones de uso más allá de la renderización de texto
- Comparativa de los mejores generadores de imágenes con IA de 2026 para una visión más amplia de la calidad de imagen en todas las categorías
- Seedream 5 Pro vs Nano Banana Pro para un desglose detallado de los modelos de imagen de ByteDance y Google