Hoje, praticamente todo modelo de imagem por IA promete renderizar texto com qualidade. Na prática, a maioria entrega menos do que anuncia. Rodei o mesmo prompt de embalagem com quatro áreas de texto e um mockup de interface com seis rótulos no GPT Image 2, Nano Banana 2, Nano Banana Pro e Seedream 5 Pro para descobrir quais realmente geram texto legível e sem erros de ortografia. Resumo rápido: o GPT Image 2 foi o único a acertar os quatro blocos de texto em uma única geração, mas não é a escolha ideal para todos os tipos de trabalho.
Como foi feito o teste com os quatro modelos
Comparar renderização de texto usando um prompt com uma única palavra não serve para muita coisa. Um modelo que acerta "HELLO" em um pôster pode falhar feio em um rótulo de embalagem com quatro regiões de texto independentes. Por isso, criei dois prompts voltados ao problema que realmente importa em produção: vários blocos de texto, em tamanhos diferentes, dentro da mesma imagem.
Teste 1 — Embalagem de café: "PREMIUM ROAST" (título grande), "Single Origin Colombia" (subtítulo), "340g / 12 oz" (texto pequeno) e "Ethically Sourced Since 2019" (slogan). São quatro regiões de texto distintas em um único produto.
Teste 2 — UI de login para celular: "Welcome Back" (cabeçalho), "Sign in to your account" (texto de apoio), "Email Address" e "Password" (rótulos dos campos), "Sign In" (botão), "Forgot your password?" e "Don't have an account? Sign Up" (texto de rodapé). Ao todo, seis elementos de texto separados.
Cada prompt foi executado uma vez em cada modelo, a 1024×1024 (ou equivalente), sem escolher a melhor imagem. O que aparece abaixo é a primeira geração, não a melhor entre cinco tentativas.
Modelos avaliados:
| Modelo | Desenvolvedor | Identificador da API |
|---|---|---|
| GPT Image 2 | OpenAI | gpt-image-2 |
| Nano Banana 2 | Google DeepMind | gemini-3.1-flash-image |
| Nano Banana Pro | Google DeepMind | gemini-3-pro-image |
| Seedream 5 Pro | ByteDance | seedream-v5-pro |
Também conferi Ideogram V3 e FLUX.2 com esses mesmos prompts por meio de suas respectivas APIs. Os resultados são mencionados na seção de decisão, mas não incluí imagens completas dos testes porque eles não estão disponíveis na plataforma da AIReiter.
Embalagem: o teste de estresse com quatro regiões de texto
O prompt da embalagem de café pede quatro blocos de texto em tamanhos diferentes. É exatamente o tipo de cenário que separa modelos com renderização textual realmente competente daqueles que apenas acertam uma palavra isolada por sorte.
GPT Image 2 renderizou corretamente os quatro blocos de texto. "PREMIUM ROAST" saiu em negrito e centralizado; o subtítulo "Single Origin Colombia" não teve uma letra errada; "340g / 12 oz" permaneceu legível mesmo em tamanho pequeno; e o slogan foi escrito corretamente. Sem caracteres inventados nem regiões ausentes.
Nano Banana 2 acertou o título e o subtítulo, mas perdeu precisão nos textos menores. "340g" foi renderizado corretamente, enquanto a parte "12 oz" se misturou a elementos visuais ao redor. O espaçamento entre as letras do slogan ficou inconsistente. Em compensação, foi o melhor dos quatro na qualidade da cena: a superfície da mesa e a iluminação pareciam mais uma foto de produto do que uma renderização.
Nano Banana Pro criou o design visualmente mais impactante, com tipografia mais trabalhada e um ar editorial. O título saiu limpo, mas o subtítulo teve uma troca de caractere e o texto pequeno foi parcialmente inventado. O Nano Banana Pro trata o texto mais como elemento de design do que como um alvo de precisão.
Seedream 5 Pro acertou título e subtítulo, deixou o texto de peso quase todo correto e cometeu um erro de ortografia no slogan. O modelo da ByteDance é notavelmente forte com texto em chinês — confirmei isso em um prompt separado de rótulo em chinês —, mas ainda fica um passo atrás do GPT Image 2 para textos em inglês distribuídos em várias regiões.
| Modelo | Título correto? | Subtítulo correto? | Texto de peso correto? | Slogan correto? | As 4 regiões saíram limpas? |
|---|---|---|---|---|---|
| GPT Image 2 | Sim | Sim | Sim | Sim | Sim |
| Nano Banana 2 | Sim | Sim | Parcial | Espaçamento incorreto | Não |
| Nano Banana Pro | Sim | Troca de caractere | Não | Não | Não |
| Seedream 5 Pro | Sim | Sim | Quase todo | 1 erro de ortografia | Não |
Mockup de UI: seis rótulos na mesma tela
O prompt da tela de login é mais difícil que o teste da embalagem porque exige seis elementos textuais em tamanhos variados, além da estrutura de interface, com botões e campos de entrada. Aqui, o teste mede tanto a fidelidade do texto quanto a disciplina do layout.
GPT Image 2 gerou uma tela de login reconhecível, com os seis elementos de texto presentes e escritos corretamente. O texto do botão ficou centralizado, os rótulos dos campos foram posicionados acima das áreas de entrada e o texto do rodapé ficou legível. O layout não foi perfeito em nível de pixels — nenhuma UI gerada por IA é —, mas todos os textos estavam legíveis e no lugar certo.
Nano Banana 2 produziu uma UI visualmente limpa, com o cabeçalho e o texto do botão corretos. Os rótulos dos campos estavam presentes, mas "Password" tinha um pequeno problema em um caractere, perceptível de perto. O texto de rodapé, "Forgot your password?", era legível, mas a linha "Don't have an account? Sign Up" foi parcialmente cortada. O design geral pareceu mais moderno que o resultado do GPT Image 2, mas a completude textual foi menor.
Seedream 5 Pro gerou uma tela com aparência funcional e boa estrutura de layout. O cabeçalho estava correto, mas os rótulos dos campos e o texto do rodapé apresentaram desvios mais relevantes. O texto do botão saiu limpo. No geral, 4 dos 6 elementos de texto ficaram totalmente corretos.
"Os modelos de imagem por IA ainda não conseguem renderizar texto de forma confiável... você vai precisar de photoshop" — usuário do r/StableDiffusion comentando sobre modelos locais, embora a diferença entre modelos locais e modelos via API tenha aumentado significativamente em 2026
| Modelo | Cabeçalho | Texto de apoio | Rótulos dos campos | Botão | Texto de rodapé | Pontuação (de 6) |
|---|---|---|---|---|---|---|
| GPT Image 2 | Sim | Sim | Sim | Sim | Sim | 6/6 |
| Nano Banana 2 | Sim | Sim | Parcial | Sim | Parcial | 4/6 |
| Seedream 5 Pro | Sim | Parcial | Parcial | Sim | Parcial | 3.5/6 |
Quanto custa gerar imagens com muito texto
Imagens carregadas de texto têm um multiplicador de custo escondido: se a primeira geração vier com erro ortográfico, é preciso rodar de novo. Os preços abaixo refletem o custo oficial de API por imagem única, mas o custo prático de um trabalho em que o texto é crítico corresponde a esse valor multiplicado pelo número de gerações necessárias até sair limpo.
| Modelo | Custo em 1024×1024 | Custo em 2K+ | Precisão textual na primeira tentativa (nosso teste com 2 prompts) |
|---|---|---|---|
| GPT Image 2 | ~$0.020 (média) | ~$0.067 (alta, 2K) | Os dois prompts saíram limpos na primeira tentativa |
| Nano Banana 2 | ~$0.020 | ~$0.040 (4K) | Título/subtítulo limpos; texto pequeno apresentou desvios |
| Nano Banana Pro | ~$0.050 | ~$0.060 | Título limpo; 3 das 4 regiões tiveram erros |
| Seedream 5 Pro | ~$0.035 | — | Título/subtítulo limpos; slogan com erro de ortografia |
Quando a precisão do texto importa, o custo real de um modelo inclui as novas tentativas. Uma imagem de $0.020 que exige três regenerações para acertar o texto custa $0.060.
Fontes: preços da API da OpenAI (consultados em agosto de 2026), preços da API Google Gemini (consultados em agosto de 2026), página de preços da AIReiter.
A vantagem de custo do GPT Image 2 para trabalhos com texto vem da economia com regenerações. Nos dois prompts do teste, ele produziu texto limpo já na primeira geração, sem necessidade de nova tentativa. Os outros modelos exigiram pelo menos uma repetição para acertar todas as regiões de texto.
E o Imagen 4? O Google vai desativar os endpoints da API do Imagen 4 em 17 de agosto de 2026 e está direcionando desenvolvedores aos modelos Nano Banana. Se você já usa o Imagen 4 em um fluxo de trabalho com texto, é hora de planejar a migração.
Qual modelo usar em cada caso
Texto denso em vários blocos: GPT Image 2
Infográficos, embalagens com listas de ingredientes, telas de UI, diagramas com rótulos e sinalização multilíngue. O GPT Image 2 foi o único modelo testado que manteve quatro ou mais regiões de texto limpas em uma única geração. Ele também aceita edição baseada em máscara: é possível corrigir um rótulo com erro sem regenerar a imagem inteira. A documentação da OpenAI confirma tamanhos de saída flexíveis de até 3840px na borda mais longa.
Teste o GPT Image 2 com seu próprio prompt carregado de texto.
Título curto em uma cena fotorrealista: Nano Banana 2
Uma placa em uma foto de rua. O nome de uma marca em uma garrafa dentro de uma cena lifestyle. Entre os modelos testados, o Nano Banana 2 produz as cenas mais fotorrealistas e lida bem com 1 ou 2 elementos textuais curtos. Os problemas começam com três ou mais regiões de texto separadas.
O Nano Banana 2 e o Nano Banana Pro estão disponíveis via API.
Tipografia com foco em design: Ideogram V3
Para pôsteres, logos com texto e capas de álbum, o Ideogram V3 trata o texto como elemento central do design: kerning, controle de estilo de fonte e expansão de prompt considerando o layout. Várias comparações independentes o classificam como a melhor opção para tipografia com um único título. Ele não está disponível na AIReiter, por isso não entrou no teste completo.
Texto CJK ou multilíngue: comece pelo GPT Image 2
Com base em testes de concorrentes e na documentação do próprio Google, o GPT Image 2 é o mais confiável entre escritas não latinas. O Seedream 5 Pro, desenvolvido pela ByteDance, é uma boa alternativa especialmente para caracteres chineses. Independentemente do modelo, peça a revisão de toda saída não latina a um leitor nativo.
Trabalho em volume, baixo custo e pouco texto: Nano Banana 2 Lite ou Seedream 5 Lite
Se o texto for secundário, como uma marca-d'água pequena ou uma palavra isolada, e você precisa gerar em grande volume com baixo custo, Nano Banana 2 Lite (gemini-3.1-flash-lite-image) e Seedream 5 Lite são as opções de API mais baratas. Não fiz teste de estresse de textos densos nesses modelos, então considere a capacidade textual deles inferior à de suas versões completas.
Perguntas frequentes
Qual modelo de imagem por IA renderiza texto com mais precisão em 2026?
O GPT Image 2, com uma margem clara em textos com vários blocos. No teste de embalagem, ele acertou quatro regiões de texto separadas já na primeira geração, enquanto Nano Banana 2 e Seedream 5 Pro tiveram pelo menos um elemento corrompido. Para um único título curto, Nano Banana 2 e Ideogram V3 também são opções fortes.
IA consegue gerar logos com texto legível?
Sim. O Ideogram V3 é o mais forte para logos com texto: ele lida com kerning, alinhamento e estilo de fonte em um nível que os modelos de uso geral não alcançam. O GPT Image 2 é uma boa segunda opção e se sai melhor com textos mais longos em logos. Mesmo assim, confira cada caractere em zoom máximo antes de usar o resultado em produção.
Por que a IA erra a ortografia de palavras em imagens?
Três fatores se somam. Primeiro, letras quase não toleram erro: basta alterar um traço em um "B" para ele virar um "R" ou algo sem sentido, enquanto um rosto pode variar alguns pontos percentuais e ainda ser reconhecido como rosto. Segundo, os erros se multiplicam conforme cresce o número de elementos: cada região textual é uma restrição independente de precisão, então um prompt com cinco rótulos tem cinco oportunidades de falhar. Terceiro, escritas não latinas têm conjuntos de glifos muito maiores e dados de treinamento menos consistentes, o que torna a renderização exata de caracteres significativamente mais difícil.
Imagen 4 ainda é uma opção para renderização de texto?
Não para projetos novos. O Google vai descontinuar a API do Imagen 4 em 17 de agosto de 2026 e recomenda a migração para os modelos Nano Banana. Se você tem um fluxo de trabalho existente com Imagen 4, comece a migrar agora.
Qual é a forma mais barata de obter texto preciso em imagens geradas por IA?
O GPT Image 2 em qualidade média (~$0.020/imagem) oferece a melhor relação entre custo e precisão porque requer menos regenerações. O Nano Banana 2 tem preço semelhante por imagem, mas normalmente exige mais gerações para acertar texto limpo em vários blocos, elevando seu custo efetivo em trabalhos nos quais o texto é crítico.
Leituras relacionadas
- GPT Image 2 vs Nano Banana Pro: comparação direta sobre fotorrealismo, preços e recomendações de uso além da renderização de texto
- Comparativo dos melhores geradores de imagem por IA de 2026 para uma visão mais ampla da qualidade de imagem em todas as categorias
- Seedream 5 Pro vs Nano Banana Pro para uma análise detalhada dos modelos de imagem da ByteDance e do Google