Oggi quasi tutti i modelli AI per immagini dichiarano di saper gestire bene il testo. Nella pratica, però, molti mantengono la promessa solo in parte. Ho sottoposto GPT Image 2, Nano Banana 2, Nano Banana Pro e Seedream 5 Pro agli stessi due prompt: una confezione con quattro aree di testo e un mockup UI con sei etichette. Il verdetto rapido è chiaro: GPT Image 2 è l'unico modello che, in una sola generazione, ha mantenuto puliti tutti e quattro i blocchi di testo. Non è però la scelta giusta per qualsiasi lavoro.
Il test: quattro modelli alle prese con testo reale
Valutare il rendering testuale con un prompt di una sola parola serve a poco. Un modello che scrive correttamente "HELLO" su un poster può andare in crisi davanti all'etichetta di un prodotto con quattro aree testuali distinte. Per questo ho preparato due prompt mirati al problema che conta davvero in produzione: più blocchi di testo, di dimensioni diverse, nella stessa immagine.
Test 1 — Confezione di caffè: "PREMIUM ROAST" (titolo grande), "Single Origin Colombia" (sottotitolo), "340g / 12 oz" (testo piccolo) e "Ethically Sourced Since 2019" (payoff). Quattro aree testuali separate sullo stesso prodotto.
Test 2 — UI mobile di accesso: "Welcome Back" (intestazione), "Sign in to your account" (testo secondario), "Email Address" e "Password" (etichette dei campi), "Sign In" (pulsante), "Forgot your password?" e "Don't have an account? Sign Up" (testo nel footer). Sei elementi di testo indipendenti.
Ogni prompt è stato eseguito una volta per modello a 1024×1024, o formato equivalente, senza selezionare artificialmente i risultati migliori. Le immagini qui sotto sono la prima generazione, non la migliore di cinque tentativi.
I modelli testati:
| Modello | Sviluppatore | Identificatore API |
|---|---|---|
| GPT Image 2 | OpenAI | gpt-image-2 |
| Nano Banana 2 | Google DeepMind | gemini-3.1-flash-image |
| Nano Banana Pro | Google DeepMind | gemini-3-pro-image |
| Seedream 5 Pro | ByteDance | seedream-v5-pro |
Ho verificato anche Ideogram V3 e FLUX.2 con gli stessi prompt, tramite le rispettive API. I risultati sono citati nella sezione dedicata alla scelta del modello, ma non includono immagini complete del test perché non sono disponibili sulla piattaforma di AIReiter.
Test sulla confezione: quattro aree testuali sotto stress
Il prompt del sacchetto di caffè richiede quattro blocchi di testo, ciascuno di dimensione diversa. È proprio questo lo scenario che distingue i modelli con un rendering testuale realmente affidabile da quelli che riescono per caso a generare una singola parola pulita.
GPT Image 2 ha riprodotto correttamente tutti e quattro i blocchi. "PREMIUM ROAST" è risultato marcato e centrato; il sottotitolo "Single Origin Colombia" non conteneva neppure una lettera errata; "340g / 12 oz" era leggibile anche nelle piccole dimensioni; anche il payoff era scritto correttamente. Nessun carattere inventato e nessuna area mancante.
Nano Banana 2 ha centrato titolo e sottotitolo, ma ha perso precisione nei testi più piccoli. "340g" è stato generato correttamente, mentre "12 oz" si è fuso con gli elementi grafici circostanti. Il payoff mostrava una spaziatura irregolare tra le lettere. La qualità della scena, però, era la migliore dei quattro modelli: piano d'appoggio e illuminazione ricordavano più una foto prodotto che un render.
Nano Banana Pro ha prodotto il design più d'impatto, grazie a una tipografia più curata e a un'impronta editoriale. Il titolo era pulito, ma nel sottotitolo un carattere era stato sostituito e il testo piccolo era in parte inventato. Nano Banana Pro tende a trattare il testo come componente estetica, più che come obiettivo di precisione.
Seedream 5 Pro ha gestito bene titolo e sottotitolo, ha reso quasi corretto il peso e ha commesso un errore ortografico nel payoff. Il modello di ByteDance è particolarmente valido con il testo cinese, come ho verificato con un prompt separato per un'etichetta in cinese, ma con testo inglese distribuito in più aree resta un gradino sotto GPT Image 2.
| Modello | Titolo corretto? | Sottotitolo corretto? | Testo del peso corretto? | Payoff corretto? | Tutte e 4 le aree pulite? |
|---|---|---|---|---|---|
| GPT Image 2 | Sì | Sì | Sì | Sì | Sì |
| Nano Banana 2 | Sì | Sì | Parziale | Spaziatura errata | No |
| Nano Banana Pro | Sì | Carattere sostituito | No | No | No |
| Seedream 5 Pro | Sì | Sì | Quasi | 1 errore ortografico | No |
Mockup UI: sei etichette nella stessa schermata
Il prompt della schermata di login è più impegnativo del test sulla confezione: richiede sei elementi testuali di dimensioni diverse, oltre alla struttura di un'interfaccia con pulsanti e campi di input. Mette alla prova sia l'accuratezza del testo sia la disciplina del layout.
GPT Image 2 ha generato una schermata di login riconoscibile, con tutti e sei gli elementi presenti e ortograficamente corretti. Il testo del pulsante era centrato, le etichette dei campi erano collocate sopra le aree di inserimento e il testo del footer risultava leggibile. Il layout non era perfetto al pixel, come accade con qualsiasi UI generata dall'AI, ma ogni testo era leggibile e nella posizione giusta.
Nano Banana 2 ha prodotto una UI dall'aspetto pulito, con intestazione e testo del pulsante corretti. Le etichette dei campi erano presenti, ma osservando da vicino "Password" mostrava un lieve problema a livello di caratteri. Il footer con "Forgot your password?" era leggibile, mentre la riga "Don't have an account? Sign Up" risultava parzialmente tagliata. Il design complessivo appariva più moderno rispetto all'output di GPT Image 2, ma la completezza del testo era inferiore.
Seedream 5 Pro ha generato una schermata dall'aspetto funzionale e con una buona struttura del layout. L'intestazione era corretta, ma le etichette dei campi e il testo nel footer mostravano errori più evidenti. Il testo del pulsante era pulito. Nel complesso, 4 dei 6 elementi testuali erano del tutto accurati.
"I modelli AI per immagini non riescono ancora a renderizzare il testo in modo affidabile... ti servirà Photoshop" — un utente di r/StableDiffusion, riferendosi ai modelli locali; nel 2026, però, il divario tra modelli locali e modelli via API si è ampliato sensibilmente
| Modello | Intestazione | Testo secondario | Etichette dei campi | Pulsante | Testo del footer | Punteggio (su 6) |
|---|---|---|---|---|---|---|
| GPT Image 2 | Sì | Sì | Sì | Sì | Sì | 6/6 |
| Nano Banana 2 | Sì | Sì | Parziale | Sì | Parziale | 4/6 |
| Seedream 5 Pro | Sì | Parziale | Parziale | Sì | Parziale | 3.5/6 |
Quanto costa ogni immagine ricca di testo
Le immagini con molto testo hanno un moltiplicatore di costo nascosto: se la prima generazione sbaglia una parola, bisogna rigenerare. I prezzi qui sotto corrispondono al costo API ufficiale di una singola immagine, ma per lavori in cui il testo è critico il costo effettivo va moltiplicato per il numero di generazioni necessarie a ottenere un risultato pulito.
| Modello | Costo 1024×1024 | Costo 2K+ | Accuratezza del testo al primo tentativo (test con 2 prompt) |
|---|---|---|---|
| GPT Image 2 | ~$0.020 (media) | ~$0.067 (alta, 2K) | Entrambi i prompt puliti al primo tentativo |
| Nano Banana 2 | ~$0.020 | ~$0.040 (4K) | Titolo e sottotitolo puliti; testo piccolo impreciso |
| Nano Banana Pro | ~$0.050 | ~$0.060 | Titolo pulito; 3 aree su 4 con errori |
| Seedream 5 Pro | ~$0.035 | — | Titolo e sottotitolo puliti; payoff con errore ortografico |
Quando l'accuratezza del testo è importante, nel costo reale di un modello vanno conteggiate anche le rigenerazioni. Un'immagine da $0.020 che richiede tre tentativi per ottenere testo pulito costa $0.060.
Fonti: prezzi API OpenAI (verificati ad agosto 2026), prezzi API Google Gemini (verificati ad agosto 2026), pagina prezzi AIReiter.
Il vantaggio di costo di GPT Image 2 nei lavori testuali deriva dal risparmio sulle rigenerazioni. In entrambi i prompt del test ha prodotto testo pulito già alla prima generazione, senza bisogno di riprovare. Gli altri modelli hanno richiesto almeno un nuovo tentativo per rendere corrette tutte le aree testuali.
E Imagen 4? Google disattiverà gli endpoint API di Imagen 4 il 17 agosto 2026 e indirizza gli sviluppatori verso i modelli Nano Banana. Se hai già un flusso di lavoro basato su Imagen 4, è il momento di pianificare la migrazione.
Quale modello scegliere in base al caso d'uso
Testo denso in più blocchi: GPT Image 2
Infografiche, packaging con liste di ingredienti, schermate UI, diagrammi con etichette, segnaletica multilingue. GPT Image 2 è l'unico modello del test a mantenere pulite quattro o più aree testuali in una sola generazione. Supporta inoltre l'editing con maschere: puoi correggere una singola etichetta sbagliata senza rigenerare l'intera immagine. La documentazione di OpenAI conferma dimensioni di output flessibili fino a 3840 px sul lato più lungo.
Prova GPT Image 2 con il tuo prompt ricco di testo.
Titoli brevi in scene fotorealistiche: Nano Banana 2
Un'insegna in una foto di strada, un brand su una bottiglia in uno scatto lifestyle: Nano Banana 2 produce le scene più fotorealistiche tra i modelli testati e gestisce bene 1-2 elementi testuali brevi. I problemi iniziano con tre o più aree di testo separate.
Nano Banana 2 e Nano Banana Pro sono entrambi disponibili via API.
Tipografia orientata al design: Ideogram V3
Per poster, loghi con testo e copertine di album, Ideogram V3 tratta il testo come un elemento progettuale di primo piano: kerning, controllo dello stile dei font ed espansione del prompt consapevole del layout. Diversi confronti indipendenti lo indicano come la scelta migliore per la tipografia con un solo titolo. Non è disponibile su AIReiter, quindi non l'ho incluso nel test completo.
Testo CJK o multilingue: prima scelta GPT Image 2
Sulla base dei test della concorrenza e della documentazione di Google, GPT Image 2 è il modello più affidabile anche per gli alfabeti non latini. Seedream 5 Pro, sviluppato da ByteDance, è una valida alternativa soprattutto per i caratteri cinesi. A prescindere dal modello, fai sempre revisionare l'output non latino da un madrelingua.
Lavori ad alto volume e poco testo: Nano Banana 2 Lite o Seedream 5 Lite
Se il testo è secondario, per esempio una piccola filigrana o una sola parola, e devi generare grandi volumi a costo contenuto, Nano Banana 2 Lite (gemini-3.1-flash-lite-image) e Seedream 5 Lite sono le opzioni API più economiche. Non li ho sottoposti a stress test con testo denso, quindi considera le loro capacità testuali inferiori a quelle delle rispettive versioni complete.
FAQ
Quale modello AI per immagini renderizza il testo con maggiore accuratezza nel 2026?
GPT Image 2, con un margine netto sui testi distribuiti in più blocchi. Nel test sul packaging ha gestito correttamente quattro aree testuali separate già alla prima generazione, mentre Nano Banana 2 e Seedream 5 Pro hanno entrambi prodotto almeno un elemento alterato. Per un singolo titolo breve, Nano Banana 2 e Ideogram V3 sono entrambe ottime opzioni.
L'AI può generare loghi con testo leggibile?
Sì. Ideogram V3 è il più forte per i lavori di logo con testo: gestisce kerning, allineamento e stile dei font a un livello che i modelli generalisti non raggiungono. GPT Image 2 è una solida seconda scelta e gestisce meglio i testi più lunghi nei loghi. Prima di usare il risultato in produzione, controlla comunque ogni carattere con lo zoom al massimo.
Perché l'AI sbaglia l'ortografia delle parole nelle immagini?
Entrano in gioco tre fattori. Primo: le lettere tollerano errori quasi nulli; basta cambiare un tratto di una "B" per ottenere una "R" o un simbolo senza senso, mentre un volto può essere impreciso di qualche punto percentuale e restare comunque riconoscibile. Secondo: gli errori aumentano con il numero di elementi, perché ogni area testuale è un vincolo di precisione indipendente; un prompt con cinque etichette offre quindi cinque occasioni di fallire. Terzo: gli alfabeti non latini hanno set di glifi molto più ampi e dati di addestramento meno puliti, rendendo assai più difficile il rendering accurato dei caratteri.
Imagen 4 è ancora un'opzione per il rendering del testo?
No, non per i nuovi progetti. Google ritirerà l'API di Imagen 4 il 17 agosto 2026 e consiglia di passare ai modelli Nano Banana. Se utilizzi già un workflow con Imagen 4, inizia subito la migrazione.
Qual è il modo più economico per ottenere testo accurato nelle immagini AI?
GPT Image 2 a qualità media (~$0.020/immagine) offre il miglior rapporto tra costo e accuratezza perché richiede meno rigenerazioni. Nano Banana 2 ha un prezzo per immagine simile, ma per ottenere testo pulito in più blocchi richiede in genere più generazioni; nei lavori in cui il testo è essenziale, il suo costo effettivo risulta quindi più alto.
Approfondimenti correlati
- GPT Image 2 vs Nano Banana Pro: confronto diretto su fotorealismo, prezzi e casi d'uso oltre al rendering del testo
- Confronto tra i migliori generatori di immagini AI del 2026 per una panoramica più ampia della qualità d'immagine in tutte le categorie
- Seedream 5 Pro vs Nano Banana Pro per un'analisi dettagliata dei modelli per immagini di ByteDance e Google