Grok Imagine 2 non è il seguito del modello video Grok Imagine 1.5: è il nuovo modello per immagini di xAI. Si chiama Imagine Image 2.0, corrisponde alla Quality Mode di grok.com/imagine ed è stato rilasciato in disponibilità generale il 7 agosto 2026. Nella classifica immagini di LM Arena è al secondo posto sia per text-to-image sia per image editing, dietro GPT-Image-2. C’è però un limite importante: l’API non è ancora aperta. Per generare o modificare immagini via codice, oggi bisogna usare l’app consumer di Grok oppure rivolgersi a un’alternativa con API disponibili.
Grok Imagine 2: immagini, non video
Il punto più utile da chiarire su “Grok Imagine 2” è proprio la sua natura: si tratta del modello di immagini Imagine Image 2.0 (model id grok-imagine-image-quality), distribuito come Quality Mode del generatore di immagini di Grok. Non va confuso con il modello video grok-imagine-video-1.5, analizzato nella nostra recensione di Grok Imagine 1.5.
La sovrapposizione dei nomi genera effettivamente confusione. Un controllo rapido basta a distinguere i due prodotti: se una pagina cita risoluzione nativa 4K, clip da 30 secondi, motore video Aurora o audio parlato sincronizzato con il labiale, sta attribuendo a un modello di immagini specifiche che appartengono al modello video. Image 2.0 genera e modifica immagini statiche: non ha durata, audio né timeline video. Gli output sono disponibili su grok.com/imagine e nelle app iOS e Android.
La fonte più chiara sul lancio è l’annuncio di xAI:
Cosa sa fare davvero Image 2.0
Imagine Image 2.0 è un modello per generazione e editing, progettato per rispettare composizione e layout e offrire un controllo più preciso sulle modifiche. Il suo punto di forza dichiarato è la creazione di immagini con testo leggibile e composizioni dense, ricche di elementi — come poster, pagine prodotto e infografiche — evitando le lettere deformate o confuse tipiche dei modelli meno recenti.
Queste sono le funzionalità indicate nella pagina di lancio di xAI, verificate il 7 agosto 2026:
| Funzionalità | Cosa permette di fare |
|---|---|
| Modifica regionale con bacchetta magica | Indicare un’area e intervenire soltanto su quella regione, in stile inpainting. |
| Segmentazione | Creare selezioni precise prima della modifica, senza dover dipingere manualmente una maschera. |
| Rimozione dello sfondo | Eliminare gli sfondi ed esportare immagini con trasparenza. |
| Modifica con più immagini di riferimento | Usare fino a 5 immagini di riferimento in un’unica modifica per mantenere coerenti soggetto o stile. |
| Smart Resize | Outpainting generativo in 9 rapporti d’aspetto (1:2, 9:16, 2:3, 3:4, 1:1, 4:3, 3:2, 16:9, 2:1); il modello estende la tela. |
| Fedeltà di testo e layout | Testi piccoli e layout con molti elementi rimangono leggibili e allineati. |
| 15 template | Photo Edit, Product Color Change, Editorial Product Poster, Reimagine, Photo Collage, Mascot Maker, BG Removal & Change, E-Commerce Photos, UGC Photos, Professional Headshot, Icon Maker, Character Sprite, Props & UI Kit, Emoji Creator, Merch Maker. |
| Creazione di mondi per video | Generare separatamente personaggi, scene e oggetti di scena mantenendo uno stile coerente, come fase di pre-produzione per un video. |
Il filo conduttore è il controllo nell’editing: è l’aspetto su cui i concorrenti vengono confrontati con Image 2.0 e quello che abbiamo testato qui contro le alternative accessibili via API.
Quanto è valido? Interpretare correttamente il ranking Arena
Secondo xAI, Imagine Image 2.0 è il modello numero 2 al mondo sia in text-to-image sia in image editing su LM Arena, dove compare con il nome SpaceXAI, la denominazione usata da xAI nella classifica. Il primo classificato in entrambe le categorie è GPT-Image-2.
Conviene però leggere il grafico con le giuste aspettative. I valori Elo derivano dal resoconto di xAI sui dati pubblici di Arena, non da un test indipendente condotto da noi. Il distacco da GPT-Image-2 è ridotto nell’editing (1.439 contro 1.463) e più ampio nel text-to-image (1.320 contro 1.380). Il secondo posto è un ottimo risultato, ma non equivale a dire che Image 2.0 sia al livello del modello capolista. Inoltre, dato che l’API non è pubblicamente aperta, non abbiamo potuto eseguire un confronto API controllato. Per verificare la classifica, la leaderboard aggiornata è su lmarena.ai; nella fascia immediatamente successiva figurano Reve 2.1, Meta Muse-Image, Qwen-Image-3.0-Pro, Gemini Image e Seedream.
L’API di Grok Imagine 2 è utilizzabile oggi? No.
L’API non è aperta. La pagina di lancio di xAI afferma esplicitamente: "API access is coming soon,", senza indicare una data, verifica effettuata il 10 agosto 2026.
C’è un’apparente contraddizione da chiarire. Su docs.x.ai compaiono già il model id grok-imagine-image-quality e gli endpoint POST /v1/images/generations e POST /v1/images/edits, quest’ultimo con fino a 3 immagini di riferimento. Ma la presenza di un model id nella documentazione non equivale ad avere accesso attivo e fatturabile. Non esiste un prezzo pubblicato per immagine e, finché l’accesso resta indicato come “coming soon”, grok-imagine-image-quality non è ancora richiamabile. In questo caso conta l’indicazione “coming soon”, non la voce nella documentazione.
Di conseguenza, non esiste neppure un percorso alternativo tramite relay: AIReiter elenca Grok solo con il modello video grok_imagine_1_5, quindi non offre accesso alle immagini di Grok. L’unico modo per usare Imagine Image 2.0 oggi è l’app consumer di Grok, su grok.com, iOS e Android.
Alternative API già disponibili: i test
Con l’API immagini di Grok ancora chiusa, la domanda pratica è quali modelli della stessa leaderboard Arena siano utilizzabili subito via API. Tre rivali di fascia alta lo sono: GPT-Image-2, al primo posto; Nano Banana Pro, basato sulla tecnologia immagini di Gemini; e Seedream V5 Pro di ByteDance. Li ho messi alla prova sui due compiti distintivi di Image 2.0 — generazione con testo accurato ed editing controllato — per capire se queste capacità siano davvero esclusive del modello xAI.
Generazione: confronto con lo stesso prompt
Ho inviato ai tre modelli lo stesso prompt: un poster di viaggio rétro con un titolo grande (NEON KYOTO), un sottotitolo (2049 EXPRESS) e una riga prezzo (TICKETS FROM 29000 YEN), in una palette dai toni teal e magenta attenuati. Stesso formato 1:1, impostazioni predefinite e una generazione per modello. L’obiettivo era testare la resa del testo e del layout, i due punti di forza promossi per Image 2.0.
Il risultato: tutti e tre i modelli hanno reso correttamente tutte e tre le stringhe di testo — titolo, sottotitolo e riga prezzo, senza errori ortografici né caratteri inventati. Con un campione di queste dimensioni (n=1, un solo prompt, non è un benchmark), non è possibile classificare i tre modelli in base alla capacità di gestire il testo: si può solo confermare che, su questo prompt per poster, tutti hanno riprodotto correttamente il testo richiesto. Significa che per questo tipo di lavoro la capacità di rendering testuale promossa da Image 2.0 è disponibile anche presso rivali con API accessibili; non significa che abbia perso ogni elemento distintivo in assoluto. I costi, invece, differiscono: GPT-Image-2 ha addebitato 1 credito, Nano Banana Pro 6 e Seedream V5 Pro 7 per lo stesso lavoro. Per provarli direttamente, sono disponibili le rispettive pagine API di GPT-Image-2, Nano Banana Pro e Seedream V5 Pro.
Editing: prima e dopo con un controllo mirato
L’editing è l’altra metà della proposta di Image 2.0: mantenere la struttura e cambiare un solo elemento. Ho passato il poster qui sopra a Nano Banana Pro come immagine di riferimento, chiedendo di preservare layout, tutte e tre le stringhe di testo, il Monte Fuji e il treno, sostituendo però la città notturna al neon con un’alba innevata a Kyoto, con fiori di ciliegio in rosa tenue e oro.
Il risultato: tutte e tre le stringhe di testo sono rimaste corrette (NEON KYOTO, 2049 EXPRESS, TICKETS FROM 29000 YEN), e sia il Monte Fuji sia il treno sono ancora presenti. La scena è passata da una notte scura al neon a un’alba luminosa. Va segnalato un limite: l’output dell’editing è arrivato con un rapporto d’aspetto diverso (1376×768 contro i 1024×1024 dell’originale), quindi assomiglia più a una rigenerazione guidata che a un inpainting rigoroso che preserva la tela. È un test singolo su un unico modello: dimostra che oggi un rivale con API può eseguire una modifica del tipo “preserva testo e soggetto, cambia la scena”, ma non prova che ogni concorrente eguagli l’inpainting più chirurgico con bacchetta magica di Grok. La sua API è chiusa e non abbiamo potuto verificarlo direttamente; qualsiasi demo ufficiale di editing Grok va quindi considerata una vetrina del fornitore, non una capacità da noi testata.
Prezzi: il costo di un’immagine per ciascuna opzione
Prezzi per generazione riportati sulle pagine AIReiter di ciascun modello, collegate nella tabella e verificate il 10 agosto 2026. Grok Image 2.0 non ha un prezzo API perché non dispone di un’API: è utilizzabile solo nell’app consumer di Grok e non esiste una cifra pubblicata per singola immagine.
| Modello | Su AIReiter | Prezzo ~1K immagini (per generazione) | Posizione Arena | Note |
|---|---|---|---|---|
| GPT-Image-2 | Sì | $0.02 | #1 (T2I & Edit) | Il più economico dei tre e il meglio classificato. |
| Nano Banana Pro | Sì | $0.05 | Fascia alta | Basato su Gemini; valido per testo + editing. |
| Seedream V5 Pro | Sì | $0.07 (7 crediti) | Fascia alta | ByteDance; nessun tier 4K; immagini di riferimento a $0.005 ciascuna. |
| Grok Image 2.0 | No (API in arrivo) | n/a | #2 (T2I & Edit) | Solo consumer; disponibile nell’app Grok. |
Quale scegliere adesso
Le opzioni sono tre, in base all’esigenza:
- Vuoi proprio Grok Image 2.0. Usa l’app di Grok su web, iOS o Android. Non esiste un percorso API e non è stata indicata una data di apertura.
- Vuoi generare o modificare immagini via API oggi. Scegli GPT-Image-2, primo su Arena a $0.02 per generazione a 1K, oppure confrontalo con Nano Banana Pro e Seedream V5 Pro. Tutti e tre hanno superato il nostro campione di una generazione sul testo, mentre Nano Banana Pro ha retto anche il test di editing.
- In realtà cerchi un modello video. È un prodotto diverso:
grok-imagine-video-1.5, trattato nella nostra recensione di Grok Imagine 1.5 e nella pagina Grok video.
FAQ
Grok Imagine 2 è un modello di immagini o video?
È un modello di immagini. “Grok Imagine 2” indica Imagine Image 2.0 (model id grok-imagine-image-quality), la Quality Mode di grok.com/imagine. Il modello video è il distinto grok-imagine-video-1.5: se una descrizione parla di 4K, clip da 30 secondi o audio, si riferisce al modello video, non a questo.
Posso chiamare l’API di Grok Imagine 2?
Non ancora. xAI indica che l’accesso API è “coming soon”, verifica effettuata il 7 agosto 2026. docs.x.ai elenca il model id e gli endpoint /v1/images/generations e /v1/images/edits, ma al 10 agosto 2026 non esistono accesso attivo e fatturabile né un prezzo pubblicato per immagine.
Quanto costa Grok Imagine 2?
Via API non ha un prezzo, perché non esiste ancora un’API disponibile. Nell’app consumer di Grok, xAI non ha pubblicato un costo autonomo per singola immagine.
Qual è la migliore alternativa API a Grok Imagine 2?
GPT-Image-2. È al primo posto su LM Arena, davanti a Grok Image 2.0, sia nel text-to-image sia nell’editing e, a circa $0.02 per generazione a 1K, è anche il più economico tra i modelli API di fascia alta che abbiamo testato.