AIREITER

Grok Imagine 2 (Image 2.0) : test, API et alternatives

Dernière mise à jour: 2026-08-10 03:42:42

Grok Imagine 2 est le nouveau modèle d’image de xAI : le Quality Mode de grok.com/imagine, disponible en disponibilité générale depuis le 7 août 2026. Malgré son nom, il ne succède pas au modèle vidéo Grok Imagine 1.5. Il occupe la 2e place du classement d’images LM Arena, à la fois en génération texte-image et en édition, derrière GPT-Image-2. Point important avant d’aller plus loin : son API n’est pas encore ouverte. Pour générer ou modifier des images par programmation aujourd’hui, il faut donc passer par l’application grand public de Grok ou choisir un concurrent doté d’une API.

Grok Imagine 2 : un modèle d’image, pas une nouvelle version vidéo

La première chose à clarifier au sujet de « Grok Imagine 2 », c’est sa nature : il s’agit du modèle d’image Imagine Image 2.0 (identifiant grok-imagine-image-quality), lancé comme Quality Mode du générateur d’images de Grok. Il ne s’agit pas du modèle vidéo grok-imagine-video-1.5, couvert dans notre test de Grok Imagine 1.5.

La confusion est compréhensible, tant les noms se ressemblent. Voici le moyen le plus simple de faire la distinction : si une page mentionne la résolution 4K native, des clips de 30 secondes, le moteur vidéo Aurora ou de l’audio parlé synchronisé sur les lèvres, elle attribue des caractéristiques vidéo à un modèle d’image. Image 2.0 produit et retouche des images fixes : pas de durée, pas d’audio, pas de timeline vidéo. Les résultats sont disponibles sur grok.com/imagine ainsi que dans les applications iOS et Android.

La page d’annonce de xAI reste la source la plus claire concernant ce lancement :

Capture d’écran de l’annonce xAI pour Imagine Image 2.0, montrant le nom du modèle et son positionnement en Quality Mode

Ce que permet réellement Image 2.0

Imagine Image 2.0 combine génération et retouche, avec un accent mis sur le respect de la composition et la précision des modifications. Sa promesse phare : générer des images contenant du texte lisible et des mises en page denses à plusieurs éléments — affiches, pages produit, infographies — sans les lettres déformées qui caractérisaient souvent les anciens modèles.

Voici ses fonctions, d’après la page de lancement de xAI, vérifiée le 7 août 2026 :

FonctionCe qu’elle permet
Retouche locale à la baguette magiqueDésigner une zone et ne modifier que cette région, à la manière de l’inpainting.
SegmentationCréer des sélections précises avant modification, sans devoir peindre un masque à la main.
Suppression d’arrière-planSupprimer les arrière-plans et exporter avec transparence.
Édition avec plusieurs images de référenceFournir jusqu’à 5 images de référence dans une même retouche afin de préserver un sujet ou un style.
Smart ResizeÉtendre générativement l’image sur 9 formats (1:2, 9:16, 2:3, 3:4, 1:1, 4:3, 3:2, 16:9, 2:1) ; le modèle prolonge la toile.
Fidélité du texte et de la mise en pageLes petits textes et les compositions à plusieurs éléments restent lisibles et alignés.
15 modèlesPhoto Edit, Product Color Change, Editorial Product Poster, Reimagine, Photo Collage, Mascot Maker, BG Removal & Change, E-Commerce Photos, UGC Photos, Professional Headshot, Icon Maker, Character Sprite, Props & UI Kit, Emoji Creator, Merch Maker.
Créer un univers pour la vidéoGénérer séparément personnages, scènes et accessoires dans un style cohérent, pour préparer une production vidéo.

Le fil rouge est donc le contrôle de la retouche : c’est sur ce terrain que les concurrents se comparent à Image 2.0, et celui que nous mettons à l’épreuve ci-dessous face aux alternatives disponibles par API.

Quel est son niveau ? Lire le classement Arena avec recul

xAI présente Imagine Image 2.0 comme le 2e meilleur modèle mondial, en texte-image comme en retouche d’image, dans LM Arena. Il apparaît sous le nom SpaceXAI, l’intitulé utilisé par xAI sur le tableau. GPT-Image-2 occupe la première place dans les deux catégories.

Classement d’images LM Arena, avec les deux premiers modèles par Elo en texte-image et en édition d’image

Il faut interpréter ce graphique avec les bonnes réserves. Les scores Elo proviennent du propre compte rendu de xAI à partir des données publiques d’Arena, et non d’un test indépendant mené par nos soins. L’écart avec GPT-Image-2 est faible en retouche (1 439 contre 1 463), mais plus marqué en texte-image (1 320 contre 1 380). Une 2e place est un excellent résultat, sans pour autant mettre Image 2.0 au niveau du leader. Et comme l’API n’est pas publiquement ouverte, nous n’avons pas pu réaliser de comparaison API contrôlée. Pour consulter le classement en direct, rendez-vous sur lmarena.ai ; l’échelon suivant comprend Reve 2.1, Meta Muse-Image, Qwen-Image-3.0-Pro, Gemini Image et Seedream.

Peut-on appeler l’API de Grok Imagine 2 aujourd’hui ? Non.

L’API n’est pas ouverte. La page de lancement de xAI l’indique explicitement : « API access is coming soon », sans donner de date, vérifié le 10 août 2026.

Une apparente contradiction mérite toutefois d’être levée. docs.x.ai répertorie déjà l’identifiant grok-imagine-image-quality ainsi que les endpoints POST /v1/images/generations et POST /v1/images/edits, ce dernier acceptant jusqu’à 3 images de référence. Mais la présence d’un identifiant dans la documentation ne signifie pas que l’accès est actif et facturable. Aucun tarif par image n’est publié et, tant que l’accès reste annoncé comme « coming soon », grok-imagine-image-quality n’est pas encore appelable. L’annonce « coming soon » prévaut sur la liste de la documentation.

La question d’un relais est donc réglée : AIReiter ne propose Grok que pour le modèle vidéo grok_imagine_1_5. Il n’existe donc pas non plus de voie AIReiter vers les images Grok. À ce jour, la seule manière d’utiliser Imagine Image 2.0 est l’application grand public Grok, sur grok.com, iOS ou Android.

Les modèles utilisables par API dès maintenant : nos tests

L’API image de Grok restant fermée, la question pratique est de savoir quels modèles du même classement Arena sont appelables aujourd’hui. Trois concurrents de premier plan proposent une API : GPT-Image-2, le n°1 ; Nano Banana Pro, basé sur la technologie d’image Gemini ; et Seedream V5 Pro de ByteDance. Nous leur avons confié les deux tâches emblématiques d’Image 2.0 — génération de texte fidèle et retouche contrôlée — afin de voir si ce qui rend Image 2.0 intéressant lui est réellement exclusif.

Génération : trois modèles, un même prompt

Nous avons donné aux trois modèles le même prompt : une affiche de voyage rétro exigeant un grand titre (NEON KYOTO), une ligne secondaire (2049 EXPRESS) et une ligne de prix (TICKETS FROM 29000 YEN), dans une palette atténuée turquoise et magenta. Même ratio 1:1, réglages par défaut, une génération chacun. L’objectif était d’évaluer le rendu du texte et la composition, les deux atouts mis en avant par Image 2.0.

Comparatif avec un même prompt : GPT-Image-2, Nano Banana Pro et Seedream V5 Pro génèrent chacun la même affiche de voyage rétro

Résultat : les trois modèles ont correctement rendu les trois chaînes de texte — le titre, la ligne secondaire et le prix, sans faute d’orthographe ni caractère inventé. Avec cet échantillon limité (n=1, un prompt, ce n’est pas un benchmark), impossible de classer les trois modèles sur leur aptitude à produire du texte ; on peut seulement constater qu’ils ont tous correctement restitué le texte demandé sur cette affiche. Pour ce type de tâche, la capacité de rendu textuel mise en avant par Image 2.0 est donc accessible chez des concurrents via API. Cela ne signifie pas qu’elle a cessé d’être distinctive dans tous les cas. Les coûts, eux, diffèrent : GPT-Image-2 a consommé 1 crédit, Nano Banana Pro 6 et Seedream V5 Pro 7 pour le même travail. Pour les essayer directement, chacun possède une page API : GPT-Image-2, Nano Banana Pro et Seedream V5 Pro.

Retouche : un avant/après contrôlé avec un concurrent

La retouche est l’autre promesse d’Image 2.0 : conserver la structure tout en changeant un seul élément. Nous avons fourni l’affiche ci-dessus à Nano Banana Pro comme image de référence et demandé de préserver la mise en page, les trois chaînes de texte, le mont Fuji et le train, tout en remplaçant la ville nocturne aux néons par un Kyoto enneigé à l’aube, avec des cerisiers roses, doux et dorés.

Avant/après : l’affiche nocturne originale aux néons et sa version retouchée à l’aube enneigée, toutes deux réalisées avec l’édition par image de référence de Nano Banana Pro

Le résultat : les trois chaînes de texte sont toutes restées correctes (NEON KYOTO, 2049 EXPRESS, TICKETS FROM 29000 YEN), et le mont Fuji comme le train sont toujours présents. La scène est passée d’une nuit sombre aux néons à une aube lumineuse. Une réserve importante : l’image retouchée est revenue dans un autre ratio (1376×768, contre 1024×1024 pour l’original). Elle s’apparente donc davantage à un nouveau rendu guidé qu’à un inpainting strict préservant la toile. Il s’agit d’un unique test sur un seul modèle : il montre qu’une alternative accessible par API peut aujourd’hui préserver texte et sujet tout en modifiant la scène. Il ne prouve pas que chaque concurrent égale l’inpainting plus chirurgical à la baguette magique de Grok, dont l’API est fermée et que nous n’avons pas pu tester nous-mêmes ; les démonstrations officielles de retouche Grok doivent être considérées comme des présentations du fournisseur, pas comme un résultat que nous avons vérifié.

Tarifs : le coût d’une image selon chaque accès

Prix par génération issus de la page AIReiter de chaque modèle, liée dans le tableau, et vérifiés le 10 août 2026. Grok Image 2.0 n’a pas de prix API puisqu’il n’a pas d’API ; il est uniquement proposé dans l’application grand public Grok, sans tarif publié par image.

ModèleSur AIReiterPrix d’une image d’environ 1K (par génération)Rang ArenaNotes
GPT-Image-2Oui$0.02#1 (T2I & Edit)Le moins cher des trois et le mieux classé.
Nano Banana ProOui$0.05Premier niveauBasé sur Gemini ; solide en texte et en retouche.
Seedream V5 ProOui$0.07 (7 crédits)Premier niveauByteDance ; pas de niveau 4K ; images de référence à $0.005 chacune.
Grok Image 2.0Non (API en attente)n/a#2 (T2I & Edit)Réservé au grand public ; disponible dans l’application Grok.

Quel choix faire aujourd’hui ?

Trois options selon votre besoin :

  • Vous voulez précisément Grok Image 2.0. Utilisez l’application Grok, sur le web, iOS ou Android. Il n’existe aucune voie API, et aucune date n’a été annoncée pour son ouverture.
  • Vous voulez générer ou retoucher des images par API dès aujourd’hui. Choisissez GPT-Image-2, n°1 d’Arena à $0.02 par génération en 1K, ou comparez avec Nano Banana Pro et Seedream V5 Pro. Les trois ont réussi notre échantillon de génération de texte, et Nano Banana Pro a tenu le test de retouche.
  • Vous cherchiez en fait un modèle vidéo. Il s’agit d’un autre modèle, grok-imagine-video-1.5, présenté dans notre test de Grok Imagine 1.5 et sur la page vidéo Grok.

FAQ

Grok Imagine 2 est-il un modèle d’image ou de vidéo ?

C’est un modèle d’image. « Grok Imagine 2 » désigne Imagine Image 2.0 (identifiant grok-imagine-image-quality), le Quality Mode de grok.com/imagine. Le modèle vidéo distinct est grok-imagine-video-1.5 ; si une description évoque la 4K, des clips de 30 secondes ou de l’audio, elle parle du modèle vidéo, pas de celui-ci.

Puis-je appeler l’API de Grok Imagine 2 ?

Pas encore. xAI annonce que l’accès API arrive « coming soon », vérifié le 7 août 2026. docs.x.ai liste l’identifiant du modèle et les endpoints /v1/images/generations et /v1/images/edits, mais aucun accès actif et facturable n’est disponible, et aucun prix par image n’était publié au 10 août 2026.

Combien coûte Grok Imagine 2 ?

Il n’existe pas de tarif API, puisqu’il n’existe pas d’API ouverte. Dans l’application grand public Grok, xAI n’a pas publié de prix autonome par image.

Quelle est la meilleure alternative à Grok Imagine 2 via API ?

GPT-Image-2. Il occupe la 1re place de LM Arena, devant Grok Image 2.0, aussi bien en texte-image qu’en retouche. À environ $0.02 par génération en 1K, c’est également le moins cher des modèles de premier plan accessibles par API que nous avons testés.