Dans ses exemples de lancement, Qwen-Image-3.0 produit en un seul passage une infographie à neuf panneaux : une dérivation en physique, une démonstration en théorie des groupes, un schéma médical, une comparaison en biologie cellulaire, chaque panneau rempli de ses propres diagrammes légendés et légendes, chaque ligne de petit texte restant lisible. Cette seule image est le résumé le plus clair de ce à quoi sert réellement le modèle d’image Qwen de troisième génération, publié le 21 juillet 2026.
*Exemple officiel de Qwen-Image-3.0 (via qwen.ai). Qwen indique que la grille complète provient d’un seul prompt, et non d’un assemblage de neuf rendus.*
Qwen résume la sortie en un mot : « 实 », approximativement *substantiel* ou *pratique*. Là où 1.0 poursuivait la précision et 2.0 la portée, 3.0 vise le travail de production : journaux, storyboards, copies d’examen, maquettes d’interface imbriquées et figures académiques qui tiennent ensemble au premier coup d’œil. Il s’agit moins d’une belle image unique que de mises en page denses et riches en informations, qui restent exactes jusque dans les petits caractères.
Ce qu’est réellement Qwen-Image-3.0
Qwen-Image-3.0 est un modèle fondation texte-vers-image de l’équipe Qwen d’Alibaba, troisième opus d’une série dont la force signature a longtemps été le rendu de texte. Qwen présente les générations comme une progression : la version 1.0 était « précise », la 2.0 était « précise, variée, complète, belle, réaliste », et la 3.0 est « substantielle ». En pratique, cela signifie qu’elle vise les scènes que la plupart des générateurs d’images gèrent encore mal (une page de journal complète, un storyboard à plusieurs panneaux, une capture d’écran imbriquée dans une autre capture d’écran), afin que le résultat puisse s’intégrer directement dans un flux de travail de conception, d’éducation, d’e-commerce ou de contenu.
Les trois améliorations qui comptent
Qwen organise la publication autour de trois piliers. Débarrassé du marketing, chacun vous apporte quelque chose de concret.
Contenu riche : prompts de 4,5k tokens et mises en page complexes en one-shot
Le chiffre clé est la longueur du prompt. Qwen-Image-3.0 accepte jusqu’à 4.5k tokens en entrée, soit une hausse importante par rapport à la longueur d’instruction d’environ 1k tokens que la génération précédente pouvait gérer. Un token est un fragment de texte que le modèle lit ; ainsi, plus il y a de tokens, plus vous pouvez décrire en une seule fois une scène plus dense et plus structurée.
Ce budget débloque deux choses. La première, Qwen l’appelle une mise en page *horizontale* : la grille de neuf panneaux ci-dessus, où chaque cellule est sa propre infographie détaillée et l’ensemble est généré en une seule passe. Selon Qwen, la description complète de cette grille a pris environ 3,7k tokens, ce qui explique l’importance de relever le plafond : l’ancienne limite ne pouvait pas contenir l’instruction.
Le second est la *profondeur* : imbriquer des interfaces à l’intérieur d’autres interfaces. L’exemple de Qwen rend une fenêtre VS Code contenant une fenêtre de chat Qwen contenant un chat WeChat contenant une affiche de café, chaque couche conservant sa propre interface réaliste. Si votre travail implique des maquettes, des tableaux de bord ou des scènes en couches, c’est l’amélioration à surveiller.
Détails réalistes : petit texte qui reste lisible
Le rendu du texte a longtemps été le point fort de la série Qwen, et 3.0 abaisse le seuil jusqu'à du petit texte de 10 px qui reste lisible. Dans les exemples, cela tient bon dans les cas difficiles : une page entière de LaTeX académique avec des exposants, des indices, des lettres grecques et une numérotation des théorèmes corrects ; un journal avec un corps de texte dense sur du papier réaliste ; de minuscules étiquettes d'annotation sur une planche scientifique.
*Exemple officiel de Qwen-Image-3.0 (via qwen.ai) : une plaque de style taxonomique construite autour d’une photo, avec de petites étiquettes et des barres d’échelle de 0,5 mm qui restent nettes.*
Ce qui ressort de ces exemples, c’est que les petits caractères ne se transforment pas en bruit. Les légendes, notes de bas de page et libellés d’axes conservent leur forme à des tailles où le texte illisible est généralement le mode d’échec habituel. Le niveau de détail ne se limite pas au texte non plus : Qwen affiche une texture de peau au niveau des pores et des cheveux qui frôle le réalisme photographique, ainsi qu’une retouche qui restaure une peinture traditionnelle à l’encre endommagée, en comblant les zones manquantes tout en préservant le coup de pinceau original.
Connaissances riches : 12 langues, plus de 100 styles et une sortie connectée au web
Le troisième pilier est l’étendue. Qwen-Image-3.0 rend 12 langues nativement (le japonais, le coréen et l’espagnol figurent parmi les démonstrations), prend en charge plus de 100 styles artistiques et plusieurs polices, et produit des interfaces utilisateur simulées convaincantes pour le web, les jeux et les diffusions en direct.
*Exemple officiel de Qwen-Image-3.0 (via qwen.ai) : une affiche de connaissances à image unique avec huit sections et des dizaines de petits libellés, tous lisibles.*
Deux capacités se sont démarquées. Il crée des infographies de référence détaillées à partir d’une photo réelle : la figure ci-dessus ajoute des étiquettes taxonomiques, des annotations morphologiques, une vue détaillée agrandie et une barre d’échelle à une image source. Et Qwen montre qu’il extrait des informations en direct du web, en générant dans une démonstration un graphique de prévision météorologique pour une ville et une date spécifiques. Cela va au-delà de « dessine ce que je décris » pour tendre vers « dessine ce qui est actuel » — même si, comme pour toute figure générée, il faudrait quand même vérifier les faits avant de s’y fier.
Comment il se compare aux autres modèles d’images à forte composante textuelle
Si vous choisissez un modèle pour un travail riche en texte ou en mise en page, voici les alternatives réalistes. Les évaluations ci-dessous sont indicatives, pas issues de benchmarks : Qwen n’a publié aucun score pour la version 3.0, donc considérer tout chiffre comparatif comme un fait reviendrait à deviner.
| Modèle | Rendu de texte | Mises en page complexes | Édition | Comment y accéder |
|---|---|---|---|---|
| Qwen-Image-3.0 | Très puissant ; lisible à 10 px, qualité LaTeX | Très puissant ; 4,5k tokens, 9 panneaux en un seul essai | Oui (annotations, restauration) | Qwen Studio, Qwen API |
| Qwen-Image-2.0 | Puissant | Bon ; ~1k tokens | Oui (unifié) | Qwen Studio, points de terminaison tiers |
| Nano Banana Pro | Bon | Bon | Oui | Google ; API unifiée |
| Seedream 5 Pro | Bon | Bon | Oui | ByteDance ; API unifiée |
| GPT-Image-2 | Bon | Bon | Oui | OpenAI ; API unifiée |
Lorsque vous les comparez vous-même, trois tests distinguent un modèle « capable de traiter du texte » d’un modèle fiable : savoir si les petits caractères restent lisibles à l’échelle d’une affiche, si les mises en page à panneaux multiples conservent leur structure au lieu de se fondre les unes dans les autres, et si le modèle conserve la véritable écriture d’une langue plutôt que de s’en approcher approximativement. Qwen a construit la version 3.0 précisément autour de ces trois points. Si vous utilisez déjà Nano Banana Pro, Seedream 5 ou GPT-Image-2 via une API unique comme AIReiter, notez que Qwen-Image-3.0 n’est pas encore dans ce catalogue ; pour l’instant, il n’existe que sur la propre plateforme de Qwen.
Comment essayer Qwen-Image-3.0 aujourd’hui
Le jour du lancement, la solution la plus fiable est la propre plateforme de Qwen :
- Qwen Studio sur chat.qwen.ai, sur le web, iOS, Android, macOS et Windows. C'est la voie la plus directe vers le modèle le jour du lancement ; ouvrez l'outil d'image et saisissez-y votre prompt.
- La plateforme API de Qwen (Qwen Cloud) pour l'accès programmatique.
- Les fiches modèle Qwen-Image sur Hugging Face pour les détails techniques de la famille.
Pour exploiter la puissance des 4,5 k tokens, rédigez une consigne qui précise explicitement la structure : nommez chaque panneau, son titre et le texte exact que vous souhaitez y voir, plutôt qu’une seule phrase vague. Un squelette à adapter :
Create a single 2x2 poster infographique, "Méthodes d’infusion du café".
En haut à gauche — "Pour Over" : 3 étapes avec libellés (rincer le filtre, fleurir 30 s, verser en cercles), petite légende "1:16 ratio, 92°C".
En haut à droite — "French Press" : schéma étiqueté, légende "4 min d’infusion, mouture grossière".
En bas à gauche — "Espresso" : coupe transversale d’un shot avec des couches étiquetées (crema, body, heart), légende "9 bar, 25-30s".
En bas à droite — "AeroPress" : étapes numérotées, légende "méthode inversée".
Style d’illustration plate cohérent, petites légendes lisibles, fond blanc.
Plus l’instruction de mise en page est concrète, plus vous utilisez réellement la nouvelle capacité.
Une réserve issue des tests du jour du lancement : le 21 juillet, un endpoint tiers qwen/text-to-image que j’ai essayé (via la marketplace Kie) a renvoyé des erreurs 500 répétées après avoir accepté la tâche. Il s’agit d’un seul fournisseur, pas d’une preuve d’une panne à l’échelle de la plateforme, mais si un endpoint Qwen en aval échoue pour vous aujourd’hui, la solution la plus sûre est d’aller directement sur Qwen Studio jusqu’à ce que les miroirs se stabilisent.
Ce que nous ne savons toujours pas
Comme cela a été lancé il y a quelques heures, quelques éléments ne sont pas encore publics, et vous devriez être sceptique envers toute personne les présentant comme des faits :
- Tarification. L’annonce de Qwen n’inclut aucune grille tarifaire d’API. Tout coût spécifique par image que vous voyez aujourd’hui n’est qu’une estimation.
- Poids ouverts. Les modèles d’image Qwen précédents étaient téléchargeables, mais Qwen n’a pas indiqué si les poids de la version 3.0 seront publiés. La communauté a débattu ouvertement de la question de savoir si Qwen se dirige vers des modèles fermés, donc n’assumez pas encore pouvoir auto-héberger 3.0.
- Paramètres et benchmarks. Aucun nombre de paramètres ni score de benchmark n’accompagnait cette publication. Les chiffres qui circulent appartiennent généralement à 2.0.
FAQ
Qwen Image 3 est-il gratuit ?
Vous pouvez utiliser Qwen-Image-3.0 via Qwen Studio sur chat.qwen.ai, qui offre un accès gratuit aux outils de chat et d'image de Qwen. Qwen n'a pas encore publié de tarification API, donc les coûts des niveaux payants pour une utilisation programmatique sont encore inconnus.
Puis-je télécharger Qwen-Image-3.0 ?
Non confirmé. L’article de lancement de Qwen n’indique pas si les poids de la version 3.0 seront disponibles en téléchargement. Les versions précédentes étaient disponibles sur Hugging Face, mais considérez la version 3.0 comme réservée au cloud jusqu’à ce que Qwen indique le contraire.
En quoi Qwen Image 3 est-il différent de la version 2.0 ?
Les changements les plus importants sont un passage d’environ 1k à 4,5k tokens en entrée de prompt, un rendu lisible du petit texte en 10px, des mises en page complexes en un seul passage comme une grille à neuf panneaux, du texte natif en 12 langues, et une génération connectée au web. Qwen présente cela comme le passage de « beau à regarder » à « utile ».
Qwen Image 3 gère-t-il le texte non anglais ?
Oui. Qwen indique qu'il affiche nativement 12 langues, et les démonstrations incluent le japonais, le coréen et l'espagnol rendus dans l'écriture propre à chaque langue plutôt qu'avec des caractères approximatifs.
Où puis-je utiliser Qwen Image 3 en ligne ?
Qwen Studio (chat.qwen.ai) est la voie officielle en ligne, avec des applications web et mobiles. L’accès programmatique est disponible via la plateforme API de Qwen.
