À peine un jour après le lancement de Qwen-Image-3.0, des sites tiers affichaient déjà des tarifs par image. Le problème : aucun ne s’appuie sur une source officielle. Au 22 juillet 2026, le modèle ne figure tout simplement pas dans la grille tarifaire officielle d’Alibaba Cloud.
Ce qui est établi, en revanche : Qwen Image 3 s’utilise gratuitement sur chat.qwen.ai, ses prix API n’ont pas été publiés et aucun poids n’est disponible au téléchargement, au 22 juillet 2026. Son principal argument est un rendu de texte de troisième génération qui reste net à très petite taille : l’exemple officiel de Qwen ci-dessous conserve des étiquettes fines et des barres d’échelle de 0.5mm parfaitement lisibles.
Exemple officiel de Qwen-Image-3.0 (via qwen.ai) : une planche de type taxonomique construite autour d’une photo, dont les petites annotations et les barres d’échelle de 0.5mm restent nettes.
Utiliser Qwen-Image-3.0 gratuitement dès maintenant
La voie vérifiée passe par la plateforme de Qwen :
- Qwen Studio, sur chat.qwen.ai, disponible sur le Web, iOS, Android, macOS et Windows. Ouvrez l’outil d’image et saisissez votre prompt : c’est le parcours vers lequel renvoie l’annonce de Qwen elle-même. Lors de ma vérification le 22 juillet, l’outil fonctionnait avec un compte gratuit, sous réserve de limites d’usage dont Qwen n’a pas précisé la nature.
- La plateforme API de Qwen (Qwen Cloud), pour un accès programmatique, lorsque la version 3.0 y apparaîtra. Au 22 juillet, elle n’était toujours pas présente dans la liste officielle des tarifs : considérez donc que le déploiement API est encore en cours.
- Les fiches des modèles Qwen-Image sur Hugging Face, pour les détails techniques des générations précédentes.
Attention aux accès tiers. Le 22 juillet, le catalogue de la marketplace Kie ne proposait pour Qwen que les générations antérieures, via les endpoints qwen/text-to-image et qwen2/text-to-image, sans modèle 3.0. Un endpoint tiers baptisé « Qwen image 3 » aussi tôt après le lancement mérite donc une certaine méfiance : il peut très bien rediriger vers un ancien modèle.
La stabilité est un autre sujet. Le jour du lancement, le 21 juillet, l’endpoint qwen/text-to-image de cette plateforme a renvoyé à répétition des erreurs 500 après avoir accepté mes tâches. Les défaillances d’un seul fournisseur ne suffisent pas à conclure à une panne générale, mais elles constituent une raison de plus de commencer par Qwen Studio.
Tarifs : les faits, puis les suppositions
Qwen n’a publié aucune grille tarifaire API pour la version 3.0. Tout prix précis par image actuellement avancé pour Qwen Image 3 n’a donc aucune source officielle.
La génération précédente reste le meilleur point de comparaison disponible. Dans la tarification officielle, la famille 2.0 se situe ici :
| Modèle | Tarif officiel | Quota gratuit (région de Singapour) |
|---|---|---|
| qwen-image-plus | $0.03 / image | 100 images, 90 jours |
| qwen-image-2.0 | $0.035 / image | 100 images, 90 jours |
| qwen-image-2.0-pro | $0.075 / image | 100 images, 90 jours |
| qwen-image-max | $0.075 / image | 100 images, 90 jours |
Si la version 3.0 suit la logique de la gamme, elle devrait se positionner au niveau de l’offre pro ou au-dessus. C’est une déduction, pas une annonce. Tant que le chiffre réel n’est pas publié, l’accès gratuit via Qwen Studio est le seul tarif sur lequel vous pouvez compter.
À qui Qwen-Image-3.0 s’adresse — et à qui non
Vous avez intérêt à l’adopter dès maintenant si vous produisez :
- Des mises en page denses en informations : infographies, sujets d’examen, affiches, storyboards ou contenus explicatifs à plusieurs panneaux, où la structure et les petits textes doivent rester lisibles. C’est précisément le terrain pour lequel 3.0 a été conçu, et aucun des modèles du tableau comparatif ci-dessous ne revendique un budget d’instructions comparable.
- Du texte multilingue intégré à des images : 12 langues rendues dans leurs écritures réelles, un atout pour les contenus e-commerce et éducatifs localisés.
- Des maquettes d’interface et des scènes imbriquées : les démonstrations de composition en profondeur visent directement les usages produit et design.
Mieux vaut attendre si vous êtes dans l’un de ces cas :
- Vous avez besoin d’auto-hébergement ou de fine-tuning. Aucun poids de 3.0 n’était téléchargeable au 22 juillet 2026, après vérification sur Hugging Face, et aucun calendrier de publication n’a été annoncé.
- Vous construisez un pipeline API de production. Sans tarif publié, sans limites de débit documentées ni SLA, 3.0 n’est pas encore prêt à devenir une dépendance critique. La famille 2.0 et des concurrents comme Nano Banana Pro le sont déjà aujourd’hui.
- Votre livrable doit rester modifiable. Une page de journal ou une diapositive générée reste une image matricielle. Si le client demande des retouches, un outil de mise en page associé à un modèle d’image classique demeure un flux de travail plus sûr.
Face aux autres modèles performants sur le texte
Pour les projets dominés par le texte ou la mise en page, voici les alternatives réalistes. Les appréciations ci-dessous sont indicatives et ne reposent pas sur des benchmarks : Qwen n’a publié aucun score pour 3.0, et présenter un quelconque chiffre comparatif comme un fait reviendrait à spéculer.
| Modèle | Rendu de texte | Mises en page complexes | Édition | Accès |
|---|---|---|---|---|
| Qwen-Image-3.0 | Très fort ; lisible à 10px selon Qwen, niveau LaTeX | Très fort ; 4.5k tokens, 9 panneaux en une génération | Oui (annotations, restauration) | Qwen Studio ; API en attente |
| Qwen-Image-2.0 | Fort | Bon ; ~1k tokens | Oui (unifié) | Qwen Studio, endpoints tiers |
| Nano Banana Pro | Bon | Bon | Oui | Google ; API unifiée |
| Seedream 5 Pro | Bon | Bon | Oui | ByteDance ; API unifiée |
| GPT-Image-2 | Bon | Bon | Oui | OpenAI ; API unifiée |
Pour les comparer vous-même, trois tests permettent de distinguer un modèle simplement « capable de générer du texte » d’un modèle réellement fiable :
- Les petits caractères restent-ils lisibles à l’échelle d’une affiche ?
- Les mises en page à plusieurs panneaux conservent-elles leur structure sans se fondre les unes dans les autres ?
- Le modèle respecte-t-il l’écriture réelle d’une langue au lieu d’en produire une approximation ?
Si vous utilisez déjà Nano Banana Pro, Seedream 5 ou GPT-Image-2 via une API unique telle que AIReiter, notez que Qwen-Image-3.0 ne figure pas encore dans ce catalogue. Au 22 juillet, la seule voie que j’ai pu confirmer restait la plateforme de Qwen.
Les vraies nouveautés de la version 3.0
Qwen présente ses générations comme une progression : la 1.0 était « accurate », la 2.0 « accurate, varied, complete, beautiful, real », et la 3.0 est « substantial » — résumée par Qwen en un mot : « 实 ». L’objectif est de produire des visuels directement exploitables dans un flux de travail de design, d’éducation, d’e-commerce ou de création de contenus, plutôt que de simples brouillons.
Cette sortie s’articule autour de trois piliers.
Contenus riches : prompts de 4.5k tokens et compositions complexes en une passe
Le chiffre à retenir est la longueur des prompts. Qwen-Image-3.0 accepte jusqu’à 4.5k tokens en entrée, un bond important face aux quelque 1k tokens d’instructions attribués par Qwen à la génération précédente. Un token est une unité de texte lue par le modèle : plus il y en a, plus vous pouvez décrire une scène dense et structurée en une seule requête.
Ce budget débloque deux usages. Le premier, que Qwen qualifie d’horizontal, est illustré par la démonstration à neuf panneaux de l’annonce de Qwen : chaque case y devient une infographie détaillée distincte et, selon Qwen, l’ensemble a été généré en une seule passe. Toujours d’après Qwen, la description complète de cette grille a nécessité environ 3.7k tokens, au-delà de l’ancienne limite.
Le second concerne la profondeur : des interfaces intégrées dans d’autres interfaces. L’exemple de Qwen montre une fenêtre VS Code contenant une fenêtre de chat Qwen, qui contient elle-même une conversation WeChat avec une affiche de café ; chaque niveau conserve une interface réaliste. Pour les maquettes, tableaux de bord et scènes à plusieurs niveaux, c’est l’évolution à surveiller.
Pour tirer parti des 4.5k tokens, formulez un prompt qui décrit explicitement la structure : nommez chaque panneau, son titre et le texte exact à y intégrer. Voici un squelette à adapter :
Créez une infographie unique en 2x2, « Méthodes de préparation du café ».
En haut à gauche — « Pour Over » : 3 étapes avec étiquettes (rincer le filtre, bloom 30 s, verser en cercles), petite légende « ratio 1:16, 92 °C ».
En haut à droite — « French Press » : schéma annoté, légende « infusion 4 min, mouture grossière ».
En bas à gauche — « Espresso » : coupe d’un shot avec couches annotées (crema, corps, cœur), légende « 9 bars, 25-30 s ».
En bas à droite — « AeroPress » : étapes numérotées, légende « méthode inversée ».
Style d’illustration à plat cohérent, petites légendes lisibles, fond blanc.
Du détail crédible : un texte lisible même en petit
Le rendu typographique est depuis longtemps l’un des points forts de la série Qwen, et Qwen affirme que 3.0 conserve un texte lisible jusqu’à 10px.
Les exemples fournis s’attaquent aux cas les plus difficiles : une page académique complète en LaTeX avec exposants, indices, lettres grecques et numérotation de théorèmes corrects ; un journal à la typographie dense ; et la planche scientifique en tête de cet article, dont les annotations restent lisibles à la taille d’une légende de miniature. Il s’agit de démonstrations de lancement sélectionnées par Qwen, et non de tests indépendants, mais elles montrent que légendes, notes de bas de page et étiquettes d’axes gardent leur forme là où le texte déformé est habituellement la norme.
Le niveau de détail ne s’arrête pas au texte : Qwen montre une texture de peau, pores et cheveux compris, qui se rapproche du photoréalisme, ainsi qu’une retouche restaurant une peinture traditionnelle à l’encre endommagée tout en préservant le trait d’origine.
Connaissances étendues : 12 langues, plus de 100 styles et des sorties connectées au Web
Le troisième pilier est l’étendue des capacités. Qwen-Image-3.0 produit nativement du texte dans 12 langues — les démonstrations incluent notamment le japonais, le coréen et l’espagnol — prend en charge 100+ styles artistiques et plusieurs polices, et génère des interfaces simulées convaincantes pour le Web, les jeux et les livestreams.
Exemple officiel de Qwen-Image-3.0 (via qwen.ai) : une affiche de connaissances en une seule image, avec huit sections et des dizaines de petites étiquettes toutes lisibles.
Deux démonstrations ressortent particulièrement. Dans la première, le modèle construit une infographie de référence à partir d’une photo réelle, en ajoutant des étiquettes taxonomiques, des annotations morphologiques, une vue de détail agrandie et une barre d’échelle. Dans la seconde, Qwen le montre récupérant des informations en direct sur le Web pour produire un visuel de prévisions météo pour une ville et une date précises.
Ces deux démonstrations ont été produites par Qwen. L’entreprise n’a pas indiqué si l’import de photos et la récupération Web sont disponibles dans toutes les interfaces publiques de Qwen Image 3 : vérifiez donc leur présence dans la vôtre avant de bâtir un flux de travail autour de ces fonctions.
Ce que nous ignorons encore
Plusieurs éléments n’ont toujours pas été publiés. Méfiez-vous donc de quiconque les présenterait comme des certitudes :
- Le prix de l’API. Comme indiqué plus haut, rien d’officiel au 22 juillet. La fourchette de prix de la famille 2.0 est le seul repère solide.
- Les poids ouverts. Les anciens modèles d’image Qwen étaient téléchargeables — la version 1.0 était sortie comme un MMDiT ouvert de 20B — mais Qwen n’a pas précisé si les poids de 3.0 seraient publiés, et rien n’est apparu sur Hugging Face depuis le lancement.
- Les paramètres et benchmarks. Cette sortie ne s’est accompagnée ni d’un nombre de paramètres ni de scores de benchmark, et 3.0 n’apparaît pas encore dans les arènes publiques de text-to-image. Les chiffres qui circulent concernent généralement la version 2.0.
FAQ
Qwen Image 3 est-il gratuit ?
Oui, via Qwen Studio sur chat.qwen.ai, où l’outil d’image fonctionne avec un compte gratuit soumis à des limites d’usage, vérifié le 22 juillet 2026. Qwen n’a pas publié de tarification API ; la fourchette officielle de la famille 2.0 va de $0.03 à $0.075 par image.
Puis-je télécharger Qwen-Image-3.0 ?
Non. Au 22 juillet 2026, aucun poids de 3.0 n’était disponible sur Hugging Face et le billet de lancement de Qwen ne promet pas leur publication. Les versions antérieures restent téléchargeables, mais considérez 3.0 comme un modèle exclusivement cloud tant que Qwen n’aura pas annoncé le contraire.
Quelles différences entre Qwen Image 3 et 2.0 ?
Le budget de prompt passe d’environ 1k à 4.5k tokens, les petits textes restent lisibles à des tailles que Qwen situe à 10px, et la génération ajoute du texte natif dans 12 langues ainsi que des sorties connectées au Web. Qwen présente cette évolution comme le passage du « beau » à l’« utile ».
Qwen Image 3 gère-t-il le texte dans d’autres langues que l’anglais ?
Oui. Qwen indique que le modèle rend 12 langues nativement, et les démonstrations incluent du japonais, du coréen et de l’espagnol écrits dans leur alphabet réel, et non sous la forme de caractères approximatifs.
Où utiliser Qwen Image 3 en ligne ?
Qwen Studio (chat.qwen.ai) est la voie officielle en ligne, avec des applications Web et mobiles. L’accès API n’apparaît pas encore dans la grille tarifaire officielle, et la marketplace tierce que j’ai vérifiée ne propose pas la version 3.0 : Qwen Studio est donc actuellement le seul accès confirmé.