Qwen Image 2.1 est disponible sous forme de poids téléchargeables, mais aussi via des services hébergés par des tiers. Dans ce second cas, les endpoints, les tarifs, les schémas de requête et les résultats peuvent varier. Pour un usage en production, il est donc plus important de distinguer le modèle officiel de ses wrappers que de se fier au seul nom Qwen Image 2.1.
L’essentiel sur l’API, en un tableau
La documentation officielle présente les poids du modèle ainsi que des solutions d’exécution locale, mais pas d’endpoint hébergé first-party avec un tarif public par image. L’annonce officielle et le dépôt GitHub décrivent un générateur visuel 7B, un encodeur Qwen3-VL 8B, la transparence native et la retouche à partir de plusieurs images de référence.
| Question | Réponse pratique |
|---|---|
| API hébergée officielle | Aucun endpoint first-party ni tarif par image clairement documenté trouvé |
| Accès officiel | Poids, code, Diffusers, ComfyUI et intégrations de serving |
| Accès hébergé | Des services tiers existent, avec des contrats propres à chaque fournisseur |
| Retouche | Génération et retouche unifiées, avec jusqu’à 10 images de référence dans le workflow documenté |
| Transparence | Le checkpoint prend en charge le RGBA, mais un service hébergé peut renvoyer du RGB |
| Usage commercial | Consultez la version actuelle de la Qwen Research License avant toute mise en production |
Ce que recouvre réellement la disponibilité d’une « API »
Vous pouvez héberger vous-même les poids, encapsuler l’inférence locale dans un service HTTP interne ou appeler un endpoint tiers. L’existence d’un identifiant de modèle chez un fournisseur ne transforme pas ce service en API officielle de Qwen.
Le guide SpicyAPI consacré à Qwen Image 2.1 documente les routes de ce fournisseur pour la génération texte-image standard, la retouche standard, la génération texte-image avec LoRA et la retouche avec LoRA. Il mentionne les paramètres aspect_ratio et resolution, les paliers 1k, 1.5k et 2k, jusqu’à 10 images de référence et jusqu’à trois LoRA. Ces détails relèvent du contrat SpicyAPI et ne sont pas nécessairement valables pour tous les déploiements de Qwen.
Gardez ces spécificités derrière un adaptateur :
| Champ interne | Rôle |
|---|---|
prompt | Instruction de retouche et éléments à préserver |
references[] | Images ordonnées avec des rôles comme sujet ou vêtement |
edit_region | Cercle, annotation ou masque séparé |
aspect_ratio / resolution | Composition et niveau de résolution |
output_format | Format cible PNG, JPEG ou WebP |
seed | Suivi des variantes, sans garantir une reproduction déterministe |
provider_metadata | Route, identifiant du modèle, identifiant de requête, coût et format renvoyé |
Le guide SpicyAPI précise que son schéma 2.1 rejette le champ size utilisé par Qwen Image 2.0 au lieu de l’ignorer. Convertissez ce type de paramètre à la frontière de l’adaptateur plutôt que de le disséminer dans le code applicatif.
Mettre en place un workflow de retouche fiable
1. Définir la modification et le rôle de chaque référence
Commencez par préciser la modification attendue, les éléments à préserver et les conditions d’échec. Attribuez un rôle à chaque image de référence et utilisez d’abord le minimum nécessaire : des images supplémentaires peuvent introduire des attributs contradictoires et augmenter le coût facturé par le fournisseur.
2. Ajouter une indication de zone, puis vérifier les débordements
L’annonce de Qwen montre des retouches locales guidées par des cercles colorés, des annotations peintes et des masques séparés. Lorsque le service le permet, le masque séparé est préférable : il n’ajoute pas de repère graphique par-dessus l’image source. Les cercles et les coups de pinceau sont des indications sémantiques pratiques, pas des limites strictes au pixel près.
Rédigez un prompt qui identifie clairement la zone cible et les invariants :
« Change la veste à l’intérieur de la zone marquée en bleu pour la rendre vert foncé. Supprime la marque bleue. Préserve le visage, les mains, l’arrière-plan, le logo et l’éclairage. »
SpicyAPI indique que les retouches guidées par un cercle peuvent modifier des pixels situés hors de la zone marquée. Comparez donc les régions protégées avec l’image d’origine avant d’accepter le résultat.
3. Explorer en 1K, puis passer les résultats retenus en 2K
Faites vos essais en 1k, puis relancez uniquement les briefs validés en 2k. La route citée indique que la résolution modifie le prix, contrairement au ratio d’aspect sur ce service ; ne transposez pas cette règle de facturation à un autre fournisseur.
Validez systématiquement le fichier renvoyé :
- Type MIME et dimensions en pixels.
- Présence réelle d’un canal alpha, et pas seulement d’une extension
.png. - Visages, mains, logos, textes présents sur le produit et typographies fines.
- Pixels situés hors de la zone demandée.
- Attributs requis par chacune des images de référence.
- Écart réellement significatif par rapport à la version précédemment retenue.
Le checkpoint prend en charge la génération native en RGBA, mais SpicyAPI indique que sa route renvoyait du RGB sur trois canaux avec un arrière-plan blanc pour les requêtes PNG. Inspectez les canaux de l’image et effectuez un vrai test de superposition avant de compter sur la transparence.
4. Conserver les informations nécessaires pour comparer les résultats
Pour chaque image retenue, archivez le prompt normalisé, l’ordre des références, l’élément de retouche, les identifiants du modèle et du fournisseur, la résolution, le seed, l’identifiant de requête et les métadonnées du fichier renvoyé. SpicyAPI précise qu’un seed ne garantit pas des résultats identiques au pixel près.
À retenir du test : qualité et compromis de déploiement
Le score publié par Qwen dans Qwen-Image-Bench est de 60.28, contre 59.82 pour Nano Banana 2.0 et 59.65 pour GPT Image 1.5 dans la comparaison citée. Il s’agit de résultats de benchmark communiqués par Qwen, et non d’un classement indépendant entre fournisseurs ; utilisez-les comme un indicateur lié à ce jeu de tests, pas comme la preuve d’une supériorité universelle.
L’empreinte du déploiement local est également plus importante que ne le laisse penser l’étiquette « 7B ». Le pipeline complet comprend le générateur visuel 7B, l’encodeur Qwen3-VL 8B et le VAE. APIMaster estime les poids BF16 à environ 33 GB et décrit une combinaison ComfyUI quantifiée d’environ 14 GB, tout en rappelant que les performances et la compatibilité matérielle exactes dépendent de la quantification et de l’offloading.
Quand Qwen Image 2.1 n’est pas le bon choix pour la production
Le principal obstacle est la licence. La licence de Qwen-Image-2.1 est une Qwen Research License ; les documents de publication indiquent que l’usage commercial nécessite une licence commerciale distincte. Une fonctionnalité SaaS payante, un livrable client ou une API d’inférence revendue doivent donc faire l’objet d’une validation juridique avant leur déploiement.
Le deuxième point de blocage concerne l’incertitude du contrat fournisseur. Un service peut ne pas préserver le RGBA natif, gérer les masques différemment ou modifier les identifiants de modèle et les tarifs. Comparez le coût par image acceptée, en incluant les frais GPU ou fournisseur ainsi que les tentatives rejetées lors de la validation.
Choisissez Qwen Image 2.1 lorsque le contrôle local, la retouche unifiée et les assets transparents justifient l’effort de déploiement et la démarche de licence. Préférez une API d’images commerciale gérée lorsque des conditions de service documentées et une facturation stable comptent davantage que la maîtrise de la pile de modèles.
FAQ
L’API peut-elle renvoyer des PNG transparents ?
Le modèle prend en charge la génération native en RGBA, mais un service hébergé peut renvoyer du RGB. Inspectez les canaux du fichier reçu avant de vous appuyer sur la transparence.
Combien d’images de référence faut-il utiliser pour une retouche ?
Le workflow documenté en accepte jusqu’à 10. Commencez par le plus petit ensemble clairement identifié qui contient toutes les informations nécessaires.
Un seed fixe garantit-il un résultat identique ?
Non. La reproductibilité dépend aussi du fournisseur, de l’environnement d’exécution, de la version du modèle, du scheduler et d’autres paramètres.
Puis-je utiliser Qwen Image 2.1 dans un produit payant ?
Pas automatiquement. Consultez la version actuelle de la Qwen Research License et obtenez l’autorisation commerciale requise avant d’utiliser le modèle dans un workflow générant des revenus.
La vérification indispensable avant la mise en production
Ne déployez le modèle qu’après avoir vérifié la route utilisée, la licence, le schéma, le comportement du canal alpha, la gestion de la zone de retouche et le coût par image acceptée. En attendant, gardez Qwen Image 2.1 en recherche ou en staging au lieu de considérer un wrapper comme une API officielle.