AIREITER
DOCS APITARIFS
MODÈLES
  • AIReiter
  • Blog
  • Qwen-Audio-3.0-TTS : le modèle TTS en tête de l’Arena

Qwen-Audio-3.0-TTS : le modèle TTS en tête de l’Arena

Dernière mise à jour: 2026-07-22 07:43:33

En juillet 2026, Qwen-Audio-3.0-TTS-Plus d’Alibaba a pris la tête de l’Arena Text-to-Speech d’Artificial Analysis. Avec un Quality Elo de 1 237, il devance Gemini 3.1 Flash TTS de Google, MiniMax Speech 2.8 HD et Eleven v3 d’ElevenLabs. Son tarif est de 27,6 $ par million de caractères, soit environ un tiers du prix demandé par ElevenLabs et MiniMax pour les offres qu’il surclasse. Ce n’est pas le modèle le moins cher du classement, mais aucun autre ne associe la première place en qualité à ce niveau de prix. (Chiffres relevés le 20 juillet 2026 : les positions et les tarifs évoluent fréquemment, vérifiez-les avant de bâtir votre choix dessus.)

Classement Text-to-Speech d’Artificial Analysis avec Qwen-Audio-3.0-TTS-Plus en première position

Voici ce que propose ce modèle, ce qui explique son classement, combien il coûte et dans quels cas il est — ou non — le bon choix.

Qwen-Audio-3.0-TTS n’est pas Qwen3-TTS

Une recherche sur « Qwen audio 3.0 TTS » renvoie le plus souvent vers Qwen3-TTS, la précédente famille vocale à poids ouverts publiée par Alibaba sur GitHub et via une démo Hugging Face. C’est elle que l’on exécute en local, que l’on relie à ComfyUI et que Reddit cite souvent pour le clonage vocal. Ce n’est pas le produit traité dans cet article.

Qwen-Audio-3.0-TTS est la nouvelle génération hébergée, proposée dans Alibaba Cloud Model Studio (Bailian) plutôt que sous forme de poids téléchargeables. Elle se décline en deux offres :

  • Plus — l’offre privilégiant la qualité, celle qui occupe la première place, conçue pour les livres audio, la narration et le doublage lorsque le naturel compte davantage que quelques millisecondes.
  • Flash — l’offre pensée pour la latence, avec un délai avant le premier paquet d’environ 300 ms, destinée aux interactions en temps réel telles que les agents vocaux et les assistants en direct.

L’écart entre les générations est net sur ce même classement : l’ancien Qwen3 TTS Flash affiche un Elo de 929 environ (rang ~76), tandis que la nouvelle offre Plus domine avec 1 237. Même lignée de marque, mais une tout autre catégorie de modèle.

Les usages ne sont pas les mêmes non plus. Pour choisir entre les deux, voici la distinction :

Qwen3-TTS (poids ouverts)Qwen-Audio-3.0-TTS (hébergé)
AccèsTéléchargement des poids (GitHub / Hugging Face)API via Alibaba Cloud Model Studio
Auto-hébergement / exécution localeOuiNon — hébergé uniquement
ComfyUI et nœuds communautairesOuiNon
OffresUne famille open sourcePlus (qualité) / Flash (~300 ms)
Couverture linguistique~10 langues16 langues + 20 dialectes chinois
Quality Elo dans l’Arena~929 (Qwen3 TTS Flash)1 237 (Plus, n°1)
Idéal pourContrôle local, résidence des données, expérimentationQualité maximale, dialectes, production à grande échelle

Préférez la gamme à poids ouverts lorsque le contrôle de l’hébergement ou l’absence de coût marginal priment ; optez pour les offres 3.0 hébergées si la qualité, la diversité des dialectes ou l’absence de GPU à gérer comptent davantage.

Le benchmark derrière la première place

L’Arena d’Artificial Analysis est un classement indépendant fondé sur des préférences humaines et des écoutes à l’aveugle : les participants comparent des extraits sans savoir quel modèle les a produits, et le score Elo reflète la fréquence à laquelle chaque modèle l’emporte.

Voici le haut du classement au 20 juillet 2026 :

RangModèleQuality EloPrix API / 1 M de caractères
1Qwen-Audio-3.0-TTS-Plus (Alibaba)1 23727,6 $
2Simba 3.2 (SpeechifyAI)1 23210,0 $
3Gemini 3.1 Flash TTS (Google)1 21118,3 $
4Sonic 3.5 (Cartesia)1 21149,0 $
8MiniMax Speech 2.8 HD1 180100,0 $
11ElevenLabs Eleven v31 173100,0 $

Les métriques publiées par Alibaba vont dans le même sens que ce classement indépendant. Sur le benchmark multilingue CV3-Eval, le fournisseur indique un taux moyen d’erreurs sur les mots/caractères de 3,96 pour Plus et de 3,87 pour Flash : autrement dit, la parole synthétisée est retranscrite presque aussi fidèlement que le texte source. La similarité du locuteur, qui mesure à quel point une voix clonée correspond à son échantillon de référence, atteint 82,75 pour Plus sur les 16 langues testées. Ces deux chiffres viennent d’Alibaba ; l’Elo ci-dessus, non. Un benchmark isolé doit servir de point de départ : testez toujours avec vos propres contenus audio.

Ses points forts en production

Ce classement repose sur quatre capacités concrètement utiles en production, détaillées sur la page technique officielle de Qwen-Audio-3.0-TTS.

Présentation des capacités de Qwen-Audio-3.0-TTS et résultats CV3-Eval

Pilotage par instructions libres. La voix se guide en langage naturel : « lis ce texte comme un animateur radio anxieux, tard dans la nuit, en ralentissant vers la fin ». Vous pouvez agir sur le rôle, l’émotion, le style de parole, le débit, le timbre et l’accent, sans devoir apprendre un langage de balisage pour les réglages généraux.

Balises intégrées très précises. Lorsqu’un contrôle plus fin est nécessaire, le modèle interprète 86 balises insérées directement dans le texte, y compris des événements non verbaux comme le rire, la respiration, la toux et le soupir. C’est ce qui sépare une lecture uniforme d’une véritable interprétation, et ce qui rend le modèle exploitable pour les dialogues de jeu, la narration et le doublage de films.

Une couverture étendue des langues et dialectes. Le modèle prend en charge 16 langues, dont sept nouvellement ajoutées : arabe, indonésien, portugais, thaï, vietnamien, malais et tagalog. Il couvre aussi 20 régions dialectales chinoises, du cantonais et du shanghaïen au sichuanais et aux dialectes du Nord-Est. Pour les équipes qui se déploient en Asie du Sud-Est ou sur plusieurs marchés sinophones, cette couverture dialectale est difficile à égaler.

Robustesse et rendu audio. Le modèle clone des voix à partir d’audios de référence bruités, réverbérants ou peu clairs, sans étape distincte de débruitage. Il peut synthétiser jusqu’à trois minutes en une seule passe pour la narration longue et produit de l’audio en 48 kHz (le déploiement 48 kHz dans la console est prévu pour le 24 juillet). Cette génération en une passe sur trois minutes est importante : l’assemblage de clips plus courts est souvent là où la prosodie et le timbre dérivent.

Tarifs : la qualité n°1 sans facture premium

La synthèse vocale est facturée au caractère du texte en entrée : le coût augmente donc directement avec le volume narré.

À 27,6 $ par million de caractères, Qwen-Audio-3.0-TTS-Plus ne coûte qu’une fraction du prix de deux références premium historiques qu’il dépasse : ElevenLabs Eleven v3 et MiniMax Speech 2.8 HD sont tous deux affichés à 100 $ par million de caractères, soit environ 3,6 fois plus. Concrètement, un livre audio de 100 000 caractères — l’équivalent approximatif d’un court roman — revient à environ 2,76 $ sur Plus, contre environ 10 $ sur ces deux modèles.

Plus n’est toutefois pas l’option la moins chère du marché. Deux modèles légèrement en retrait sur la qualité sont moins onéreux : Gemini 3.1 Flash TTS à 18,3 $ par million de caractères (rang 3) et Simba 3.2 à 10 $ (rang 2, presque à égalité en Elo). Le positionnement exact est donc le suivant : Qwen offre la qualité la mieux classée à un tarif intermédiaire, et non le tarif le plus bas du tableau. Si quelques points d’Elo ne changent rien à votre cas d’usage, vous pouvez dépenser moins. (L’Arena publique affiche le prix de Plus ; le tarif par caractère de Flash n’y est pas encore publié, consultez donc la console pour connaître le montant actuel.)

Utiliser Qwen-Audio-3.0-TTS

La voie directe passe par Alibaba Cloud Model Studio (Bailian). Les formats de requête et SDK sont disponibles dans la documentation Model Studio : créez une clé API, puis appelez le modèle qwen-audio-3.0-tts-plus ou qwen-audio-3.0-tts-flash via l’endpoint du marché de modèles. Une approche raisonnable consiste à prototyper d’abord avec Flash pour vérifier que sa latence convient, puis à exécuter les mêmes scripts avec Plus pour comparer. Le bon choix dépend de votre priorité : interaction en direct ou narration écoutée de bout en bout.

Les équipes qui font déjà transiter plusieurs fournisseurs par un agrégateur compatible comme AIReiter, afin de centraliser leur facturation, peuvent l’y ajouter sans ouvrir un compte Alibaba distinct. Passer en direct reste le plus simple si c’est le seul modèle dont vous avez besoin.

Pour une conversation en temps réel plutôt qu’une narration ponctuelle, le TTS n’est qu’une couche de la pile : l’API omni Realtime et l’ASR en streaming qui l’accompagnent sont abordés dans le guide Qwen Audio 3 Realtime.

Faut-il l’adopter ?

  • Choisissez Plus si vous produisez de la narration, des livres audio ou du doublage en chinois, en dialectes chinois ou dans plusieurs langues, et recherchez le meilleur naturel par dollar dépensé.
  • Choisissez Flash si vous développez un agent vocal en temps réel, pour lequel un premier paquet à ~300 ms importe plus que les derniers points d’Elo en qualité.
  • Regardez Gemini 3.1 Flash TTS ou Simba 3.2 si le coût est le critère décisif et qu’une qualité proche du sommet vous suffit : les deux sont moins chers que Plus.
  • Restez chez ElevenLabs ou Cartesia si vous dépendez de leurs SDK plus matures, de leurs bibliothèques de voix préconfigurées plus étendues, ou de leurs outils et écosystèmes d’abord pensés pour l’anglais, domaines où ils restent en tête indépendamment de leur position dans l’Arena.

Parmi les modèles comparés ici, seul Plus réunit une première place dans l’Arena, 20 régions dialectales chinoises et un tarif de 27,6 $/M. Si cette combinaison correspond à votre usage, faites tourner vos propres scripts dessus avant de vous engager, plutôt que d’accepter le classement sur parole.

FAQ

Qwen-Audio-3.0-TTS est-il gratuit ?

Non. Les offres hébergées Plus et Flash sont payantes et facturées au caractère via Alibaba Cloud Model Studio ; Plus coûte 27,6 $ par million de caractères. Alibaba Cloud a ponctuellement proposé des quotas d’essai gratuits : consultez la console pour voir l’offre actuelle dans votre région. Qwen3-TTS à poids ouverts peut, lui, être auto-hébergé gratuitement.

Qwen-Audio-3.0-TTS est-il open source ? Peut-on le télécharger ?

Les offres hébergées Qwen-Audio-3.0-TTS-Plus/Flash ne sont pas distribuées sous forme de poids. Le modèle open source est la famille antérieure Qwen3-TTS, disponible sur GitHub et Hugging Face pour un usage local, le clonage vocal et les workflows ComfyUI. Ces versions sont liées, mais constituent des sorties distinctes.

Prend-il en charge le clonage vocal ?

Oui. Il clone une voix cible à partir d’un audio de référence et est spécifiquement optimisé pour rester performant lorsque cet échantillon est bruité ou réverbérant, sans nettoyage préalable. La similarité du locuteur atteint en moyenne 82,75 pour l’offre Plus sur 16 langues.

Qwen-Audio-3.0-TTS et Qwen3-TTS-Flash : quelle différence ?

Qwen3-TTS-Flash appartient à la génération antérieure à poids ouverts et se situe beaucoup plus bas dans l’Arena (Elo ~929). Qwen-Audio-3.0-TTS correspond à la nouvelle génération hébergée : son offre Flash cible une faible latence, tandis que Plus domine le classement de qualité avec un Elo de 1 237.

Existe-t-il une démo ou une prise en charge de ComfyUI ?

Qwen3-TTS à poids ouverts dispose d’une démo publique Hugging Face et de nœuds ComfyUI communautaires. Les offres hébergées Qwen-Audio-3.0-TTS s’utilisent via la console Alibaba Cloud Model Studio, plutôt que depuis une page de démo indépendante.

>_Répertoire des modèles AIReiter

Accès API rapide aux modèles liés à ce guide

Gemini 3.1 Pro

Chat
GoogleCréer une API Key >

Gemini 3 Pro

Chat
GoogleCréer une API Key >

Claude Fable 5

Chat

Un modèle Claude premium pour le raisonnement approfondi et le travail long et complexe.

AnthropicCréer une API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicCréer une API Key >

Claude Opus 4.8

Chat

Un modèle Claude hautement performant pour les tâches de raisonnement exigeantes et le travail professionnel.

AnthropicCréer une API Key >

Articles récents

Routage OpenRouter en région US : configuration et limites

2026-09-10

Alternatives à Civitai : Hugging Face, Tensor.Art, SeaArt et ComfyUI

2026-09-10

Tarifs de l’API Kling : coût officiel et agrégateurs (2026)

2026-09-10

Guide de l’outil Shell et de l’API Files d’OpenRouter (bêta)

2026-09-10
AIREITER

Des questions ? Contactez-nous à
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

Vidéo IA

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

Image IA

GPT-Image 2.5Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image Turbo

Blog

Voir tout →

Entreprise

Politique de confidentialitéConditions d'utilisationPolitique de remboursement

© 2026 AIReiter. Tous droits réservés.