AIREITER
DOC APIPREZZI
TEMPLATE
  • AIReiter
  • Blog
  • Qwen-Audio-3.0-TTS: il modello TTS in vetta all'arena

Qwen-Audio-3.0-TTS: il modello TTS in vetta all'arena

Ultimo Aggiornamento: 2026-07-22 07:42:53

A luglio 2026, Qwen-Audio-3.0-TTS-Plus di Alibaba ha conquistato il primo posto nella Text-to-Speech arena di Artificial Analysis, con un Quality Elo di 1.237. Supera Gemini 3.1 Flash TTS di Google, MiniMax Speech 2.8 HD ed Eleven v3 di ElevenLabs, pur avendo un prezzo di listino di $27.6 per milione di caratteri: circa un terzo di quanto chiedono ElevenLabs e MiniMax per i tier che lascia alle spalle. Non è il modello meno costoso della classifica, ma nessun altro abbina la qualità da #1 a questo prezzo. (I dati sono del 20 luglio 2026; classifiche e prezzi dei fornitori cambiano spesso, quindi verificateli prima di basare una scelta su questi numeri.)

Classifica Text-to-Speech di Artificial Analysis con Qwen-Audio-3.0-TTS-Plus al primo posto

Vediamo cos'è il modello, come ha ottenuto questo risultato, quanto costa e in quali casi conviene — oppure no — sceglierlo.

Qwen-Audio-3.0-TTS non è Qwen3-TTS

Cercando "Qwen audio 3.0 TTS", la maggior parte dei risultati rimanda a Qwen3-TTS: la precedente famiglia vocale a pesi aperti di Alibaba, pubblicata su GitHub e disponibile con una demo su Hugging Face. È il modello che si esegue in locale, si collega a ComfyUI e viene spesso apprezzato su Reddit per il voice cloning. Non è però il prodotto trattato in questa guida.

Qwen-Audio-3.0-TTS è la generazione hosted più recente, disponibile tramite Alibaba Cloud Model Studio (Bailian) anziché come pesi scaricabili. È proposto in due tier:

  • Plus — il tier che privilegia la qualità, quello in vetta alla classifica, pensato per audiolibri, narrazione e doppiaggio dove la naturalezza conta più dei millisecondi.
  • Flash — il tier orientato alla latenza, con una latenza del primo pacchetto attorno ai 300 ms, progettato per interazioni in tempo reale come agenti vocali e assistenti live.

La distanza generazionale emerge chiaramente nella stessa classifica: il precedente Qwen3 TTS Flash ha un Elo di 929 circa, attorno alla posizione 76, mentre il nuovo tier Plus guida con 1.237. Stesso ecosistema di marca, ma una classe di modello differente.

Anche gli scenari d'uso sono diversi. Ecco come orientarsi fra i due:

Qwen3-TTS (pesi aperti)Qwen-Audio-3.0-TTS (hosted)
Come ottenerloDownload dei pesi (GitHub / Hugging Face)API tramite Alibaba Cloud Model Studio
Self-hosting / esecuzione localeSìNo — solo hosted
ComfyUI e nodi della communitySìNo
TierUn'unica famiglia openPlus (qualità) / Flash (~300 ms)
Copertura linguistica~10 lingue16 lingue + 20 dialetti cinesi
Quality Elo nell'arena~929 (Qwen3 TTS Flash)1.237 (Plus, #1)
Ideale perControllo locale, residenza dei dati, sperimentazioneMassima qualità, dialetti, produzione su larga scala

Scegliete la linea a pesi aperti quando contano soprattutto il controllo dell'hosting o l'assenza di costi marginali; i tier hosted 3.0 sono più indicati se la priorità è la qualità, l'ampiezza della copertura dialettale o evitare di gestire GPU proprie.

Il benchmark dietro il primo posto

L'arena di Artificial Analysis è una classifica indipendente basata su preferenze umane e test alla cieca: gli ascoltatori confrontano clip senza sapere quale modello le abbia generate, mentre il punteggio Elo riflette la frequenza con cui ciascun modello prevale.

Questa è la parte alta dell'arena al 20 luglio 2026:

PosizioneModelloQuality EloPrezzo API / 1M caratteri
1Qwen-Audio-3.0-TTS-Plus (Alibaba)1.237$27.6
2Simba 3.2 (SpeechifyAI)1.232$10.0
3Gemini 3.1 Flash TTS (Google)1.211$18.3
4Sonic 3.5 (Cartesia)1.211$49.0
8MiniMax Speech 2.8 HD1.180$100.0
11ElevenLabs Eleven v31.173$100.0

Anche le metriche dichiarate da Alibaba indicano la stessa direzione. Sul benchmark multilingue CV3-Eval, il fornitore riporta per il tier Plus un tasso medio di errore su parole/caratteri di 3,96 e per Flash di 3,87: in altre parole, il parlato sintetizzato viene trascritto di nuovo quasi con la stessa accuratezza del testo sorgente. La similarità del parlante, cioè quanto una voce clonata riproduca il riferimento, è indicata in 82,75 per Plus nelle 16 lingue testate. Questi ultimi due dati sono di Alibaba; l'Elo riportato sopra no. Qualsiasi benchmark va considerato un punto di partenza: la prova decisiva resta quella sul proprio audio.

I punti di forza in produzione

Il risultato in classifica nasce da quattro capacità rilevanti in produzione, documentate nella pagina tecnica ufficiale di Qwen-Audio-3.0-TTS.

Panoramica delle capacità di Qwen-Audio-3.0-TTS e risultati CV3-Eval

Controllo tramite istruzioni libere. La voce si guida in linguaggio naturale: per esempio, "leggi questo testo come un conduttore radiofonico ansioso a tarda notte, rallentando verso la fine". Si possono definire ruolo, emozione, stile di parlato, velocità, timbro e accento, senza dover imparare un linguaggio di markup separato per le indicazioni generali.

Tag inline di precisione. Quando serve un controllo più puntuale, il modello interpreta 86 tag inline inseriti direttamente nel testo, inclusi eventi non verbali quali risate, respiri, colpi di tosse e sospiri. È la differenza fra una lettura piatta e un'interpretazione, e rende il modello adatto a dialoghi per giochi, narrazione e doppiaggio cinematografico.

Lingue e dialetti. Supporta 16 lingue, sette delle quali aggiunte di recente, tra cui arabo, indonesiano, portoghese, thai, vietnamita, malese e tagalog. A queste si aggiungono 20 regioni dialettali cinesi, dal cantonese e shanghainese fino al sichuanese e ai dialetti nordorientali. Per i team che distribuiscono nel Sud-est asiatico o nei mercati sinofoni, una copertura dialettale simile è difficile da trovare altrove.

Robustezza e qualità dell'output. Il modello clona le voci anche a partire da audio di riferimento rumorosi, riverberanti o poco chiari, senza un passaggio di denoising dedicato; sintetizza fino a tre minuti in un singolo passaggio per la narrazione long-form e produce audio a 48 kHz, con il rollout nella console previsto per il 24 luglio. La generazione in un unico passaggio fino a tre minuti è importante perché concatenando clip più brevi prosodia e timbro tendono a variare.

Prezzi: qualità al vertice, costo non premium

Il text-to-speech viene fatturato in base ai caratteri del testo in input, quindi il costo cresce direttamente con la quantità di contenuti narrati.

A $27.6 per milione di caratteri, Qwen-Audio-3.0-TTS-Plus costa una frazione dei due nomi premium storici che supera: ElevenLabs Eleven v3 e MiniMax Speech 2.8 HD sono entrambi quotati a $100 per milione di caratteri, circa 3,6 volte di più. In termini pratici, un audiolibro da 100.000 caratteri, approssimativamente un romanzo breve, costa circa $2.76 con Plus contro circa $10 con gli altri due.

Plus non è comunque l'opzione meno costosa in assoluto. Due modelli leggermente inferiori sul fronte della qualità lo battono sul prezzo: Gemini 3.1 Flash TTS costa $18.3 per milione di caratteri, posizione 3, mentre Simba 3.2 costa $10, posizione 2 e quasi appaiato in Elo. La lettura corretta è quindi più circoscritta: Qwen offre la qualità al primo posto a un prezzo di fascia media, non il prezzo più basso della classifica. Se pochi punti Elo non sono rilevanti per il vostro caso d'uso, si può spendere meno. (L'arena pubblica riporta il prezzo di Plus; la tariffa per carattere di Flash non è ancora pubblicata, quindi controllate nella console il valore aggiornato.)

Come usare Qwen-Audio-3.0-TTS

La via diretta passa da Alibaba Cloud Model Studio (Bailian); formati delle richieste e SDK sono disponibili nella documentazione di Model Studio. Occorre creare una chiave API e chiamare il modello qwen-audio-3.0-tts-plus oppure qwen-audio-3.0-tts-flash tramite l'endpoint del model market. Un approccio sensato è fare un prototipo con Flash per verificare se la sua latenza sia adatta, quindi eseguire gli stessi script con Plus e confrontare i risultati: il tier giusto dipende dal fatto che l'uso sia un'interazione live o una narrazione ascoltata dall'inizio alla fine.

I team che instradano già più fornitori tramite un aggregatore compatibile come AIReiter, per centralizzare la fatturazione, possono aggiungerlo lì invece di aprire un account Alibaba separato; la via diretta è più semplice se questo è l'unico modello necessario.

Se serve una conversazione in tempo reale anziché una narrazione one-shot, il modello TTS è soltanto un livello dello stack: l'API omni Realtime e lo streaming ASR che lo affiancano sono trattati nella guida a Qwen Audio 3 Realtime.

Vale la pena usarlo?

  • Scegliete Plus per narrazione, audiolibri o doppiaggio in cinese, nei dialetti cinesi o in più lingue, se cercate la massima naturalezza per dollaro.
  • Scegliete Flash se state sviluppando un agente vocale in tempo reale, dove un primo pacchetto di ~300 ms conta più degli ultimi punti Elo di qualità.
  • Valutate Gemini 3.1 Flash TTS o Simba 3.2 se il costo è il fattore decisivo e una qualità quasi al vertice è sufficiente: entrambi costano meno di Plus.
  • Restate su ElevenLabs o Cartesia se dipendete dai loro SDK maturi, da librerie più ampie di voci predefinite oppure da tool ed ecosistemi orientati anzitutto all'inglese, ambiti in cui restano avanti indipendentemente dalla posizione nell'arena.

Tra i modelli confrontati qui, soltanto Plus combina il primo posto nell'arena, 20 regioni dialettali cinesi e un prezzo di $27.6/M. Se questa combinazione coincide con il vostro caso d'uso, vale dunque la pena eseguire i vostri script sul modello prima di decidere, anziché fidarsi della classifica alla cieca.

FAQ

Qwen-Audio-3.0-TTS è gratuito?

No. I tier hosted Plus e Flash sono a pagamento e vengono fatturati per carattere tramite Alibaba Cloud Model Studio; per Plus il prezzo è $27.6 per milione di caratteri. Alibaba Cloud ha offerto periodicamente quote di prova gratuite, quindi controllate nella console se esiste un'offerta attiva nella vostra regione. Il Qwen3-TTS a pesi aperti è invece gratuito da self-hostare.

Qwen-Audio-3.0-TTS è open source? Si può scaricare?

I tier hosted Qwen-Audio-3.0-TTS-Plus/Flash non vengono distribuiti come pesi. Il modello open source è la precedente famiglia Qwen3-TTS, disponibile su GitHub e Hugging Face per l'uso locale, il cloning e i workflow ComfyUI. Sono release correlate, ma distinte.

Supporta il voice cloning?

Sì. Clona una voce target a partire da audio di riferimento ed è ottimizzato per mantenere la qualità anche quando tale riferimento è rumoroso o riverberante, senza richiedere un passaggio separato di pulizia. La similarità del parlante raggiunge in media 82,75 nel tier Plus sulle 16 lingue.

Qual è la differenza fra Qwen-Audio-3.0-TTS e Qwen3-TTS-Flash?

Qwen3-TTS-Flash appartiene alla precedente generazione a pesi aperti e si trova molto più in basso nell'arena, con un Elo di ~929. Qwen-Audio-3.0-TTS è la nuova generazione hosted: il suo tier Flash punta alla bassa latenza, mentre Plus guida la classifica di qualità con un Elo di 1.237.

Esiste una demo o il supporto per ComfyUI?

Qwen3-TTS, la versione a pesi aperti, dispone di una demo pubblica su Hugging Face e di nodi ComfyUI della community. I tier hosted Qwen-Audio-3.0-TTS si usano invece tramite la console Alibaba Cloud Model Studio, non attraverso una pagina demo indipendente.

>_Directory modelli AIReiter

Accesso API rapido ai modelli collegati a questa guida

Gemini 3.1 Pro

Chat
GoogleCrea API Key >

Gemini 3 Pro

Chat
GoogleCrea API Key >

Claude Fable 5

Chat

Un modello Claude premium per il ragionamento profondo e il lavoro complesso su contenuti lunghi.

AnthropicCrea API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicCrea API Key >

Claude Opus 4.8

Chat

Un modello Claude ad alte prestazioni per ragionamenti impegnativi e lavoro professionale.

AnthropicCrea API Key >

Post recenti

OpenRouter US In-Region Routing: configurazione e limiti

2026-09-10

Alternative a Civitai: Hugging Face, Tensor.Art, SeaArt, ComfyUI

2026-09-10

Prezzi API Kling: costi ufficiali e aggregatori a confronto (2026)

2026-09-10

Guida a OpenRouter Shell Tool e Files API (Beta)

2026-09-10
AIREITER

Domande? Contattaci a
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

Video IA

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

Immagine IA

GPT-Image 2.5Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image Turbo

Blog

Vedi Tutto →

Azienda

Informativa sulla privacyTermini di servizioPolitica di rimborso

© 2026 AIReiter. Tutti i diritti riservati.