Nel luglio 2026, Qwen-Audio-3.0-TTS-Plus di Alibaba ha conquistato il primo posto nell’arena Text-to-Speech di Artificial Analysis con un Quality Elo di 1.237, davanti a Gemini 3.1 Flash TTS di Google, MiniMax Speech 2.8 HD ed Eleven v3 di ElevenLabs. È inoltre disponibile a $27.6 per milione di caratteri, circa un terzo di quanto ElevenLabs e MiniMax addebitano per le fasce che supera in classifica. Non è il modello più economico sul pannello, ma nessun altro modello abbina la sua qualità da primo posto a quel prezzo. (I dati sono del 20 luglio 2026; i fornitori modificano spesso posizione e prezzo, quindi verificateli entrambi prima di pianificare in base ad essi.)
Di seguito trovi cos’è il modello, come ha ottenuto quella posizione, quanto costa e quando è — o non è — la scelta giusta.
Per prima cosa, non confonderlo con Qwen3-TTS
Cerca "Qwen audio 3.0 TTS" e la maggior parte dei risultati rimanda a Qwen3-TTS, la famiglia speech open-weight rilasciata in precedenza da Alibaba e pubblicata su GitHub e su una demo di Hugging Face. È il modello che le persone eseguono localmente, integrano in ComfyUI e di cui parlano entusiasticamente su Reddit per il voice cloning. È un prodotto diverso da quello di questa guida.
Qwen-Audio-3.0-TTS è la versione più recente, ospitata, fornita tramite Alibaba Cloud Model Studio (Bailian) anziché come pesi scaricabili. È disponibile in due livelli:
- Plus — il livello orientato alla qualità (quello che ottiene il primo posto in classifica), pensato per audiolibri, narrazione e doppiaggio, dove la naturalezza conta più dei millisecondi.
- Flash — il livello orientato alla latenza, con una latenza del primo pacchetto di circa 300 ms, progettato per l’interazione in tempo reale come agenti vocali e assistenti live.
Il divario generazionale è netto nella stessa classifica: il più vecchio Qwen3 TTS Flash si trova a un Elo di 929 (posizione ~76), mentre il nuovo livello Plus è in testa a 1.237. Stessa linea di brand, una classe di modello diversa.
I due svolgono anche compiti diversi. Se stai scegliendo tra loro, questa è la distinzione:
| Qwen3-TTS (open-weight) | Qwen-Audio-3.0-TTS (ospitato) | |
|---|---|---|
| Come ottenerlo | Scarica i pesi (GitHub / Hugging Face) | API tramite Alibaba Cloud Model Studio |
| Self-host / esecuzione locale | Sì | No — solo ospitato |
| ComfyUI & nodi della community | Sì | No |
| Livelli | Singola famiglia open | Plus (qualità) / Flash (~300 ms) |
| Copertura linguistica | ~10 lingue | 16 lingue + 20 dialetti cinesi |
| Arena Quality Elo | ~929 (Qwen3 TTS Flash) | 1,237 (Plus, #1) |
| Ideale per | Controllo locale, residenza dei dati, sperimentazione | Qualità massima, dialetti, produzione su larga scala |
Scegli la linea open-weight quando contano di più il controllo dell'hosting o il costo marginale zero; scegli i livelli hosted 3.0 quando contano di più la qualità, l'ampiezza dei dialetti o il fatto di non dover eseguire i tuoi GPU.
Il benchmark che ha ottenuto il riconoscimento
La arena di Artificial Analysis è una classifica alla cieca, basata sulle preferenze umane, gestita da una terza parte indipendente: gli ascoltatori confrontano clip senza sapere quale modello le abbia prodotte, e il punteggio Elo riflette quante volte ciascuno vince.
Ecco la parte superiore dell'arena al 20 luglio 2026:
| Posizione | Modello | Elo di qualità | Prezzo API / 1M caratteri |
|---|---|---|---|
| 1 | Qwen-Audio-3.0-TTS-Plus (Alibaba) | 1,237 | $27.6 |
| 2 | Simba 3.2 (SpeechifyAI) | 1,232 | $10.0 |
| 3 | Gemini 3.1 Flash TTS (Google) | 1,211 | $18.3 |
| 4 | Sonic 3.5 (Cartesia) | 1,211 | $49.0 |
| 8 | MiniMax Speech 2.8 HD | 1,180 | $100.0 |
| 11 | ElevenLabs Eleven v3 | 1,173 | $100.0 |
Le metriche riportate da Alibaba indicano la stessa direzione della classifica indipendente. Sul benchmark multilingue CV3-Eval, il vendor riporta per il tier Plus un tasso medio di errore parola/carattere di 3.96 e per il tier Flash di 3.87 — il che significa che il parlato sintetizzato viene trascritto quasi con la stessa precisione del testo di origine. La similarità del parlante, la misura di quanto una voce clonata corrisponda al suo riferimento, è riportata a 82.75 per Plus su tutte le 16 lingue testate. Questi due valori sono quelli di Alibaba; l’Elo sopra non lo è. Considera qualsiasi singolo benchmark come un punto di partenza e verifica sui tuoi audio.
Cosa fa bene
Il posizionamento deriva da quattro capacità che contano in produzione, documentate nella pagina tecnica ufficiale di Qwen-Audio-3.0-TTS.
Controllo delle istruzioni in stile libero. Guidi la voce con un linguaggio semplice — "leggi questo come un conduttore radiofonico notturno ansioso, più lento verso la fine" — coprendo ruolo, emozione, stile di parlato, velocità, timbro e accento. Non c’è un linguaggio di markup separato da imparare per gli aspetti generali.
Tag inline a grana fine. Per un controllo preciso, il modello legge 86 tag inline inseriti direttamente nel testo, inclusi eventi non verbali come risate, respirazione, tosse e sospiri. Questa è la differenza tra una lettura piatta e una performance, ed è ciò che rende il modello utilizzabile per i dialoghi di gioco, la narrazione e il doppiaggio cinematografico.
Ampiezza di lingue e dialetti. Copre 16 lingue — sette delle quali aggiunte di recente, tra cui arabo, indonesiano, portoghese, tailandese, vietnamita, malese e tagalog — oltre a 20 regioni di dialetti cinesi, dal cantonese e shanghainese al sichuanese e al nord-orientale. Per i team che lanciano prodotti nel Sud-est asiatico o nei mercati di lingua cinese, quella copertura dialettale è difficile da eguagliare altrove.
Robustezza e qualità dell'output. Clona voci da audio di riferimento rumoroso, riverberante o poco chiaro senza un passaggio separato di denoising, sintetizza fino a tre minuti in un'unica passata per la narrazione di lunga durata e produce audio a 48 kHz (il rollout della console per i 48 kHz è previsto per il 24 luglio). La generazione in un'unica passata di tre minuti è importante perché l'unione di clip più brevi è il punto in cui di solito prosodia e timbro derivano.
Prezzi: qualità top senza il conto da top di gamma
Il text-to-speech viene fatturato per carattere di testo di input, quindi il costo aumenta direttamente in base a quanto narri.
A $27.6 per milione di caratteri, Qwen-Audio-3.0-TTS-Plus costa una frazione dei due nomi premium storici che supera: ElevenLabs Eleven v3 e MiniMax Speech 2.8 HD sono entrambi listati a $100 per milione di caratteri, circa 3,6 volte di più. In termini pratici, un audiolibro da 100.000 caratteri (all’incirca un romanzo breve) costa circa $2.76 su Plus rispetto a circa $10 su questi due.
Tuttavia, Plus non è l’opzione più economica in assoluto. Due modelli un gradino sotto in qualità lo superano sul prezzo: Gemini 3.1 Flash TTS a $18.3 per milione di caratteri (classifica 3) e Simba 3.2 a $10 (classifica 2, quasi alla pari su Elo). Quindi la formulazione corretta è più limitata: Qwen offre una qualità al primo posto a un prezzo di fascia media, non il prezzo più basso in assoluto. Se per il tuo caso d’uso pochi punti Elo non contano, puoi pagare meno. (L’arena pubblica mostra i prezzi di Plus; la tariffa per carattere di Flash non è ancora pubblicata lì, quindi controlla la console per il valore aggiornato di Flash.)
Come usare Qwen-Audio-3.0-TTS
Il percorso diretto è Alibaba Cloud Model Studio (Bailian), con formati di richiesta e SDK nella documentazione di Model Studio: provisiona una API key, quindi chiama il modello qwen-audio-3.0-tts-plus o qwen-audio-3.0-tts-flash tramite l'endpoint model-market. Un buon punto di partenza è prototipare su Flash per vedere se la sua latenza è adeguata, poi eseguire gli stessi script tramite Plus e confrontare — il livello giusto dipende dal fatto che il tuo caso d'uso sia un'interazione in tempo reale o una narrazione che un ascoltatore sente dall'inizio alla fine.
I team che instradano già diversi provider tramite un aggregator compatibile come AIReiter per mantenere la fatturazione su un’unica interfaccia possono aggiungerlo lì invece di aprire un account Alibaba separato; andare direttamente è la soluzione più semplice se questo è l’unico modello di cui hai bisogno.
Se hai bisogno di una conversazione in tempo reale anziché di una narrazione one-shot, il modello TTS è solo un livello — l'omni Realtime API e lo streaming ASR che lo accompagnano sono trattati nella guida Qwen Audio 3 Realtime.
Dovresti usarlo?
- Scegli Plus se generi narrazione, audiolibri o doppiaggio in cinese, dialetto o multilingue e desideri la massima naturalezza per dollaro.
- Scegli Flash se stai costruendo un agente vocale in tempo reale in cui un primo pacchetto di ~300 ms conta più degli ultimi pochi punti Elo di qualità.
- Guarda Gemini 3.1 Flash TTS o Simba 3.2 se il costo è il fattore decisivo e una qualità quasi al vertice è sufficiente — entrambi sono più economici di Plus.
- Rimani con ElevenLabs o Cartesia se dipendi dai loro SDK maturi, dalle librerie vocali predefinite più ampie o da strumenti ed ecosistema orientati all'inglese, dove restano leader indipendentemente dalla posizione in classifica.
Tra i modelli confrontati qui, la combinazione di un ranking #1 nell’arena, 20 regioni di dialetti cinesi e un prezzo di $27.6/M è offerta solo da Plus — ed è per questo che, se questa combinazione si adatta al tuo caso d’uso, vale la pena eseguire i tuoi script attraverso di esso prima di impegnarti, invece di accettare il ranking sulla fiducia.
FAQ
Qwen-Audio-3.0-TTS è gratuito?
No — i piani hosted Plus e Flash sono a pagamento, fatturati per carattere tramite Alibaba Cloud Model Studio, a $27.6 per milione di caratteri per Plus. Alibaba Cloud ha periodicamente offerto quote di prova gratuite, quindi controlla la console per un'offerta attuale nella tua regione. Il modello open-weight Qwen3-TTS è gratuito da self-hostare.
Qwen-Audio-3.0-TTS è open source? Posso scaricarlo?
I livelli ospitati Qwen-Audio-3.0-TTS-Plus/Flash non sono distribuiti come pesi. Il modello open-source è la famiglia Qwen3-TTS precedente, disponibile su GitHub e Hugging Face per l'uso locale, la clonazione e i workflow ComfyUI. Si tratta di release correlate ma separate.
Supporta il voice cloning?
Sì. Clona una voce target dall'audio di riferimento ed è specificamente ottimizzato per mantenere la qualità anche quando quel riferimento è rumoroso o riverberante — non è necessario alcun passaggio separato di pulizia. La somiglianza del parlante raggiunge in media 82,75 nel livello Plus, su 16 lingue.
Qwen-Audio-3.0-TTS vs Qwen3-TTS-Flash — qual è la differenza?
Qwen3-TTS-Flash fa parte della generazione open-weight precedente e si colloca molto più in basso nell'arena (Elo ~929). Qwen-Audio-3.0-TTS è la nuova generazione ospitata; il suo livello Flash punta a una bassa latenza e il livello Plus guida la classifica di qualità con un Elo di 1.237.
C’è una demo o il supporto per ComfyUI?
Qwen3-TTS, con pesi open, ha una demo pubblica su Hugging Face e nodi ComfyUI della community. I livelli ospitati di Qwen-Audio-3.0-TTS si accedono tramite la console Alibaba Cloud Model Studio anziché attraverso una pagina demo autonoma.
