Im Juli 2026 belegte Alibabas Qwen-Audio-3.0-TTS-Plus den ersten Platz auf dem Artificial Analysis Text-to-Speech arena mit einem Quality-Elo von 1.237 und lag damit vor Googles Gemini 3.1 Flash TTS, MiniMax Speech 2.8 HD und ElevenLabs' Eleven v3. Außerdem ist es mit 27,6 $ pro Million Zeichen gelistet, also ungefähr einem Drittel dessen, was ElevenLabs und MiniMax für die Stufen verlangen, die es übertrifft. Es ist nicht das günstigste Modell auf dem Board, aber kein anderes Modell verbindet seine Qualitäts-#1-Position mit diesem Preis. (Die Angaben stammen vom 20. Juli 2026; Anbieter ändern Rang und Preis häufig, daher sollten Sie beides vor Ihrer Planung noch einmal bestätigen.)
Im Folgenden wird erläutert, was das Modell ist, wie es diesen Rang erreicht hat, was es kostet und wann es die richtige Wahl ist — oder nicht.
Verwechseln Sie es nicht mit Qwen3-TTS
Suche nach "Qwen audio 3.0 TTS" und die meisten Ergebnisse verweisen auf Qwen3-TTS, die Open-Weight-Sprachfamilie, die Alibaba früher veröffentlicht hat und auf GitHub sowie einer Hugging-Face-Demo veröffentlicht wurde. Das ist das Modell, das Leute lokal ausführen, in ComfyUI einbinden und auf Reddit wegen Voice Cloning feiern. Es ist ein anderes Produkt als das in diesem Leitfaden.
Qwen-Audio-3.0-TTS ist die neuere, gehostete Generation, bereitgestellt über Alibaba Cloud Model Studio (Bailian) statt als herunterladbare Gewichte. Sie wird in zwei Stufen angeboten:
- Plus — die Qualitäts-zuerst-Stufe (diejenige, die den #1-Rang erreicht), gedacht für Hörbücher, Erzählstimme und Synchronisation, bei denen Natürlichkeit wichtiger ist als Millisekunden.
- Flash — die Latenz-zuerst-Stufe mit einer First-Packet-Latenz von etwa 300 ms, entwickelt für Echtzeit-Interaktion wie Sprachagenten und Live-Assistenten.
Der Generationsunterschied zeigt sich deutlich auf derselben Rangliste: Das ältere Qwen3 TTS Flash liegt bei einem Elo von 929 (Rang ~76), während die neue Plus-Stufe mit 1.237 führt. Gleiche Markenlinie, aber eine andere Modellklasse.
Die beiden erfüllen auch unterschiedliche Aufgaben. Wenn Sie sich zwischen ihnen entscheiden, sieht die Aufteilung so aus:
| Qwen3-TTS (open-weight) | Qwen-Audio-3.0-TTS (hosted) | |
|---|---|---|
| Wie Sie es erhalten | Gewichte herunterladen (GitHub / Hugging Face) | API über Alibaba Cloud Model Studio |
| Lokal selbst hosten / ausführen | Ja | Nein — nur gehostet |
| ComfyUI & Community-Nodes | Ja | Nein |
| Stufen | Eine einzelne offene Familie | Plus (Qualität) / Flash (~300 ms) |
| Sprachabdeckung | ~10 Sprachen | 16 Sprachen + 20 chinesische Dialekte |
| Arena-Qualitäts-Elo | ~929 (Qwen3 TTS Flash) | 1.237 (Plus, #1) |
| Am besten geeignet für | Lokale Kontrolle, Datenresidenz, Experimentieren | Höchste Qualität, Dialekte, Produktion im großen Maßstab |
Wählen Sie die Open-Weight-Reihe, wenn Hosting-Kontrolle oder null Grenzkosten am wichtigsten sind; wählen Sie die gehosteten 3.0-Tarife, wenn Qualität, Dialektvielfalt oder das Nicht-Betreiben eigener GPUs wichtiger sind.
Der Benchmark, der den Rang verdient hat
Die Artificial Analysis Arena ist ein blindes, von Menschenpräferenzen geprägtes Ranking, das von einer unabhängigen dritten Partei durchgeführt wird: Zuhörer vergleichen Clips, ohne zu wissen, welches Modell sie erzeugt hat, und der Elo-Score spiegelt wider, wie oft jedes einzelne gewinnt.
Hier ist die Spitze der Arena vom 20. Juli 2026:
| Rang | Modell | Qualitäts-Elo | API-Preis / 1 Mio. Zeichen |
|---|---|---|---|
| 1 | Qwen-Audio-3.0-TTS-Plus (Alibaba) | 1,237 | $27.6 |
| 2 | Simba 3.2 (SpeechifyAI) | 1,232 | $10.0 |
| 3 | Gemini 3.1 Flash TTS (Google) | 1,211 | $18.3 |
| 4 | Sonic 3.5 (Cartesia) | 1,211 | $49.0 |
| 8 | MiniMax Speech 2.8 HD | 1,180 | $100.0 |
| 11 | ElevenLabs Eleven v3 | 1,173 | $100.0 |
Alibabas eigene gemeldete Kennzahlen weisen in die gleiche Richtung wie das unabhängige Ranking. Auf dem multilingualen CV3-Eval-Benchmark meldet der Anbieter für die Plus-Stufe eine durchschnittliche Wort-/Zeichenfehlerrate von 3,96 und für die Flash-Stufe 3,87 — das bedeutet, dass die synthetisierte Sprache sich nahezu so genau zurück in Text transkribieren lässt wie der Quelltext. Die Sprecherähnlichkeit, also das Maß dafür, wie eng eine geklonte Stimme ihrer Referenz entspricht, wird für Plus über alle 16 getesteten Sprachen hinweg mit 82,75 angegeben. Diese beiden Werte stammen von Alibaba selbst; das obige Elo nicht. Betrachten Sie jeden einzelnen Benchmark als Ausgangspunkt und testen Sie mit Ihrem eigenen Audio.
Was es gut macht
Das Ranking ergibt sich aus vier Fähigkeiten, die in der Produktion wichtig sind und auf der offiziellen technischen Seite von Qwen-Audio-3.0-TTS dokumentiert sind.
Freistil-Steuerung von Anweisungen. Sie steuern die Stimme mit einfacher Sprache — „lies dies wie ein ängstlicher Late-Night-Radio-Moderator, gegen Ende langsamer“ — und decken dabei Rolle, Emotion, Sprechstil, Sprechgeschwindigkeit, Timbre und Akzent ab. Es gibt keine separate Auszeichnungssprache, die man für die groben Züge lernen muss.
Feingranulare Inline-Tags. Für präzise Steuerung liest das Modell 86 Inline-Tags, die direkt im Text platziert sind, einschließlich nonverbaler Ereignisse wie Lachen, Atmen, Husten und Seufzen. Das ist der Unterschied zwischen einem flachen Vortrag und einer Performance, und genau das macht das Modell für Dialoge in Spielen, Erzählungen und Filmdubbing nutzbar.
Sprach- und Dialektvielfalt. Es umfasst 16 Sprachen — sieben davon neu hinzugefügt, darunter Arabisch, Indonesisch, Portugiesisch, Thai, Vietnamesisch, Malaiisch und Tagalog — plus 20 chinesische Dialektregionen, von Kantonesisch und Shanghainesisch bis zu Sichuanesisch und Nordostchinesisch. Für Teams, die in Südostasien oder in chinesischsprachigen Märkten veröffentlichen, ist diese Dialektabdeckung anderswo nur schwer zu finden.
Robustheit und Ausgabqualität. Es klont Stimmen aus verrauschtem, halligem oder unklarem Referenzaudio ohne separaten Entrauschungsschritt, synthetisiert bis zu drei Minuten in einem einzigen Durchgang für Langform-Narration und gibt 48-kHz-Audio aus (die Console-Einführung für 48 kHz ist für den 24. Juli geplant). Die dreiminütige Generierung in einem Durchgang ist wichtig, weil beim Zusammensetzen kürzerer Clips normalerweise Prosodie und Timbre abdriften.
Preisgestaltung: Top-Qualität ohne Premium-Preis
Text-to-Speech wird pro Zeichen des Eingabetextes abgerechnet, sodass die Kosten direkt mit dem Umfang der gesprochene Inhalte steigen.
Mit $27.6 pro Million Zeichen kostet Qwen-Audio-3.0-TTS-Plus nur einen Bruchteil der beiden etablierten Premium-Namen, die es übertrifft: ElevenLabs Eleven v3 und MiniMax Speech 2.8 HD sind beide mit $100 pro Million Zeichen gelistet, also etwa 3.6x so viel. Praktisch bedeutet das: Ein 100,000-Zeichen-Hörbuch (etwa ein kurzer Roman) kostet bei Plus ungefähr $2.76 statt etwa $10 bei diesen beiden.
Plus ist allerdings insgesamt nicht die günstigste Option. Zwei Modelle eine Qualitätsstufe darunter unterbieten es: Gemini 3.1 Flash TTS mit $18.3 pro Million Zeichen (Rang 3) und Simba 3.2 mit $10 (Rang 2, nahezu gleichauf beim Elo). Die treffende Einordnung ist also eng gefasst — Qwen bietet erstklassige Qualität zu einem Preis im mittleren Bereich, nicht den niedrigsten Preis auf dem Markt. Wenn ein paar Elo-Punkte für Ihren Anwendungsfall nicht wichtig sind, können Sie weniger bezahlen. (Die öffentliche Arena listet die Plus-Preise; der Preis pro Zeichen von Flash ist dort noch nicht veröffentlicht, daher prüfen Sie die Konsole für den aktuellen Flash-Wert.)
Wie man Qwen-Audio-3.0-TTS verwendet
Der direkte Weg ist Alibaba Cloud Model Studio (Bailian) mit Request-Formaten und SDKs in der Model Studio-Dokumentation: Erstellen Sie einen API-Schlüssel und rufen Sie dann das Modell qwen-audio-3.0-tts-plus oder qwen-audio-3.0-tts-flash über den model-market-Endpunkt auf. Ein sinnvoller Ausgangspunkt ist es, zunächst auf Flash einen Prototyp zu erstellen, um zu sehen, ob die Latenz passt, und dann dieselben Skripte über Plus auszuführen und zu vergleichen — die richtige Stufe hängt davon ab, ob Ihr Anwendungsfall eine Live-Interaktion oder eine Erzählung ist, die ein Hörer von Anfang bis Ende hört.
Teams, die bereits mehrere Anbieter über einen kompatiblen Aggregator wie AIReiter routen, um die Abrechnung über eine einzige Oberfläche zu behalten, können es dort hinzufügen, anstatt ein separates Alibaba-Konto zu eröffnen; der direkte Weg ist am einfachsten, wenn dies das einzige Modell ist, das Sie benötigen.
Wenn Sie Echtzeit-Konversation statt einer einmaligen Wiedergabe benötigen, ist das TTS-Modell nur eine Ebene — die omni Realtime API und das dazugehörige Streaming-ASR werden im Qwen Audio 3 Realtime guide behandelt.
Sollten Sie es verwenden?
- Wählen Sie Plus, wenn Sie chinesische, dialektale oder mehrsprachige Erzählungen, Hörbücher oder Synchronisationen erstellen und das höchste Maß an Natürlichkeit pro Dollar wünschen.
- Wählen Sie Flash, wenn Sie einen Echtzeit-Sprachagenten entwickeln, bei dem ein erstes Paket von ~300 ms wichtiger ist als die letzten wenigen Elo-Punkte an Qualität.
- Schauen Sie sich Gemini 3.1 Flash TTS oder Simba 3.2 an, wenn die Kosten der entscheidende Faktor sind und nahezu Spitzenqualität ausreicht — beide sind günstiger als Plus.
- Bleiben Sie bei ElevenLabs oder Cartesia, wenn Sie von deren ausgereiften SDKs, größeren vorgefertigten Sprachbibliotheken oder englischsprachigen Tools und dem Ökosystem abhängen, wo sie unabhängig von der Platzierung in der Arena weiterhin führend sind.
Unter den hier verglichenen Modellen ist die Kombination aus einem #1-Arena-Rang, 20 chinesischen Dialektregionen und einem Preis von $27.6/M eine, die nur Plus bietet — weshalb es sich lohnt, wenn diese Mischung zu Ihrem Anwendungsfall passt, Ihre eigenen Skripte zuerst darüber laufen zu lassen, bevor Sie sich festlegen, statt dem Ranking einfach zu vertrauen.
FAQ
Ist Qwen-Audio-3.0-TTS kostenlos?
Nein — die gehosteten Plus- und Flash-Tiers sind kostenpflichtig und werden pro Zeichen über Alibaba Cloud Model Studio abgerechnet, mit $27.6 pro Million Zeichen für Plus. Alibaba Cloud hat zeitweise kostenlose Testkontingente angeboten, daher prüfen Sie die Konsole auf ein aktuelles Angebot in Ihrer Region. Das Open-Weight Qwen3-TTS ist kostenlos zum Selbst-Hosting.
Ist Qwen-Audio-3.0-TTS Open Source? Kann ich es herunterladen?
Die gehosteten Qwen-Audio-3.0-TTS-Plus/Flash-Tiers werden nicht als Gewichte bereitgestellt. Das Open-Source-Modell ist die frühere Qwen3-TTS-Familie, verfügbar auf GitHub und Hugging Face für lokale Nutzung, Klonen und ComfyUI-Workflows. Sie sind verwandt, aber separate Veröffentlichungen.
Unterstützt es Sprachklonen?
Ja. Es klont eine Zielstimme aus Referenzaudio und ist speziell darauf abgestimmt, auch dann standzuhalten, wenn diese Referenz verrauscht oder hallig ist — ein separater Bereinigungsschritt ist nicht erforderlich. Die Sprecherähnlichkeit liegt im Plus-Tarif über 16 Sprachen hinweg im Durchschnitt bei 82,75.
Qwen-Audio-3.0-TTS vs Qwen3-TTS-Flash — was ist der Unterschied?
Qwen3-TTS-Flash ist Teil der früheren Open-Weight-Generation und liegt auf der Arena deutlich weiter unten (Elo ~929). Qwen-Audio-3.0-TTS ist die neue gehostete Generation; ihre Flash-Stufe zielt auf niedrige Latenz ab und ihre Plus-Stufe führt das Qualitätsranking mit einem Elo von 1.237 an.
Gibt es eine Demo oder ComfyUI-Unterstützung?
Das Open-Weight-Modell Qwen3-TTS hat eine öffentliche Hugging-Face-Demo und Community-ComfyUI-Nodes. Auf die gehosteten Qwen-Audio-3.0-TTS-Tarife wird über die Alibaba Cloud Model Studio-Konsole zugegriffen, statt über eine eigenständige Demo-Seite.
