AIREITER
API-DOKSPREISE
VORLAGEN
  • AIReiter
  • Blog
  • Qwen-Audio-3.0-TTS: Das TTS-Modell an der Spitze der Arena

Qwen-Audio-3.0-TTS: Das TTS-Modell an der Spitze der Arena

Zuletzt aktualisiert: 2026-07-22 07:41:44

Im Juli 2026 hat sich Alibabas Qwen-Audio-3.0-TTS-Plus an die Spitze der Artificial Analysis Text-to-Speech-Arena gesetzt: mit einem Quality Elo von 1.237 vor Googles Gemini 3.1 Flash TTS, MiniMax Speech 2.8 HD und ElevenLabs' Eleven v3. Der Preis liegt bei 27,6 US-Dollar pro Million Zeichen – also bei etwa einem Drittel dessen, was ElevenLabs und MiniMax für die jeweils schlechter platzierten Stufen verlangen. Das günstigste Modell im Ranking ist es nicht. Doch kein anderes verbindet aktuell die Qualität auf Platz 1 mit diesem Preisniveau. (Stand der Zahlen: 20. Juli 2026. Rankings und Preise können sich bei den Anbietern häufig ändern – vor der Planung also beides prüfen.)

Artificial Analysis Text-to-Speech-Rangliste mit Qwen-Audio-3.0-TTS-Plus auf dem ersten Platz

Was hinter dem Modell steckt, wie es den Spitzenplatz erreicht hat, was es kostet und wann es die richtige – oder eben nicht die richtige – Wahl ist, folgt hier.

Qwen-Audio-3.0-TTS ist nicht Qwen3-TTS

Wer nach „Qwen audio 3.0 TTS“ sucht, landet meist bei Qwen3-TTS: der früher veröffentlichten Open-Weight-Sprachmodellfamilie von Alibaba, verfügbar auf GitHub und mit einer Hugging Face-Demo. Dieses Modell wird lokal betrieben, in ComfyUI eingebunden und auf Reddit insbesondere für Voice Cloning gelobt. Mit dem Modell in diesem Guide ist es jedoch nicht identisch.

Qwen-Audio-3.0-TTS ist die neuere, gehostete Generation. Sie wird über Alibaba Cloud Model Studio (Bailian) bereitgestellt, nicht als herunterladbare Weights. Es gibt zwei Stufen:

  • Plus – die auf Qualität optimierte Stufe und das Modell auf Platz 1. Gedacht für Hörbücher, Sprachaufnahmen und Synchronisation, bei denen Natürlichkeit wichtiger ist als jede Millisekunde.
  • Flash – die auf Latenz optimierte Stufe mit einer First-Packet-Latenz von rund 300 ms. Sie richtet sich an Echtzeit-Anwendungen wie Sprachagenten und Live-Assistenten.

Wie groß der Generationssprung ist, zeigt dieselbe Rangliste: Das ältere Qwen3 TTS Flash liegt bei einem Elo von 929 und etwa Rang 76, während die neue Plus-Stufe mit 1.237 führt. Gemeinsame Markenlinie, aber eine völlig andere Modellklasse.

Auch die Einsatzgebiete unterscheiden sich. Bei der Entscheidung zwischen beiden hilft diese Übersicht:

Qwen3-TTS (Open Weight)Qwen-Audio-3.0-TTS (gehostet)
BereitstellungWeights herunterladen (GitHub / Hugging Face)API über Alibaba Cloud Model Studio
Selbst hosten / lokal ausführenJaNein – nur gehostet
ComfyUI & Community-NodesJaNein
StufenEine offene ModellfamiliePlus (Qualität) / Flash (~300 ms)
Sprachabdeckung~10 Sprachen16 Sprachen + 20 chinesische Dialekte
Arena Quality Elo~929 (Qwen3 TTS Flash)1.237 (Plus, Platz 1)
Am besten geeignet fürLokale Kontrolle, Datenresidenz, ExperimentierenHöchste Qualität, Dialekte, Produktion im großen Maßstab

Die Open-Weight-Reihe passt, wenn Hosting-Kontrolle oder keine variablen Kosten oberste Priorität haben. Die gehosteten 3.0-Stufen sind die bessere Wahl, wenn Qualität, Dialektvielfalt oder der Verzicht auf eigene GPUs wichtiger sind.

Der Benchmark hinter Platz 1

Die Artificial Analysis-Arena ist ein unabhängiges Blindranking auf Basis menschlicher Präferenzen: Hörer vergleichen Audio-Clips, ohne zu wissen, welches Modell sie erzeugt hat. Der Elo-Wert bildet ab, wie oft ein Modell im Vergleich gewinnt.

So sah die Spitze der Arena am 20. Juli 2026 aus:

RangModellQuality EloAPI-Preis / 1 Mio. Zeichen
1Qwen-Audio-3.0-TTS-Plus (Alibaba)1.23727,6 US-Dollar
2Simba 3.2 (SpeechifyAI)1.23210,0 US-Dollar
3Gemini 3.1 Flash TTS (Google)1.21118,3 US-Dollar
4Sonic 3.5 (Cartesia)1.21149,0 US-Dollar
8MiniMax Speech 2.8 HD1.180100,0 US-Dollar
11ElevenLabs Eleven v31.173100,0 US-Dollar

Auch Alibabas eigene Messwerte weisen in dieselbe Richtung wie das unabhängige Ranking. Im mehrsprachigen CV3-Eval-Benchmark gibt der Anbieter für Plus eine durchschnittliche Wort-/Zeichenfehlerrate von 3,96 und für Flash von 3,87 an. Die synthetisierte Sprache lässt sich demnach nahezu so präzise wie der Ausgangstext zurücktranskribieren. Die Speaker Similarity – also die Übereinstimmung einer geklonten Stimme mit ihrer Referenz – liegt laut Alibaba bei Plus über alle 16 getesteten Sprachen hinweg bei 82,75. Diese beiden Werte stammen von Alibaba selbst, der Elo-Wert oben nicht. Einzelne Benchmarks sollten immer nur der Ausgangspunkt sein: Entscheidend ist der Test mit dem eigenen Audiomaterial.

Worin Qwen-Audio-3.0-TTS stark ist

Der Spitzenplatz stützt sich auf vier für den Produktionseinsatz relevante Fähigkeiten, die auf der offiziellen technischen Seite zu Qwen-Audio-3.0-TTS dokumentiert sind.

Übersicht der Funktionen und CV3-Eval-Ergebnisse von Qwen-Audio-3.0-TTS

Freie Steuerung per Anweisung. Die Stimme lässt sich in natürlicher Sprache dirigieren, etwa mit „Lies das wie ein nervöser Nachtmoderator im Radio, gegen Ende langsamer“. Rolle, Emotion, Sprechstil, Tempo, Timbre und Akzent lassen sich so vorgeben. Für die grundlegende Steuerung muss keine eigene Markup-Sprache gelernt werden.

Präzise Inline-Tags. Für detaillierte Eingriffe versteht das Modell 86 Inline-Tags direkt im Text, einschließlich nonverbaler Ereignisse wie Lachen, Atmen, Husten und Seufzen. Genau das macht aus einem nüchternen Vortrag eine Performance und ist für Spieldialoge, Narration und Filmsynchronisation relevant.

Breite bei Sprachen und Dialekten. Unterstützt werden 16 Sprachen, darunter sieben neu hinzugekommene wie Arabisch, Indonesisch, Portugiesisch, Thailändisch, Vietnamesisch, Malaiisch und Tagalog. Dazu kommen 20 chinesische Dialektregionen – von Kantonesisch und Shanghainesisch bis Sichuanesisch und nordostchinesischen Dialekten. Für Teams, die in Südostasien oder über chinesischsprachige Märkte hinweg veröffentlichen, ist diese Dialektabdeckung anderswo schwer zu finden.

Robustheit und Audioqualität. Das Modell klont Stimmen auch aus verrauschtem, halligem oder unklarem Referenzmaterial, ohne einen separaten Entrauschungsschritt. Für längere Inhalte kann es bis zu drei Minuten in einem Durchgang synthetisieren und gibt Audio mit 48 kHz aus; die Konsolenfreigabe für 48 kHz ist für den 24. Juli geplant. Die Einzeldurchgang-Generierung über drei Minuten ist relevant, weil beim Zusammensetzen kürzerer Clips Prosodie und Timbre häufig auseinanderlaufen.

Preis: Spitzenqualität ohne Premium-Aufschlag

Text-to-Speech wird nach Zeichen des Eingabetexts abgerechnet. Die Kosten steigen also direkt mit dem Umfang der vertonten Inhalte.

Mit 27,6 US-Dollar pro Million Zeichen kostet Qwen-Audio-3.0-TTS-Plus nur einen Bruchteil der beiden überholten Premium-Namen: ElevenLabs Eleven v3 und MiniMax Speech 2.8 HD stehen beide mit 100 US-Dollar pro Million Zeichen in der Liste – rund 3,6-mal so viel. Praktisch bedeutet das: Ein Hörbuch mit 100.000 Zeichen, ungefähr ein kurzer Roman, kostet mit Plus etwa 2,76 US-Dollar, bei den beiden anderen Modellen jeweils ungefähr 10 US-Dollar.

Insgesamt ist Plus aber nicht die günstigste Option. Zwei Modelle knapp darunter bei der Qualität unterbieten den Preis: Gemini 3.1 Flash TTS mit 18,3 US-Dollar pro Million Zeichen auf Rang 3 und Simba 3.2 mit 10 US-Dollar auf Rang 2, beim Elo nahezu gleichauf. Die korrekte Einordnung ist daher enger gefasst: Qwen bietet die bestplatzierte Qualität zu einem Preis aus der mittleren Kategorie, nicht den niedrigsten Preis der Rangliste. Wenn einige Elo-Punkte für den eigenen Anwendungsfall keine Rolle spielen, geht es günstiger. (Die öffentliche Arena führt den Preis von Plus auf; der Zeichenpreis für Flash ist dort noch nicht veröffentlicht. Den aktuellen Flash-Preis daher in der Konsole prüfen.)

Qwen-Audio-3.0-TTS einsetzen

Der direkte Weg führt über Alibaba Cloud Model Studio (Bailian). Request-Formate und SDKs finden sich in der Model Studio-Dokumentation: API-Key einrichten und dann qwen-audio-3.0-tts-plus oder qwen-audio-3.0-tts-flash über den Model-Market-Endpoint aufrufen. Sinnvoll ist, zunächst mit Flash zu prototypen und zu prüfen, ob die Latenz passt. Anschließend lassen sich dieselben Skripte mit Plus ausführen und vergleichen. Welche Stufe richtig ist, hängt davon ab, ob es um Live-Interaktion oder um Narration geht, die Hörer komplett konsumieren.

Teams, die mehrere Anbieter bereits über einen kompatiblen Aggregator wie AIReiter bündeln, um die Abrechnung an einer Stelle zu halten, können das Modell dort ergänzen, statt einen separaten Alibaba-Account anzulegen. Wenn nur dieses eine Modell benötigt wird, ist der direkte Zugang am einfachsten.

Für Echtzeit-Gespräche statt einmaliger Narration ist das TTS-Modell nur eine Ebene. Die dazu passenden omni Realtime API und Streaming-ASR behandelt der Guide zu Qwen Audio 3 Realtime.

Lohnt sich das Modell?

  • Plus wählen, wenn chinesische, dialektale oder mehrsprachige Narration, Hörbücher oder Synchronisation produziert werden sollen und maximale Natürlichkeit pro Dollar zählt.
  • Flash wählen, wenn ein Sprachagent in Echtzeit entsteht und ein erstes Paket nach ~300 ms wichtiger ist als die letzten Elo-Punkte bei der Qualität.
  • Gemini 3.1 Flash TTS oder Simba 3.2 prüfen, wenn die Kosten entscheiden und Qualität nahe an der Spitze genügt – beide sind günstiger als Plus.
  • Bei ElevenLabs oder Cartesia bleiben, wenn deren ausgereifte SDKs, größere vorgefertigte Stimmenbibliotheken oder englischzentrierten Tools und Ökosysteme entscheidend sind. Dort bleiben sie unabhängig von der Arena-Position führend.

Unter den hier verglichenen Modellen bietet allein Plus die Kombination aus Platz 1 in der Arena, 20 chinesischen Dialektregionen und einem Preis von 27,6 US-Dollar pro Million Zeichen. Wenn genau diese Mischung zum eigenen Einsatzfall passt, sollten die eigenen Skripte vor einer Festlegung damit getestet werden, statt sich allein auf das Ranking zu verlassen.

FAQ

Ist Qwen-Audio-3.0-TTS kostenlos?

Nein. Die gehosteten Stufen Plus und Flash sind kostenpflichtig und werden über Alibaba Cloud Model Studio pro Zeichen abgerechnet; Plus kostet 27,6 US-Dollar pro Million Zeichen. Alibaba Cloud hat zeitweise kostenlose Testkontingente angeboten. Ein aktuelles Angebot für die jeweilige Region lässt sich in der Konsole prüfen. Das Open-Weight-Modell Qwen3-TTS kann kostenlos selbst gehostet werden.

Ist Qwen-Audio-3.0-TTS Open Source? Kann ich es herunterladen?

Die gehosteten Stufen Qwen-Audio-3.0-TTS-Plus/Flash werden nicht als Weights verteilt. Das Open-Source-Modell ist die frühere Qwen3-TTS-Familie, die auf GitHub und Hugging Face für lokale Nutzung, Cloning und ComfyUI-Workflows verfügbar ist. Beide sind verwandt, aber getrennte Releases.

Unterstützt es Voice Cloning?

Ja. Das Modell klont eine Zielstimme aus Referenzaudio und ist ausdrücklich darauf ausgelegt, auch mit verrauschtem oder halligem Material zuverlässig zu funktionieren – ein separater Bereinigungsschritt ist nicht erforderlich. Die Speaker Similarity liegt bei der Plus-Stufe über 16 Sprachen im Durchschnitt bei 82,75.

Qwen-Audio-3.0-TTS vs. Qwen3-TTS-Flash – was ist der Unterschied?

Qwen3-TTS-Flash gehört zur früheren Open-Weight-Generation und liegt in der Arena deutlich weiter hinten, bei einem Elo von ~929. Qwen-Audio-3.0-TTS ist die neue gehostete Generation: Die Flash-Stufe zielt auf niedrige Latenz, während Plus mit einem Elo von 1.237 das Qualitätsranking anführt.

Gibt es eine Demo oder ComfyUI-Support?

Für das Open-Weight-Modell Qwen3-TTS gibt es eine öffentliche Hugging Face-Demo und Community-Nodes für ComfyUI. Die gehosteten Qwen-Audio-3.0-TTS-Stufen werden über die Alibaba Cloud Model Studio-Konsole genutzt, nicht über eine eigenständige Demo-Seite.

>_AIReiter Modellverzeichnis

Schneller API-Zugriff auf Modelle zu diesem Guide

Gemini 3.1 Pro

Chat
GoogleAPI-Key erstellen >

Gemini 3 Pro

Chat
GoogleAPI-Key erstellen >

Claude Fable 5

Chat

Ein Premium-Claude-Modell für tiefes Denken und komplexe Arbeiten über längere Formate.

AnthropicAPI-Key erstellen >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicAPI-Key erstellen >

Claude Opus 4.8

Chat

Ein leistungsstarkes Claude-Modell für anspruchsvolles Denken und professionelle Arbeit.

AnthropicAPI-Key erstellen >

Neueste Beiträge

OpenRouter US In-Region Routing: Einrichtung und Grenzen

2026-09-10

Civitai-Alternativen: Hugging Face, Tensor.Art, SeaArt, ComfyUI

2026-09-10

Kling API Preise: Offizielle Kosten vs. Aggregatoren (2026)

2026-09-10

OpenRouter Shell Tool und Files API im Praxistest (Beta)

2026-09-10
AIREITER

Fragen? Kontaktieren Sie uns unter
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

KI-Video

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

KI-Bild

GPT-Image 2.5Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image Turbo

Blog

Alle anzeigen →

Unternehmen

DatenschutzrichtlinieNutzungsbedingungenRückerstattungsrichtlinie

© 2026 AIReiter. Alle Rechte vorbehalten.