Temmuz 2026'da, Alibaba'nın Qwen-Audio-3.0-TTS-Plus modeli, Google'ın Gemini 3.1 Flash TTS, MiniMax Speech 2.8 HD ve ElevenLabs'in Eleven v3 modellerinin önünde, 1.237'lik Quality Elo ile Artificial Analysis Text-to-Speech arenasında birinci sırayı aldı. Ayrıca milyon karakter başına 27,6 $ olarak listeleniyor; bu, geçtiği kademeler için ElevenLabs ve MiniMax'in talep ettiğinin kabaca üçte biri. Piyasadaki en ucuz model değil, ancak başka hiçbir model bu birinci kalite seviyesini bu fiyatla birleştirmiyor. (Rakamlar 20 Temmuz 2026 tarihine aittir; sağlayıcılar sıralama ve fiyatı sık sık değiştirir, bu nedenle plan yapmadan önce her ikisini de doğrulayın.)
Aşağıda modelin ne olduğu, bu sıralamayı nasıl kazandığı, ne kadara mal olduğu ve ne zaman doğru tercih olup olmadığı yer alıyor.
İlk olarak, bunu Qwen3-TTS ile karıştırmayın
"Qwen audio 3.0 TTS" diye arayınca sonuçların çoğu Qwen3-TTS'ye yöneliyor; bu, Alibaba'nın daha önce yayınladığı açık ağırlıklı speech ailesi ve GitHub ile bir Hugging Face demosu üzerinde yayımlandı. İnsanların yerel olarak çalıştırdığı, ComfyUI'ye entegre ettiği ve ses klonlama için Reddit'te övdüğü model budur. Bu, bu rehberde yer alan üründen farklıdır.
Qwen-Audio-3.0-TTS, indirilebilir ağırlıklar yerine Alibaba Cloud Model Studio (Bailian) üzerinden sunulan daha yeni, barındırılan bir üretimdir. İki katman halinde sunulur:
- Plus — kalite öncelikli katman (1. sırayı kazanan katman), doğal sesin milisaniyelerden daha önemli olduğu sesli kitaplar, anlatım ve dublaj için tasarlanmıştır.
- Flash — ilk paket gecikmesi yaklaşık 300 ms olan, sesli ajanlar ve canlı asistanlar gibi gerçek zamanlı etkileşim için geliştirilmiş gecikme öncelikli katman.
Nesiller arası fark aynı liderlik tablosunda oldukça belirgin: daha eski Qwen3 TTS Flash 929 Elo’da (yaklaşık 76. sıra) yer alırken, yeni Plus kademesi 1.237 ile lider durumda. Aynı marka soy ağacı, ancak farklı bir model sınıfı.
İkisi ayrıca farklı görevler de üstlenir. Aralarında seçim yapıyorsanız, ayrım şöyledir:
| Qwen3-TTS (open-weight) | Qwen-Audio-3.0-TTS (hosted) | |
|---|---|---|
| Nasıl elde edersiniz | Ağırlıkları indirin (GitHub / Hugging Face) | Alibaba Cloud Model Studio üzerinden API |
| Kendi sunucunda barındırma / yerelde çalıştırma | Evet | Hayır — yalnızca barındırılan |
| ComfyUI & topluluk düğümleri | Evet | Hayır |
| Kademeler | Tek açık aile | Plus (kalite) / Flash (~300 ms) |
| Dil kapsamı | ~10 dil | 16 dil + 20 Çince lehçe |
| Arena Kalite Elo | ~929 (Qwen3 TTS Flash) | 1,237 (Plus, #1) |
| En uygun kullanım | Yerel kontrol, veri yerleşimi, kurcalama | En yüksek kalite, lehçeler, ölçekte üretim |
Barındırma kontrolünün veya sıfır marjinal maliyetin en önemli olduğu durumlarda açık ağırlıklı seriyi seçin; kalite, lehçe çeşitliliği ya da kendi GPU’larınızı çalıştırmamanın daha önemli olduğu durumlarda ise hosted 3.0 katmanlarını seçin.
Sıralamayı kazandıran kıstas
Artificial Analysis arenası, bağımsız bir üçüncü tarafça yürütülen kör, insan tercihlerine dayalı bir sıralamadır: dinleyiciler, hangi modelin ürettiğini bilmeden klipleri karşılaştırır ve Elo puanı, her birinin ne sıklıkla kazandığını yansıtır.
20 Temmuz 2026 itibarıyla arenanın zirvesi şöyledir:
| Sıralama | Model | Kalite Elo | API fiyatı / 1M karakter |
|---|---|---|---|
| 1 | Qwen-Audio-3.0-TTS-Plus (Alibaba) | 1,237 | $27.6 |
| 2 | Simba 3.2 (SpeechifyAI) | 1,232 | $10.0 |
| 3 | Gemini 3.1 Flash TTS (Google) | 1,211 | $18.3 |
| 4 | Sonic 3.5 (Cartesia) | 1,211 | $49.0 |
| 8 | MiniMax Speech 2.8 HD | 1,180 | $100.0 |
| 11 | ElevenLabs Eleven v3 | 1,173 | $100.0 |
Alibaba’nın kendi raporladığı metrikler de bağımsız sıralamayla aynı yönde işaret ediyor. Çok dilli CV3-Eval benchmark’ında, sağlayıcı Plus tier için ortalama sözcük/karakter hata oranını 3.96, Flash tier için 3.87 olarak bildiriyor — bu da sentezlenen konuşmanın kaynak metin kadar neredeyse aynı doğrulukta geri yazıya döküldüğü anlamına geliyor. Kopyalanmış bir sesin referansına ne kadar yaklaştığını ölçen speaker similarity ise, test edilen 16 dilin tamamında Plus için 82.75 olarak raporlanıyor. Bu iki rakam Alibaba’nın kendi verileridir; yukarıdaki Elo değildir. Herhangi bir tek benchmark’ı başlangıç noktası olarak alın ve kendi ses veriniz üzerinde test edin.
Ne yapıyor iyi
Sıralama, resmî Qwen-Audio-3.0-TTS teknik sayfasında belgelenen ve üretimde önemli olan dört yetenekten gelir.
Serbest stil talimat kontrolü. Sesi düz dille yönlendirirsiniz — "bunu kaygılı bir gece geç saat radyo sunucusu gibi, sonlara doğru daha yavaş oku" — rol, duygu, konuşma stili, hız, tını ve aksanı kapsayacak şekilde. Genel hatlar için öğrenilecek ayrı bir biçimlendirme dili yoktur.
İnce ayrıntılı satır içi etiketler. Hassas kontrol için model, metnin içine doğrudan yerleştirilmiş 86 satır içi etiketi okur; bunlar arasında kahkaha, nefes alma, öksürme ve iç çekme gibi sözlü olmayan olaylar da bulunur. Bu, düz bir okumayla bir performans arasındaki farktır ve modeli oyun diyalogları, anlatım ve film dublajı için kullanılabilir kılan şey budur.
Dil ve lehçe kapsamı. Arapça, Endonezce, Portekizce, Tayca, Vietnamca, Malayca ve Tagalog dahil olmak üzere bunlardan yedisi yeni eklenen 16 dili — ayrıca Kantonca ve Şanghaycadan Sichuan ve Kuzeydoğu lehçelerine kadar 20 Çin lehçe bölgesini kapsıyor. Güneydoğu Asya’ya veya Çince konuşulan pazarlara ürün sunan ekipler için bu lehçe kapsamını başka yerde eşleştirmek zordur.
Sağlamlık ve çıktı kalitesi. Gürültülü, yankılı veya net olmayan referans seslerden ayrı bir gürültü giderme adımı olmadan sesleri klonlar, uzun biçimli anlatım için tek geçişte üç dakikaya kadar sentezler ve 48 kHz ses çıktısı üretir (48 kHz için console dağıtımı 24 Temmuz olarak planlanmıştır). Üç dakikalık tek geçiş üretimi önemlidir; çünkü daha kısa klipleri birleştirmek, prosodi ve tınının genellikle kaydığı noktadır.
Fiyatlandırma: en üst düzey fatura olmadan en üst düzey kalite
Metinden sese dönüştürme, giriş metnindeki karakter başına ücretlendirilir; bu nedenle maliyet, anlattığınız metnin miktarıyla doğrudan ölçeklenir.
Milyon karakter başına $27.6 ile Qwen-Audio-3.0-TTS-Plus, geride bıraktığı iki eski premium ismin maliyetinin yalnızca bir kısmına sahiptir: ElevenLabs Eleven v3 ve MiniMax Speech 2.8 HD her ikisi de milyon karakter başına $100 olarak listeleniyor; bu da yaklaşık 3.6 kat daha fazla. Pratikte, 100.000 karakterlik bir sesli kitap (kabaca kısa bir roman) Plus’ta yaklaşık $2.76, bu ikisinde ise yaklaşık $10 tutuyor.
Ancak Plus, genel olarak en ucuz seçenek değil. Kalite açısından bir kademe aşağıda olan iki model onu geride bırakıyor: milyon karakter başına 18,3 $ ile Gemini 3.1 Flash TTS (3. sıra) ve 10 $ ile Simba 3.2 (2. sıra, Elo’da neredeyse berabere). Dolayısıyla doğru ifade daha dar: Qwen, en üst sıradaki kaliteyi orta seviye bir fiyatla sunuyor; listedeki en düşük fiyatı değil. Kullanım senaryonuz için birkaç Elo puanı önemli değilse, daha az ödeyebilirsiniz. (Genel arena Plus fiyatlandırmasını listeliyor; Flash’ın karakter başına oranı henüz orada yayımlanmadı, bu yüzden canlı Flash rakamı için konsolu kontrol edin.)
Qwen-Audio-3.0-TTS nasıl kullanılır
Doğrudan yol, istek formatları ve SDK’leri Alibaba Cloud Model Studio (Bailian) ile Model Studio documentation içindedir: bir API anahtarı sağlayın, ardından model-market endpoint’i üzerinden qwen-audio-3.0-tts-plus veya qwen-audio-3.0-tts-flash modelini çağırın. Makul bir başlangıç noktası, gecikmesinin uygun olup olmadığını görmek için Flash üzerinde bir prototip oluşturmak, ardından aynı script’leri Plus üzerinden çalıştırıp karşılaştırmaktır — doğru seviye, kullanım alanınızın canlı etkileşim mi yoksa bir dinleyicinin baştan sona duyduğu anlatım mı olduğuna bağlıdır.
Birden fazla sağlayıcıyı AIReiter gibi uyumlu bir toplayıcı üzerinden yönlendirip faturalandırmayı tek bir yüzeyde tutan ekipler, ayrı bir Alibaba hesabı açmak yerine bunu oraya ekleyebilir; ihtiyacınız olan tek model buysa doğrudan gitmek en basit seçenektir.
Eğer tek seferlik anlatım yerine gerçek zamanlı bir konuşmaya ihtiyacınız varsa, TTS modeli yalnızca bir katmandır — onunla eşleşen omni Realtime API ve streaming ASR, Qwen Audio 3 Realtime rehberinde ele alınmaktadır.
Bunu kullanmalı mısınız?
- Plus’ı seçin if you generate Chinese, dialect, or multilingual narration, audiobooks, or dubbing and want the highest naturalness per dollar.
- Flash’i seçin if you are building a real-time voice agent where a ~300 ms first packet matters more than the last few Elo points of quality.
- Gemini 3.1 Flash TTS veya Simba 3.2’ye bakın if cost is the deciding factor and near-top quality is good enough — both are cheaper than Plus.
- ElevenLabs veya Cartesia ile devam edin if you depend on their mature SDKs, larger prebuilt voice libraries, or English-first tooling and ecosystem, where they still lead regardless of arena position.
Burada karşılaştırılan modeller arasında, #1 arena sıralaması, 20 Çin lehçesi bölgesi ve $27.6/M fiyatlandırmasının birleşimi yalnızca Plus’ın sunduğu bir özelliktir — bu yüzden, eğer bu kombinasyon kullanım senaryonuza uyuyorsa, sıralamaya körü körüne güvenmek yerine taahhütte bulunmadan önce kendi scriptlerinizi bunun üzerinden çalıştırmanız değerlidir.
SSS
Qwen-Audio-3.0-TTS ücretsiz mi?
Hayır — barındırılan Plus ve Flash katmanları ücretlidir, Alibaba Cloud Model Studio üzerinden karakter başına faturalandırılır; Plus için milyon karakter başına $27.6. Alibaba Cloud zaman zaman ücretsiz deneme kotaları sunmuştur, bu nedenle bölgenizdeki güncel teklif için konsolu kontrol edin. Açık ağırlıklı Qwen3-TTS’i kendi altyapınızda barındırmak ücretsizdir.
Qwen-Audio-3.0-TTS açık kaynak mı? İndirebilir miyim?
Barındırılan Qwen-Audio-3.0-TTS-Plus/Flash katmanları ağırlıklar olarak dağıtılmaz. Açık kaynak model, GitHub ve Hugging Face üzerinde yerel kullanım, klonlama ve ComfyUI iş akışları için उपलब्ध olan daha önceki Qwen3-TTS ailesidir. Bunlar birbiriyle ilişkili ancak ayrı sürümlerdir.
Ses klonlamayı destekliyor mu?
Evet. Bir referans ses kaydından hedef sesi klonlar ve özellikle bu referans gürültülü ya da yankılı olsa bile performansını koruyacak şekilde ayarlanmıştır — ayrı bir temizleme adımına gerek yoktur. Konuşmacı benzerliği, Plus katmanında 16 dil genelinde ortalama 82,75’tir.
Qwen-Audio-3.0-TTS ile Qwen3-TTS-Flash — aralarındaki fark nedir?
Qwen3-TTS-Flash, daha önceki açık ağırlıklı neslin bir parçasıdır ve arenada çok daha aşağıda yer alır (Elo ~929). Qwen-Audio-3.0-TTS ise yeni barındırılan nesildir; Flash seviyesi düşük gecikmeyi hedefler ve Plus seviyesi, Elo 1.237 ile kalite sıralamasının en üstünde yer alır.
Bir demo veya ComfyUI desteği var mı?
Açık ağırlıklı Qwen3-TTS’nin herkese açık bir Hugging Face demosu ve topluluk ComfyUI düğümleri vardır. Barındırılan Qwen-Audio-3.0-TTS katmanlarına, bağımsız bir demo sayfası yerine Alibaba Cloud Model Studio konsolu üzerinden erişilir.
