Temmuz 2026 itibarıyla metinden sese pazarında dikkat çeken tablo şu: Alibaba'nın Qwen-Audio-3.0-TTS-Plus modeli, Artificial Analysis Text-to-Speech arenasında 1.237 Quality Elo puanıyla zirveye çıktı. Google Gemini 3.1 Flash TTS, MiniMax Speech 2.8 HD ve ElevenLabs Eleven v3'ü geride bırakan modelin fiyatı ise milyon karakter başına 27,6 dolar. Bu rakam, geçtiği ElevenLabs ve MiniMax katmanlarının yaklaşık üçte birine denk geliyor. Listedeki en ucuz seçenek değil; ancak #1 kaliteyi bu fiyatla birleştiren başka bir model de yok. (Veriler 20 Temmuz 2026 tarihli. Sağlayıcıların sıralamaları ve fiyatları sık değişebildiğinden, planlama yapmadan önce ikisini de doğrulamakta fayda var.)
Aşağıda modelin ne sunduğunu, bu sıralamaya nasıl ulaştığını, maliyetini ve hangi senaryolarda doğru tercih olup olmadığını ele alıyoruz.
Qwen3-TTS ile aynı model değil
"Qwen audio 3.0 TTS" diye arattığınızda sonuçların büyük bölümü, Alibaba'nın daha önce yayımladığı açık ağırlıklı konuşma modeli ailesi Qwen3-TTS'ye çıkar. GitHub'da ve Hugging Face demosunda bulunan bu model; yerelde çalıştırılan, ComfyUI iş akışlarına bağlanan ve Reddit'te ses klonlama becerisiyle öne çıkan sürüm. Bu rehberdeki ürün ise farklı.
Qwen-Audio-3.0-TTS, indirilebilir ağırlıklar olarak dağıtılmayan, yeni nesil ve barındırılan bir model. Erişim Alibaba Cloud Model Studio (Bailian) üzerinden sağlanıyor. İki katmanı bulunuyor:
- Plus — kaliteyi önceleyen katman. Doğallığın milisaniyelerden daha önemli olduğu sesli kitap, anlatım ve dublaj işleri için tasarlanmış; #1 sıralamayı alan sürüm de bu.
- Flash — gecikmeyi önceleyen katman. İlk paket gecikmesi yaklaşık 300 ms ve sesli ajanlar ile canlı asistanlar gibi gerçek zamanlı etkileşimlere odaklanıyor.
Aynı liderlik tablosunda nesiller arasındaki fark oldukça belirgin: Eski Qwen3 TTS Flash, 929 Elo ile yaklaşık 76. sıradayken yeni Plus katmanı 1.237 Elo ile lider durumda. Marka soyadı aynı olsa da model sınıfı farklı.
İki çözümün hedeflediği kullanım biçimleri de ayrışıyor. Seçim yaparken temel farklar şöyle:
| Qwen3-TTS (açık ağırlıklı) | Qwen-Audio-3.0-TTS (barındırılan) | |
|---|---|---|
| Nasıl erişilir? | Ağırlıklar indirilir (GitHub / Hugging Face) | Alibaba Cloud Model Studio üzerinden API |
| Kendi sunucunda / yerelde çalıştırma | Evet | Hayır — yalnızca barındırılan hizmet |
| ComfyUI ve topluluk düğümleri | Evet | Hayır |
| Katmanlar | Tek açık model ailesi | Plus (kalite) / Flash (~300 ms) |
| Dil kapsamı | ~10 dil | 16 dil + 20 Çince lehçe bölgesi |
| Arena Quality Elo | ~929 (Qwen3 TTS Flash) | 1.237 (Plus, #1) |
| En uygun kullanım | Yerel kontrol, veri yerleşimi, denemeler | En yüksek kalite, lehçeler, ölçekli üretim |
Barındırma kontrolü veya sıfır marjinal maliyet önceliğinizse açık ağırlıklı seriyi tercih edin. Kalite, lehçe kapsamı ya da kendi GPU altyapınızı işletmemek daha önemliyse barındırılan 3.0 katmanları daha uygun.
Zirveye taşıyan bağımsız benchmark
Artificial Analysis arenası, bağımsız bir üçüncü tarafın yürüttüğü kör insan tercihi sıralaması. Dinleyiciler, klibi hangi modelin ürettiğini bilmeden karşılaştırıyor; Elo puanı da her modelin ne sıklıkla tercih edildiğini yansıtıyor.
20 Temmuz 2026 itibarıyla sıralamanın üst bölümü şöyle:
| Sıra | Model | Quality Elo | API fiyatı / 1M karakter |
|---|---|---|---|
| 1 | Qwen-Audio-3.0-TTS-Plus (Alibaba) | 1.237 | $27.6 |
| 2 | Simba 3.2 (SpeechifyAI) | 1.232 | $10.0 |
| 3 | Gemini 3.1 Flash TTS (Google) | 1.211 | $18.3 |
| 4 | Sonic 3.5 (Cartesia) | 1.211 | $49.0 |
| 8 | MiniMax Speech 2.8 HD | 1.180 | $100.0 |
| 11 | ElevenLabs Eleven v3 | 1.173 | $100.0 |
Alibaba'nın paylaştığı metrikler de bağımsız sıralamayla benzer bir yön gösteriyor. Sağlayıcı, çok dilli CV3-Eval benchmark'ında Plus katmanının ortalama kelime/karakter hata oranını 3,96, Flash katmanınınkini ise 3,87 olarak bildiriyor. Yani üretilen konuşma, kaynak metne neredeyse aynı doğrulukla yeniden yazıya dökülebiliyor. Klonlanan sesin referans sese ne kadar yaklaştığını ölçen konuşmacı benzerliği, Plus için test edilen 16 dilin tamamında ortalama 82,75 olarak veriliyor. Bu iki sayı Alibaba'nın kendi verisi; yukarıdaki Elo puanı ise değil. Her benchmark'ı başlangıç noktası kabul edip kendi ses kayıtlarınızla test yapmak en sağlıklısı.
Üretimde öne çıkan yetenekleri
Sıralamadaki başarının arkasında, resmî Qwen-Audio-3.0-TTS teknik sayfasında belgelenen ve üretim ortamında önem taşıyan dört özellik var.
Doğal dille stil yönlendirmesi. Sesi düz metin komutlarıyla yönetebiliyorsunuz: "Bunu endişeli bir gece radyosu sunucusu gibi oku, sona yaklaşırken yavaşla" örneğinde olduğu gibi. Rol, duygu, konuşma tarzı, hız, tını ve aksan için geniş kapsamlı kontrol sunuyor; temel yönlendirmeler için ayrı bir işaretleme dili öğrenmeniz gerekmiyor.
Metin içi ayrıntılı etiketler. Daha hassas kontrol gerektiğinde model, metnin doğrudan içine yerleştirilen 86 etiketi okuyabiliyor. Gülme, nefes alma, öksürme ve iç çekme gibi sözel olmayan olaylar da bunlara dahil. Düz bir okumayla performans hissi veren bir ses arasındaki fark burada ortaya çıkıyor; oyun diyalogları, anlatım ve film dublajında modeli kullanılabilir kılan da bu.
Dil ve lehçe kapsamı. Arapça, Endonezce, Portekizce, Tayca, Vietnamca, Malayca ve Tagalog dahil sonradan eklenen yedi dilin de bulunduğu 16 dili destekliyor. Buna Kantonca ve Şanghayca'dan Siçuan ve Kuzeydoğu lehçelerine uzanan 20 Çince lehçe bölgesi ekleniyor. Güneydoğu Asya'ya ya da Çince konuşulan farklı pazarlara ürün sunan ekipler için bu lehçe kapsamını başka yerde yakalamak kolay değil.
Dayanıklılık ve çıktı kalitesi. Gürültülü, yankılı veya net olmayan referans seslerden ek bir gürültü temizleme adımına gerek duymadan ses klonlayabiliyor. Uzun anlatımlar için tek seferde üç dakikaya kadar ses üretiyor ve 48 kHz çıktı veriyor; 48 kHz için konsol dağıtımının 24 Temmuz'da yapılması planlanıyor. Tek geçişte üç dakikalık üretim önemli, çünkü kısa klipleri sonradan birleştirmek genellikle prozodi ve tını tutarlılığının bozulduğu nokta oluyor.
Fiyatlandırma: zirve kalite, premium fiyat etiketi olmadan
Metinden sese hizmetleri, giriş metnindeki karakter sayısına göre ücretlendirilir. Dolayısıyla maliyet, seslendirdiğiniz metin hacmiyle doğrudan artar.
Milyon karakter başına 27,6 dolar fiyatıyla Qwen-Audio-3.0-TTS-Plus, geçtiği iki köklü premium seçeneğin yalnızca bir bölümüne mal oluyor: ElevenLabs Eleven v3 ve MiniMax Speech 2.8 HD, milyon karakter başına 100 dolar listeliyor; yani yaklaşık 3,6 kat daha pahalı. Pratikte yaklaşık kısa bir roman uzunluğundaki 100.000 karakterlik bir sesli kitap, Plus'ta yaklaşık 2,76 dolar; bu iki modelde ise yaklaşık 10 dolar tutuyor.
Bununla birlikte Plus, genel listede en ucuz alternatif değil. Kalite açısından bir basamak aşağıda yer alan iki model daha düşük fiyat sunuyor: Gemini 3.1 Flash TTS, milyon karakter başına 18,3 dolar ile 3. sırada; Simba 3.2 ise 10 dolar ile 2. sırada ve Elo puanında neredeyse başa baş. Bu nedenle doğru tanım daha dar: Qwen, en yüksek sıralı kaliteyi orta segment fiyatla sunuyor; listedeki en düşük fiyatı değil. Kullanım senaryonuzda birkaç Elo puanı kritik değilse daha az ödeyebilirsiniz. (Herkese açık arena Plus fiyatını listeliyor; Flash'ın karakter başı fiyatı henüz burada yayımlanmadı. Güncel Flash fiyatı için konsolu kontrol edin.)
Qwen-Audio-3.0-TTS nasıl kullanılır?
En doğrudan yol Alibaba Cloud Model Studio (Bailian). İstek formatları ve SDK'lar için Model Studio dokümantasyonuna bakabilirsiniz: Bir API anahtarı oluşturduktan sonra model-market endpoint'i üzerinden qwen-audio-3.0-tts-plus veya qwen-audio-3.0-tts-flash modelini çağırın. Mantıklı bir başlangıç yaklaşımı, gecikmenin ihtiyacınıza uyup uymadığını görmek için önce Flash ile prototip hazırlamak, ardından aynı metinleri Plus üzerinden çalıştırıp karşılaştırmak. Doğru katman; canlı etkileşim mi, yoksa dinleyicinin baştan sona takip edeceği bir anlatım mı ürettiğinize bağlı.
Faturalandırmayı tek bir arayüzde tutmak için AIReiter gibi uyumlu bir toplayıcı üzerinden birden fazla sağlayıcı kullanan ekipler, ayrı bir Alibaba hesabı açmak yerine modeli buraya da ekleyebilir. İhtiyacınız olan tek model buysa doğrudan erişim en basit seçenek.
Tek seferlik anlatım yerine gerçek zamanlı konuşma gerekiyorsa TTS modeli yalnızca katmanlardan biri. Bununla eşleşen omni Realtime API ve streaming ASR, Qwen Audio 3 Realtime rehberinde ele alınıyor.
Kullanmalı mısınız?
- Plus'ı seçin — Çince, lehçe veya çok dilli anlatım, sesli kitap ya da dublaj üretiyorsanız ve dolar başına en yüksek doğallığı hedefliyorsanız.
- Flash'ı seçin — Yaklaşık 300 ms ilk paket gecikmesinin, kalitedeki son birkaç Elo puanından daha önemli olduğu gerçek zamanlı bir sesli ajan geliştiriyorsanız.
- Gemini 3.1 Flash TTS veya Simba 3.2'ye bakın — Belirleyici unsur maliyetse ve zirveye yakın kalite sizin için yeterliyse. İkisinin de fiyatı Plus'tan düşük.
- ElevenLabs veya Cartesia ile devam edin — Olgun SDK'larına, daha geniş hazır ses kütüphanelerine ya da İngilizce odaklı araç ve ekosistemlerine bağımlıysanız. Arena sıralamasından bağımsız olarak bu alanlarda hâlâ öndeler.
Burada karşılaştırılan modeller arasında #1 arena sıralaması, 20 Çince lehçe bölgesi ve 27,6 dolar/M fiyatını aynı pakette sunan tek seçenek Plus. Bu kombinasyon kullanım senaryonuza uyuyorsa, yalnızca sıralamaya güvenerek karar vermek yerine taahhütte bulunmadan önce kendi metinlerinizi modelden geçirmek değerli olur.
Sık sorulan sorular
Qwen-Audio-3.0-TTS ücretsiz mi?
Hayır. Barındırılan Plus ve Flash katmanları ücretli; Alibaba Cloud Model Studio üzerinden karakter başına faturalandırılıyor. Plus için fiyat milyon karakter başına 27,6 dolar. Alibaba Cloud dönem dönem ücretsiz deneme kotaları sunuyor; bölgenizde geçerli bir teklif olup olmadığını konsoldan kontrol edin. Açık ağırlıklı Qwen3-TTS ise kendi altyapınızda ücretsiz barındırılabilir.
Qwen-Audio-3.0-TTS açık kaynak mı? İndirebilir miyim?
Barındırılan Qwen-Audio-3.0-TTS-Plus/Flash katmanları ağırlık olarak dağıtılmıyor. Açık kaynak model, yerel kullanım, klonlama ve ComfyUI iş akışları için GitHub ile Hugging Face'de bulunan önceki Qwen3-TTS ailesi. Birbiriyle ilişkili, ancak ayrı sürümler.
Ses klonlamayı destekliyor mu?
Evet. Referans sesten hedef sesi klonlayabiliyor ve referans kayıt gürültülü veya yankılı olduğunda da çalışacak şekilde özel olarak ayarlanmış; ayrı bir temizleme adımı gerekmiyor. Plus katmanında konuşmacı benzerliği, 16 dil genelinde ortalama 82,75.
Qwen-Audio-3.0-TTS ile Qwen3-TTS-Flash arasındaki fark nedir?
Qwen3-TTS-Flash, önceki açık ağırlıklı neslin bir parçası ve arenada çok daha aşağıda yer alıyor: Elo değeri yaklaşık 929. Qwen-Audio-3.0-TTS ise yeni barındırılan nesil; Flash katmanı düşük gecikmeye, Plus katmanı ise 1.237 Elo ile kalite sıralamasının zirvesine odaklanıyor.
Demo veya ComfyUI desteği var mı?
Açık ağırlıklı Qwen3-TTS için herkese açık bir Hugging Face demosu ve topluluk tarafından geliştirilen ComfyUI düğümleri var. Barındırılan Qwen-Audio-3.0-TTS katmanlarına ise bağımsız bir demo sayfası yerine Alibaba Cloud Model Studio konsolu üzerinden erişiliyor.