Her cümleyi ücretli bir API’ye göndermeden doğal sesli anlatım üretmek istiyorsanız, Kokoro 82M TTS denenecek en pratik açık modellerden biri. Ancak “82M” ifadesi onu her durumda ElevenLabs’ın alternatifi yapmıyor. Kokoro; hazır sesler, temiz anlatım ve yerel toplu işler için güçlü. Ses klonlama, dramatik ifade kontrolü ve yönetilen servis güvenilirliği söz konusu olduğunda ise başka seçeneklere bakmak gerekiyor.
Kısa karar rehberi
Kokoro-82M, 82 milyon parametreli, ağırlıkları açık bir metin-konuşma modeli. Güncel Hugging Face model kartına göre v1.0, 27 Ocak 2025 tarihinde yayımlandı; Apache 2.0 lisanslı ağırlıklarıyla sekiz dil ve 54 ses sunuyor: resmî model kartı. Resmî çıkarım kütüphanesi ise hexgrad/kokoro.
Gizli veya çevrimdışı anlatım üretmeniz gerekiyorsa, hazır sesler işinizi görüyorsa ve iş yükünüz API ücretlerini önemsetecek kadar büyükse Kokoro’yu seçin. Ses klonlama, yönetilen bir stüdyo veya ticari kullanımda daha güçlü ifade kontrolü istiyorsanız ElevenLabs daha uygun. Çok dilli destek ve klonlama, modelin küçük olmasından daha önemliyse Qwen3-TTS’e bakın.
Yerel kurulum: Sorunsuz çalışan yol
Resmî örnekler Python, kokoro, soundfile, PyTorch ve espeak-ng kullanıyor; işlem hattı sesi 24 kHz olarak döndürüyor. Linux’ta temel kurulum şöyle:
pip install -q "kokoro>=0.9.4" soundfile
sudo apt-get install espeak-ng
En basit İngilizce örnek:
from kokoro import KPipeline
import soundfile as sf
pipeline = KPipeline(lang_code="a")
text = "Kokoro is a small local text to speech model."
for index, (_, _, audio) in enumerate(
pipeline(text, voice="af_heart", speed=1)
):
sf.write(f"kokoro-{index}.wav", audio, 24000)
Depo; Amerikan ve Britanya İngilizcesi, İspanyolca, Fransızca, Hintçe, İtalyanca, Japonca, Brezilya Portekizcesi ve Mandarin Çincesi için dil kodlarını belgeliyor. Japonca ve Mandarin için ilgili Misaki eklentileri gerekiyor. Seçtiğiniz dil kodu, kullandığınız sesle eşleşmeli.
Windows tarafında kurulum tek komutla bitmiyor; proje README dosyası kullanıcıları espeak-ng MSI sürümüne yönlendiriyor. Apple Silicon kullanıcıları PYTORCH_ENABLE_MPS_FALLBACK=1 ile PyTorch MPS’i deneyebilir. İlk çalıştırma başarısız olduğunda sonucu modelin parametre sayısından çok bu ayrıntılar belirliyor.
CPU, GPU ve gerçek zamanlı hız: Ne doğrulanmış durumda?
CPU üzerinde çıkarım destekleniyor, ancak ne resmî model kartı ne de resmî kütüphane herkes için geçerli tek bir gerçek zaman katsayısı veriyor. Hız; çalışma ortamına, işlemciye, dile, metnin nasıl bölündüğüne ve ilk çalıştırmada modelin yüklenip yüklenmediğine göre değişiyor.
Topluluk ölçümleri, genelleme yapmanın neden riskli olduğunu gösteriyor. Ayrıntılı bir karşılaştırmada @analogalok yaklaşık 0,9 GB VRAM kullanılan bir kurulumda 21 saniyelik sesi yaklaşık 0,7 saniyede ürettiğini bildirdi. Bu, düşük bellekli bir GPU yolunun mümkün olduğuna dair faydalı bir veri; her dizüstü bilgisayar için garanti değil.
“CPU’mla rahatça çalıştırabiliyorum ve ortaya çıkan sesi dinlemek oldukça keyifli.” — @rasmus1610, X
Kendi donanımınızda üç ayrı değeri ölçün:
- İşlem başladıktan ilk ses parçasının oluşmasına kadar geçen süre.
- Model ve ses belleğe alındıktan sonraki süre.
- Ses süresinin, ısınmış modelle üretim süresine oranı: gerçek zaman katsayısı.
Toplu anlatım üreten bir sistemde aktarım hızını belirleyen üçüncü değerdir. Etkileşimli bir asistan içinse ilk ses parçasına kadar geçen süre ve akış davranışı daha önemlidir. GPU sonucunu CPU sonucu gibi aktarmayın; 10 saniyelik bir örneği de “üretim kapasitesi” diye sunmayın.
Sesler, diller ve gözden kaçırılmaması gereken sınırlar
v1.0 model kartında sekiz dil ve 54 ses listeleniyor. Bu, v0.19 sürümündeki tek dil ve 10 sese kıyasla önemli bir artış. Kütüphanede belgelenen dil kodları şöyle:
| Kod | Dil |
|---|---|
a | Amerikan İngilizcesi |
b | Britanya İngilizcesi |
e | İspanyolca |
f | Fransızca |
h | Hintçe |
i | İtalyanca |
j | Japonca |
p | Brezilya Portekizcesi |
z | Mandarin Çincesi |
Kokoro hazır sesler kullanıyor; referans ses üzerinden çalışan bir ses klonlama sistemi değil. Ayrıca Misaki yazıbirimden-sesbirime dönüşüm yığınına ve gerektiğinde espeak-ng geri dönüş yollarına dayanıyor. İsimler, kısaltmalar, sayılar ve birden fazla dil içeren metinler uzun bir dışa aktarma işleminden önce mutlaka test edilmeli.
Apache 2.0 model lisansı ticari dağıtım açısından cazip. Ancak “model Apache 2.0 lisanslı” ifadesi, her ses örneği, veri kümesi veya üçüncü taraf bağımlılığı için otomatik olarak geçerli bir izin anlamına gelmiyor. Model kartını, ses dosyalarını ve bağımlılık lisanslarını yayın öncesi kontrol listenize ekleyin.
Kokoro vs ElevenLabs vs Qwen3-TTS
Üç sistemi kör dinleme testiyle karşılaştırmanın anlamlı olabilmesi için aynı metin, aynı ses tanımı, aynı normalizasyon, aynı çıkış seviyesi ve aynı değerlendirici grubunun kullanılması gerekir. Bu yazı, kontrollü bir kör dinleme testinin kazananını ilan etmiyor; resmî Kokoro materyallerinde de böyle bir test yayımlanmış değil. Daha savunulabilir karşılaştırma, iş akışındaki ödünleşimlere bakmak:
| Karar ölçütü | Kokoro-82M | ElevenLabs | Qwen3-TTS |
|---|---|---|---|
| Dağıtım | Yerel/açık ağırlıklar | Barındırılan API ve stüdyo | Yerel/açık model ailesi |
| Model lisansı/kaynağı | Apache 2.0 ağırlıklar | Sağlayıcının koşulları | Resmî model kartlarında Apache 2.0 listeleniyor |
| Hazır sesler | Evet | Geniş barındırılan ses kütüphanesi | CustomVoice ve diğer varyantlar |
| Ses klonlama | Hayır | Desteklenen plan ve özelliklerde mevcut | Base varyantı referans üzerinden klonlamayı destekliyor |
| Diller | v1.0 için 8 dil listeleniyor | Modele göre değişir; resmî API fiyatlandırması modele göre farklılık gösterir | 10 dil listeleniyor |
| En uygun kullanım | Gizli toplu anlatım | Yönetilen, ifadeli üretim | Çok dilli veya klonlama deneyleri |
| Temel maliyet | Donanım veya barındırılan çıkarım | Karakter/kredi bazlı ücretlendirme | Donanım veya barındırma |
ElevenLabs’ın resmî API fiyatlandırma sayfasında Flash/Turbo için 1.000 karakter başına yaklaşık 0,05 dolar, v2 Multilingual ve v3 içinse 1.000 karakter başına 0,10 dolar listeleniyor: API fiyatlandırması. Qwen3-TTS’in resmî model kartında Çince, İngilizce, Japonca, Korece, Almanca, Fransızca, Rusça, Portekizce, İspanyolca ve İtalyanca ile birlikte klonlamaya odaklanan varyantlar listeleniyor: Qwen3-TTS model kartı.
Pratik sonuç “Kokoro daha iyi ses veriyor” değil. Kokoro, tekrarlayan API bağımlılığını ortadan kaldırıyor ve metni makinenizden çıkarmadan çalışabiliyor. ElevenLabs kolaylık ve yönetilen altyapı sağlıyor; Qwen3-TTS ise daha büyük bir yerel model karşılığında daha geniş çok dilli ve klonlama özellikleri sunuyor.
Toplu anlatım maliyeti: Savunabileceğiniz hesap
Yerel Kokoro’da karakter başına model ücreti yok. Marjinal maliyetiniz elektrik, depolama ve çıkarımı çalıştıran makine ya da bulut sunucusundan oluşuyor. Makine zaten sizinse ek yazılım maliyeti pratikte sıfır; GPU veya CPU kiralıyorsanız sağlayıcının saatlik ücretini duvar saatiyle ölçülen üretim süresiyle çarpın.
API karşılaştırması için Kokoro model kartında Nisan 2025 tarihli, milyon giriş karakteri başına 1 doların altında kalan barındırılan örnekler yer alıyor: Replicate’te 0,65 dolar ve DeepInfra’da 0,80 dolar. Bunlar güncel fiyat garantisi değil, tarihli referans noktaları. Aynı metin hacminde ElevenLabs’ın resmî oranları şu sonucu veriyor:
| İş yükü | Kokoro yerel model ücreti | ElevenLabs Flash/Turbo | ElevenLabs v2 Multilingual/v3 |
|---|---|---|---|
| 100.000 karakter | Yerelde 0 dolar* | 5 dolar | 10 dolar |
| 1.000.000 karakter | Yerelde 0 dolar* | 50 dolar | 100 dolar |
| 10.000.000 karakter | Yerelde 0 dolar* | 500 dolar | 1.000 dolar |
\*Elektrik, donanım, barındırma ve mühendislik süresi dahil değildir. ElevenLabs rakamlarında resmî 1.000 karakter başına 0,05/0,10 dolar oranları kullanılmış; plan indirimleri, krediler, vergiler ve kota aşımı kuralları hesaba katılmamıştır. Tablo, bütçe planlama modelidir; nihai fatura garantisi değildir.
Bu nedenle Kokoro; altyazılar, dokümantasyon, erişilebilirlik sesleri ve kurum içi eğitim videoları gibi tekrarlanabilir anlatım hatlarında özellikle cazip. Ancak telaffuz kontrolü ve parçaları birleştirme için harcanan insan emeği API faturasını aşacaksa avantajı azalıyor.
Sık sorulan sorular
Kokoro GPU olmadan çalışır mı?
Evet. CPU üzerinde çıkarım destekleniyor, ancak resmî proje herkes için geçerli bir gerçek zaman katsayısı taahhüt etmiyor. Yayına alacağınız CPU ve dil kombinasyonunda ısınmış modelin aktarım hızını ölçün.
Kokoro ses klonlayabilir mi?
Hayır. Kokoro hazır seslerle çalışan bir sistem. Konuşmacı kimliği temel gereksinimse, uygun bir Qwen3-TTS varyantı gibi klonlama destekleyen bir model kullanın.
Kokoro ticari kullanım için ücretsiz mi?
Kokoro-82M model kartında ağırlıklar Apache 2.0 lisanslı olarak listeleniyor; bu izinleri geniş bir lisans. Ticari bir ürün yayımlamadan önce kullandığınız sesin, bağımlılıkların ve dağıtımın koşullarını ayrıca inceleyin.
Kokoro hangi dilleri destekliyor?
v1.0 model kartında sekiz dil listeleniyor. Resmî kütüphane ise Amerikan ve Britanya İngilizcesinin yanı sıra İspanyolca, Fransızca, Hintçe, İtalyanca, Japonca, Brezilya Portekizcesi ve Mandarin Çincesini belgeliyor. Bazı diller için ilgili paketlerin kurulması gerekebilir.
Kokoro, ElevenLabs’tan daha mı iyi?
Her açıdan değil. Yerel, gizli ve hazır seslerle toplu anlatım üretmek için Kokoro daha uygun. Yönetilen altyapı, ses klonlama ve ifadeli üretim iş akışlarında ise ElevenLabs daha güvenli tercih.
Pratik seçim
Kabul testiniz “Bu makine, ihtiyacım olan aktarım hızında, özel verileri dışarı çıkarmadan ve mevcut seslerden biriyle temiz anlatım üretebiliyor mu?” ise Kokoro ile başlayın. Testi gerçekten kullanacağınız isimler, tarihler, sayılar, uzun paragraflar ve dillerle yapın.
Testi geçerse hesap basit: tekrarlayan karakter ücretlerini makine süresiyle değiştirirsiniz. Telaffuz, konuşmacı kimliği veya duygusal yönlendirme konusunda yetersiz kalırsa ElevenLabs’a ya da Qwen3-TTS’e geçmek bir kalite yenilgisi değildir; Kokoro’nun özellikle önceliklendirmediği bir yetenek için ödeme yapmış olursunuz.
Aynı kararın ticari taraftaki karşılığı için ElevenLabs Eleven v3 API rehberine göz atabilirsiniz.