AIREITER

Kokoro 82M TTS: Yerel CPU Testi, Sesler ve Maliyet

Son Güncelleme: 2026-09-28 01:23:19

Her cümleyi ücretli bir API’ye göndermeden doğal sesli anlatım üretmek istiyorsanız, Kokoro 82M TTS denenecek en pratik açık modellerden biri. Ancak “82M” ifadesi onu her durumda ElevenLabs’ın alternatifi yapmıyor. Kokoro; hazır sesler, temiz anlatım ve yerel toplu işler için güçlü. Ses klonlama, dramatik ifade kontrolü ve yönetilen servis güvenilirliği söz konusu olduğunda ise başka seçeneklere bakmak gerekiyor.

Kısa karar rehberi

Kokoro-82M, 82 milyon parametreli, ağırlıkları açık bir metin-konuşma modeli. Güncel Hugging Face model kartına göre v1.0, 27 Ocak 2025 tarihinde yayımlandı; Apache 2.0 lisanslı ağırlıklarıyla sekiz dil ve 54 ses sunuyor: resmî model kartı. Resmî çıkarım kütüphanesi ise hexgrad/kokoro.

Gizli veya çevrimdışı anlatım üretmeniz gerekiyorsa, hazır sesler işinizi görüyorsa ve iş yükünüz API ücretlerini önemsetecek kadar büyükse Kokoro’yu seçin. Ses klonlama, yönetilen bir stüdyo veya ticari kullanımda daha güçlü ifade kontrolü istiyorsanız ElevenLabs daha uygun. Çok dilli destek ve klonlama, modelin küçük olmasından daha önemliyse Qwen3-TTS’e bakın.

Yerel kurulum: Sorunsuz çalışan yol

Resmî örnekler Python, kokoro, soundfile, PyTorch ve espeak-ng kullanıyor; işlem hattı sesi 24 kHz olarak döndürüyor. Linux’ta temel kurulum şöyle:

pip install -q "kokoro>=0.9.4" soundfile
sudo apt-get install espeak-ng

En basit İngilizce örnek:

from kokoro import KPipeline
import soundfile as sf

pipeline = KPipeline(lang_code="a")
text = "Kokoro is a small local text to speech model."

for index, (_, _, audio) in enumerate(
    pipeline(text, voice="af_heart", speed=1)
):
    sf.write(f"kokoro-{index}.wav", audio, 24000)

Depo; Amerikan ve Britanya İngilizcesi, İspanyolca, Fransızca, Hintçe, İtalyanca, Japonca, Brezilya Portekizcesi ve Mandarin Çincesi için dil kodlarını belgeliyor. Japonca ve Mandarin için ilgili Misaki eklentileri gerekiyor. Seçtiğiniz dil kodu, kullandığınız sesle eşleşmeli.

Windows tarafında kurulum tek komutla bitmiyor; proje README dosyası kullanıcıları espeak-ng MSI sürümüne yönlendiriyor. Apple Silicon kullanıcıları PYTORCH_ENABLE_MPS_FALLBACK=1 ile PyTorch MPS’i deneyebilir. İlk çalıştırma başarısız olduğunda sonucu modelin parametre sayısından çok bu ayrıntılar belirliyor.

CPU, GPU ve gerçek zamanlı hız: Ne doğrulanmış durumda?

CPU üzerinde çıkarım destekleniyor, ancak ne resmî model kartı ne de resmî kütüphane herkes için geçerli tek bir gerçek zaman katsayısı veriyor. Hız; çalışma ortamına, işlemciye, dile, metnin nasıl bölündüğüne ve ilk çalıştırmada modelin yüklenip yüklenmediğine göre değişiyor.

Topluluk ölçümleri, genelleme yapmanın neden riskli olduğunu gösteriyor. Ayrıntılı bir karşılaştırmada @analogalok yaklaşık 0,9 GB VRAM kullanılan bir kurulumda 21 saniyelik sesi yaklaşık 0,7 saniyede ürettiğini bildirdi. Bu, düşük bellekli bir GPU yolunun mümkün olduğuna dair faydalı bir veri; her dizüstü bilgisayar için garanti değil.

“CPU’mla rahatça çalıştırabiliyorum ve ortaya çıkan sesi dinlemek oldukça keyifli.” — @rasmus1610, X

Kendi donanımınızda üç ayrı değeri ölçün:

  1. İşlem başladıktan ilk ses parçasının oluşmasına kadar geçen süre.
  2. Model ve ses belleğe alındıktan sonraki süre.
  3. Ses süresinin, ısınmış modelle üretim süresine oranı: gerçek zaman katsayısı.

Toplu anlatım üreten bir sistemde aktarım hızını belirleyen üçüncü değerdir. Etkileşimli bir asistan içinse ilk ses parçasına kadar geçen süre ve akış davranışı daha önemlidir. GPU sonucunu CPU sonucu gibi aktarmayın; 10 saniyelik bir örneği de “üretim kapasitesi” diye sunmayın.

Sesler, diller ve gözden kaçırılmaması gereken sınırlar

v1.0 model kartında sekiz dil ve 54 ses listeleniyor. Bu, v0.19 sürümündeki tek dil ve 10 sese kıyasla önemli bir artış. Kütüphanede belgelenen dil kodları şöyle:

KodDil
aAmerikan İngilizcesi
bBritanya İngilizcesi
eİspanyolca
fFransızca
hHintçe
iİtalyanca
jJaponca
pBrezilya Portekizcesi
zMandarin Çincesi

Kokoro hazır sesler kullanıyor; referans ses üzerinden çalışan bir ses klonlama sistemi değil. Ayrıca Misaki yazıbirimden-sesbirime dönüşüm yığınına ve gerektiğinde espeak-ng geri dönüş yollarına dayanıyor. İsimler, kısaltmalar, sayılar ve birden fazla dil içeren metinler uzun bir dışa aktarma işleminden önce mutlaka test edilmeli.

Apache 2.0 model lisansı ticari dağıtım açısından cazip. Ancak “model Apache 2.0 lisanslı” ifadesi, her ses örneği, veri kümesi veya üçüncü taraf bağımlılığı için otomatik olarak geçerli bir izin anlamına gelmiyor. Model kartını, ses dosyalarını ve bağımlılık lisanslarını yayın öncesi kontrol listenize ekleyin.

Kokoro vs ElevenLabs vs Qwen3-TTS

Üç sistemi kör dinleme testiyle karşılaştırmanın anlamlı olabilmesi için aynı metin, aynı ses tanımı, aynı normalizasyon, aynı çıkış seviyesi ve aynı değerlendirici grubunun kullanılması gerekir. Bu yazı, kontrollü bir kör dinleme testinin kazananını ilan etmiyor; resmî Kokoro materyallerinde de böyle bir test yayımlanmış değil. Daha savunulabilir karşılaştırma, iş akışındaki ödünleşimlere bakmak:

Karar ölçütüKokoro-82MElevenLabsQwen3-TTS
DağıtımYerel/açık ağırlıklarBarındırılan API ve stüdyoYerel/açık model ailesi
Model lisansı/kaynağıApache 2.0 ağırlıklarSağlayıcının koşullarıResmî model kartlarında Apache 2.0 listeleniyor
Hazır seslerEvetGeniş barındırılan ses kütüphanesiCustomVoice ve diğer varyantlar
Ses klonlamaHayırDesteklenen plan ve özelliklerde mevcutBase varyantı referans üzerinden klonlamayı destekliyor
Dillerv1.0 için 8 dil listeleniyorModele göre değişir; resmî API fiyatlandırması modele göre farklılık gösterir10 dil listeleniyor
En uygun kullanımGizli toplu anlatımYönetilen, ifadeli üretimÇok dilli veya klonlama deneyleri
Temel maliyetDonanım veya barındırılan çıkarımKarakter/kredi bazlı ücretlendirmeDonanım veya barındırma

ElevenLabs’ın resmî API fiyatlandırma sayfasında Flash/Turbo için 1.000 karakter başına yaklaşık 0,05 dolar, v2 Multilingual ve v3 içinse 1.000 karakter başına 0,10 dolar listeleniyor: API fiyatlandırması. Qwen3-TTS’in resmî model kartında Çince, İngilizce, Japonca, Korece, Almanca, Fransızca, Rusça, Portekizce, İspanyolca ve İtalyanca ile birlikte klonlamaya odaklanan varyantlar listeleniyor: Qwen3-TTS model kartı.

Pratik sonuç “Kokoro daha iyi ses veriyor” değil. Kokoro, tekrarlayan API bağımlılığını ortadan kaldırıyor ve metni makinenizden çıkarmadan çalışabiliyor. ElevenLabs kolaylık ve yönetilen altyapı sağlıyor; Qwen3-TTS ise daha büyük bir yerel model karşılığında daha geniş çok dilli ve klonlama özellikleri sunuyor.

Toplu anlatım maliyeti: Savunabileceğiniz hesap

Yerel Kokoro’da karakter başına model ücreti yok. Marjinal maliyetiniz elektrik, depolama ve çıkarımı çalıştıran makine ya da bulut sunucusundan oluşuyor. Makine zaten sizinse ek yazılım maliyeti pratikte sıfır; GPU veya CPU kiralıyorsanız sağlayıcının saatlik ücretini duvar saatiyle ölçülen üretim süresiyle çarpın.

API karşılaştırması için Kokoro model kartında Nisan 2025 tarihli, milyon giriş karakteri başına 1 doların altında kalan barındırılan örnekler yer alıyor: Replicate’te 0,65 dolar ve DeepInfra’da 0,80 dolar. Bunlar güncel fiyat garantisi değil, tarihli referans noktaları. Aynı metin hacminde ElevenLabs’ın resmî oranları şu sonucu veriyor:

İş yüküKokoro yerel model ücretiElevenLabs Flash/TurboElevenLabs v2 Multilingual/v3
100.000 karakterYerelde 0 dolar*5 dolar10 dolar
1.000.000 karakterYerelde 0 dolar*50 dolar100 dolar
10.000.000 karakterYerelde 0 dolar*500 dolar1.000 dolar

\*Elektrik, donanım, barındırma ve mühendislik süresi dahil değildir. ElevenLabs rakamlarında resmî 1.000 karakter başına 0,05/0,10 dolar oranları kullanılmış; plan indirimleri, krediler, vergiler ve kota aşımı kuralları hesaba katılmamıştır. Tablo, bütçe planlama modelidir; nihai fatura garantisi değildir.

Bu nedenle Kokoro; altyazılar, dokümantasyon, erişilebilirlik sesleri ve kurum içi eğitim videoları gibi tekrarlanabilir anlatım hatlarında özellikle cazip. Ancak telaffuz kontrolü ve parçaları birleştirme için harcanan insan emeği API faturasını aşacaksa avantajı azalıyor.

Sık sorulan sorular

Kokoro GPU olmadan çalışır mı?

Evet. CPU üzerinde çıkarım destekleniyor, ancak resmî proje herkes için geçerli bir gerçek zaman katsayısı taahhüt etmiyor. Yayına alacağınız CPU ve dil kombinasyonunda ısınmış modelin aktarım hızını ölçün.

Kokoro ses klonlayabilir mi?

Hayır. Kokoro hazır seslerle çalışan bir sistem. Konuşmacı kimliği temel gereksinimse, uygun bir Qwen3-TTS varyantı gibi klonlama destekleyen bir model kullanın.

Kokoro ticari kullanım için ücretsiz mi?

Kokoro-82M model kartında ağırlıklar Apache 2.0 lisanslı olarak listeleniyor; bu izinleri geniş bir lisans. Ticari bir ürün yayımlamadan önce kullandığınız sesin, bağımlılıkların ve dağıtımın koşullarını ayrıca inceleyin.

Kokoro hangi dilleri destekliyor?

v1.0 model kartında sekiz dil listeleniyor. Resmî kütüphane ise Amerikan ve Britanya İngilizcesinin yanı sıra İspanyolca, Fransızca, Hintçe, İtalyanca, Japonca, Brezilya Portekizcesi ve Mandarin Çincesini belgeliyor. Bazı diller için ilgili paketlerin kurulması gerekebilir.

Kokoro, ElevenLabs’tan daha mı iyi?

Her açıdan değil. Yerel, gizli ve hazır seslerle toplu anlatım üretmek için Kokoro daha uygun. Yönetilen altyapı, ses klonlama ve ifadeli üretim iş akışlarında ise ElevenLabs daha güvenli tercih.

Pratik seçim

Kabul testiniz “Bu makine, ihtiyacım olan aktarım hızında, özel verileri dışarı çıkarmadan ve mevcut seslerden biriyle temiz anlatım üretebiliyor mu?” ise Kokoro ile başlayın. Testi gerçekten kullanacağınız isimler, tarihler, sayılar, uzun paragraflar ve dillerle yapın.

Testi geçerse hesap basit: tekrarlayan karakter ücretlerini makine süresiyle değiştirirsiniz. Telaffuz, konuşmacı kimliği veya duygusal yönlendirme konusunda yetersiz kalırsa ElevenLabs’a ya da Qwen3-TTS’e geçmek bir kalite yenilgisi değildir; Kokoro’nun özellikle önceliklendirmediği bir yetenek için ödeme yapmış olursunuz.

Aynı kararın ticari taraftaki karşılığı için ElevenLabs Eleven v3 API rehberine göz atabilirsiniz.