Eleven v3, 2 Şubat 2026'da alfa sürecinden çıktı. ElevenLabs API üzerinden çağıracağınız model kimliği ise eleven_v3. ElevenLabs ve fal.ai, 1.000 karakter için aynı şekilde 0,10 $ ücret alıyor. Yani seçimde birim fiyat değil; faturalandırma modeli, eşzamanlılık ve ses erişimi belirleyici. GA sürümüyle birlikte önemli sorunlar da azaldı: genel kullanıma sunulma duyurusuna göre 27 kategori ve 8 dilden oluşan testte yapılandırılmış metin hataları %15,3'ten %4,9'a indi. Yine de entegrasyonu iki kesin sınıra göre planlayın: istek başına 5.000 karakter ve üreticisinin bile gerçek zamanlı kullanım için uygun görmediği bir model.
ElevenLabs Eleven v3 API neler sunuyor?
Eleven v3 API dört ayrı kullanım alanı sağlıyor: konuşma oluşturma, konuşmayı akış olarak aktarma ve çok konuşmacılı ses için ayrı konuşma oluşturma ve konuşma akışı endpoint'leri. Model 70'in üzerinde dili destekliyor, duygu ve konuşma biçimini metin içine yerleştirilen ses etiketleriyle yönlendirebiliyor. GA aşamasında yapılan testlerde de alfa sürümüne kıyasla %72 oranında daha sık tercih edildi.
Yapılandırılmış metinleri v3'e emanet etmeden önce bu testteki kategori ayrıntılarına bakmakta fayda var. Kimyasal formüllerde hata oranı %45,6'dan %0,6'ya, telefon numaralarında %16,9'dan %0,6'ya geriledi; ISBN'lerde ise sıfıra indi. Zayıf halka hâlâ %17,5 hata oranıyla coğrafi koordinatlar. Matematik ifadelerinde oran %6,9 seviyesinde; bu, standart anlatım için kabul edilebilir olsa da koordinat ağırlıklı içeriklerde risk yaratabilir.
Aşağıdaki tabloda v3'ün diğer modeller arasındaki konumunu, resmî modeller dokümanına göre görebilirsiniz:
| Model | Model kimliği | Diller | İstek başına maks. karakter | Belirtilen gecikme | 1.000 karakter fiyatı |
|---|---|---|---|---|---|
| Eleven v3 | eleven_v3 | 70+ | 5.000 (~5 dk.) | ~250–300 ms (katmana göre) | 0,10 $ |
| Eleven v3 Conversational | Text-to-Dialogue WebSocket üzerinden | 70+ | yok | ~280 ms | 0,10 $ |
| Multilingual v2 | eleven_multilingual_v2 | 29 | 10.000 (~10 dk.) | ~250–300 ms | 0,10 $ |
| Flash v2.5 | eleven_flash_v2_5 | 32 | 40.000 (~40 dk.) | ~75 ms | 0,05 $ |
Dokümantasyonda dikkat edilmesi gereken bir tutarsızlık var: fiyatlandırma sayfası “Multilingual v2/v3” modellerini 40.000 karakterlik katman limiti altında birlikte gösteriyor. Buna karşılık modeller referansında Eleven v3 için istek başına sınır 5.000 karakter olarak belirtilmiş. v3 için gerçek sınır olarak 5.000'i esas alın; bu model özelindeki değer. 40 bin karakter varsayımıyla çalışan uzun içerik iş akışları hata verecektir.
Fiyatlandırma: resmî ElevenLabs mı, fal.ai mı?
Birim fiyat iki platformda da 1.000 karakter başına 0,10 $. Ailenin daha ucuz seçeneği yalnızca 1.000 karakter başına 0,05 $ fiyatlanan Flash v2.5. Asıl fark faturalandırma ve paralel istek kapasitesinde ortaya çıkıyor:
| Resmî ElevenLabs | fal.ai | |
|---|---|---|
| Birim fiyat (Eleven v3) | 1.000 karakter başına 0,10 $ | 1.000 karakter başına 0,10 $ |
| Faturalandırma | Dahil kredili abonelik planları veya kullandıkça öde | Tamamen kullanım bazlı; “koltuk lisansı yok, abonelik yok, minimum kullanım yok” |
| Ücretsiz katman | Aylık 10 bin Multilingual karakter (Flash için 20 bin) | Model sayfasında belirtilmemiş |
| Örnek plan | Creator: aylık 22 $ (ilk ay 11 $), 220 bin Multilingual karakter | yok |
| En üst plan | Business: aylık 990 $, 9,9 milyon Multilingual karakter | yok |
| Eşzamanlılık | Plana göre: Free'de aynı anda 2 Multilingual isteği, Scale/Business'ta 15–30, Enterprise'ta özel limit | Sunucusuz kuyruk; model sayfasında hesap başına bir üst sınır belgelenmiyor |
| Kuyruk etkisi | Limiti aşarsanız istekler kuyruğa giriyor ve “genellikle” yaklaşık 50 ms ekleniyor | Toplu işler için webhook destekli kuyruk API'si |
| Kontroller (belgelenmiş şema ve kullanıcı raporları) | ID ile ses; stability (kullanıcılar v3'te 3 konum bildiriyor) | Voice, stability, similarity_boost, speed, language_code, apply_text_normalization, seed, timestamps, output_format |
| Startup programı | 12 ay ücretsiz, 33 milyon karakter, daha yüksek eşzamanlılık | yok |
Resmî tarafta eşzamanlılık plan katmanlarıyla belirleniyor. Free anahtarıyla paralel v3 çağrıları yaptığınızda aynı anda yalnızca 2 istek çalışabiliyor; bu da toplu işleri ciddi biçimde yavaşlatıyor. fal ise tüm işleri sunucusuz bir kuyruktan geçiriyor ve webhook geri çağrıları sunuyor. Her iki platformun fiyatlandırma dokümanında da boşlukların veya köşeli parantez içindeki ses etiketlerinin ücretlendirilen karakter sayısına dahil edilip edilmediği belirtilmiyor. Bütçeyi dahil ediliyormuş gibi hesaplamak en güvenli yaklaşım.
v3'ü yalnızca ara sıra kullanacaksanız ve diğer modellerinizi zaten fal üzerinden çalıştırıyorsanız, platform seçimini fal.ai incelememizde ayrıntılı olarak ele aldık.
Ses etiketleri: duyguyu metnin içinden yönetmek
Ses etiketleri, metnin içine yerleştirilen köşeli parantezli yönlendirmelerdir. Model bunları seslendirmez; performans talimatı olarak yorumlar. fal model sayfasındaki basit bir örnek şöyle:
[slowly] Back then... [chuckles] we had no phones.
[whispers] Just dirt roads and [coughs] big dreams.
[sad] Then it happened.
| Kategori | İşe yarayan örnekler |
|---|---|
| Duygular | [happy], [sad], [excited], [angry], [sarcastically], [nervous], [happily] |
| Seslendirme biçimi | [whispers], [shouting], [shouts], [slowly], [quickly], [softly] |
| Sözsüz sesler | [laughs], [chuckles], [sighs], [gasps], [coughs], [gulps], [clears throat], [applause] |
| Aksanlar | [british accent], [southern accent], [strong canadian accent] |
Resmî yönlendirme dokümanına göre etiket davranışını belirleyen üç temel kural var. Birincisi, resmî ve eksiksiz bir etiket listesi yok; etiketler doğal dilde verilen yönlendirmeler ve ElevenLabs, yayımlanan örneklerin dışında daha etkili seçenekler bulunabileceğini söylüyor. Bu nedenle ezberden çok test yapmak gerekiyor. İkincisi, SSML duraklama etiketleri desteklenmiyor; tempo noktalama işaretleri, üç noktalar ve satır sonlarıyla ayarlanıyor. Üçüncüsü, sonuç ses ve bağlama göre değişiyor. Sorunlar da tam burada başlıyor:
“V3 harika, kesinlikle en insansı ses” “Bana hâlâ beta sürümü gibi geliyor” — Her iki cümle de aynı gönderiden, u/ConcertNeat8147, r/ElevenLabs v3 saha raporu
Aynı başlıkta, yirmi yıllık deneyime sahip yazılım mühendisi u/poundingCode, duygusal etiketler eklendiğinde konuşmacının aksanının bazen tamamen değişebildiğini aktarıyor. ElevenLabs çalışan hesabından gelen yanıtta ise “bunların hepsi şu anda üzerinde çalıştığımız konular” deniyor.
Aynı başlıktaki içerik üreticilerinin paylaştığı geçici çözümler şöyle (topluluk deneyimi, resmî öneri değil):
- Isınma cümlesi. Tonu ve perdeyi belirleyen, sonradan atılacak kısa bir cümleyi metnin başına ekleyin; sesler çoğu zaman üretimin birkaç saniyesinden sonra oturuyor.
- Sona
end.ekleyin. Metnin sonuna bir satır sonu ve “end.” kelimesi koyarak son kelimelerin kesilmesini önleyin, ardından bu bölümü sesten kırpın. - Cümleleri üç noktayla bitirin. Kullanıcı örneklerine göre cümleleri “...” ile kapatmak, kelime sonlarında yaşanan kesilmeleri azaltabiliyor.
- Stability değerini yükseltin. v3'teki stability kontrolünün üç konumu bulunuyor; en yüksek seviye, üretimin başındaki ses kaymasını azaltıyor.
Entegrasyonu belirleyen limitler
- En kritik sınır 5.000 karakter. Bir istek yaklaşık 5 dakikalık ses üretebiliyor. Bu nedenle sesli kitap ve uzun içerik iş akışlarında metni parçalara ayırmanız gerekir: cümle veya paragraf sınırlarından bölün, cümlenin ortasından kesmeyin ve etiketleri yönlendirdikleri parçanın içinde tutun. Daha az sayıda ama daha büyük istek istiyorsanız Multilingual v2, 10.000 karaktere izin veriyor.
- Resmî API'de eşzamanlılık plan özelliği. Modeller referansına göre Free anahtarları aynı anda 2 Multilingual katmanı isteğini (Flash için 4), Scale ve Business planları 15–30 isteği destekliyor. Enterprise'ta özel limitler görüşülüyor. Sınır aşıldığında kuyruğa giren istekler “genellikle” yaklaşık 50 ms ek gecikme yaşıyor. Aynı sayfada ElevenLabs'in kapasite tahmini de yer alıyor: 5 eşzamanlılık limiti, konuşma tabanlı iş yükünde yaklaşık 100 eşzamanlı ses yayınına karşılık geliyor. Tekil istek başına maliyet düşük olsa da toplu işlerde yetersiz kapasite ciddi darboğaz yaratabilir.
- fal herhangi bir maksimum girdi boyutu belirtmiyor. Eleven v3 sayfasında endpoint, parametreler ve formatlar açıklanıyor; ancak girdi sınırı, kuyrukta saklama süresi veya yeniden deneme davranışı hakkında bilgi verilmiyor. Uzun metin göndermenizi engelleyen bir şey yok, fakat bunun garanti edildiği de söylenmiyor.
- Zaman damgaları platforma göre değişiyor. fal giriş şemasındaki
timestampsboolean değeri, altyazı ve dudak senkronu için kullanılabilecek kelime bazında hizalama verisi döndürüyor. Resmî API'de ise v3 diyalog çıktısı zaman damgası içermiyor; geliştiriciler bu eksikliği kamuya açık şekilde gündeme getirdi (r/ElevenLabs: “v3 API, no timestamps?”). Bugün hizalama verisi için belgelenmiş yol fal'ın parametresi.
- Gerçek zamanlı kullanım hâlâ mümkün değil. ElevenLabs, daha yüksek gecikme ve değişken tutarlılık nedeniyle v3'ü gerçek zamanlı ve konuşmalı kullanım için uygun görmüyor. Önerilen seçenekler, ajanlar için yaklaşık 75 ms gecikmeli Flash v2.5 veya etkililiğin etkileşimli kullanımda da korunması gereken durumlar için WebSocket üzerinden yaklaşık 280 ms gecikmeli Eleven v3 Conversational. Gerçek zamanlı bir v3 varyantı yol haritasında yer alıyor (“gerçek zamanlı bir sürüm üzerinde çalışıyoruz”), ancak GA duyurusu yayımlandığında henüz kullanıma sunulmamıştı.
- Ticari kullanım. Alfa döneminde geliştiriciler v3 çıktısının ticari amaçlarla kullanılıp kullanılamayacağını açıkça soruyordu. GA duyurusuyla model tüm platformlarda kullanıma açıldı; fal da endpoint'ini doğrudan ticari kullanıma uygun olarak etiketliyor.
İlk isteğiniz: resmî SDK ve fal istemcisi
Resmî yol, hızlı başlangıç dokümanındaki haliyle:
pip install elevenlabs
from elevenlabs import ElevenLabs
client = ElevenLabs(api_key="YOUR_ELEVENLABS_API_KEY") # or ELEVENLABS_API_KEY env var
audio = client.text_to_speech.convert(
voice_id="JBFqnCBsd6RMkjVDRZzb", # "George"
text="[whispers] The first move is what sets everything in motion.",
model_id="eleven_v3",
output_format="mp3_44100_128",
)
fal tarafında ise fal-client kullanılıyor ve istek fal.run endpoint'ine gönderiliyor:
pip install fal-client
import fal_client
result = fal_client.subscribe(
"fal-ai/elevenlabs/tts/eleven-v3",
arguments={
"text": "[whispers] The first move is what sets everything in motion.",
"voice": "Rachel", # default voice
"stability": 0.5, # 0–1, lower = more expressive variation
"timestamps": True, # per-word alignment data
},
)
print(result["audio"]["url"]) # hosted MP3 URL
Her iki platform da API anahtarlarının istemci tarafı koduna gömülmemesi gerektiği konusunda açıkça uyarıyor. İstekleri kendi sunucunuz üzerinden proxy'leyin. Akış kullanımı için resmî API'de stream-speech endpoint'i bulunuyor; fal tarafında ise fal.stream ve toplu işler için webhook destekli kuyruk API'si sunuluyor.
Hangi endpoint'i kullanmalısınız?
| Senaryo | Kullanılacak seçenek |
|---|---|
| Kendi klonladığınız seslere (PVC/IVC) veya ID ile tanımlanan tasarım seslerine ihtiyacınız var | Resmî API: özel sesler çalışma alanınızdaki ID ile çağrılıyor; fal sayfasında yalnızca hazır ses adları belgelenmiş |
| Dahil kredileri olan bir ElevenLabs planına zaten ödeme yapıyorsunuz | Resmî API: dahil karakterler zaten ödediğiniz krediler, fal üzerinden yapılan her çağrı ise ek harcama |
| Toplu sesli kitap/dublaj işleri, abonelik istemiyorsunuz ve tamamlanma webhook'u gerekiyor | fal: kullandıkça öde modeli ve webhook akışı tam olarak bu senaryoya yönelik |
| Görsel, video ve TTS modellerini tek bir yapıda tek API anahtarıyla kullanmak istiyorsunuz | fal: v3, fal'daki diğer modellerinizle aynı istemci üzerinden çalışıyor |
| Ses ajanları veya gecikmeye duyarlı herhangi bir kullanım | İki v3 TTS endpoint'i de değil: Flash v2.5 (~75 ms) ya da Eleven v3 Conversational (~280 ms) kullanın |
| Kurumsal ihtiyaçlar (SOC 2, HIPAA BAA, özel hız limitleri, IP izin listesi) | Resmî API: fiyatlandırma sayfasında Enterprise planının özellikleri belgelenmiş; fal'ın model sayfası endpoint'inin hangi sertifikaları kapsadığını belirtmiyor |
Sık sorulan sorular
Eleven v3 model kimliği nedir?
eleven_v3. Standart metinden konuşmaya endpoint'lerinde model_id parametresi olarak gönderilir. Çok konuşmacılı diyalog ise model parametresi yerine ayrı Text-to-Dialogue endpoint'lerini kullanır.
Eleven v3 API akış aktarımını destekliyor mu?
Evet. Resmî API, ses üretildikçe aktaran bir stream-speech endpoint'i sunuyor; fal da aynı model için fal.stream desteği sağlıyor. Ancak akış aktarımı v3'ü gerçek zamanlı kullanım için uygun hâle getirmiyor. Resmî yönlendirme hâlâ konuşmalı kullanımda Flash v2.5 veya Eleven v3 Conversational tercih edilmesi yönünde.
Eleven v3 için karakter limiti nedir?
Resmî modeller referansına göre istek başına 5.000 karakter, yani yaklaşık 5 dakikalık ses. Fiyatlandırma sayfasındaki 40.000 karakter değeri doğrudan v3'e değil, Multilingual katman grubuna uygulanıyor.
Eleven v3 API ne kadar tutuyor?
Her iki platformda da 1.000 karakter başına 0,10 $: 10.000 karakterlik bir hikâye 1,00 $, 1 milyon karakterlik bir sesli kitap 100 $. Plan kredileri resmî API maliyetini düşürebilir; örneğin Creator planı aylık 22 $ karşılığında 220 bin Multilingual karakter içeriyor. fal'da abonelik bulunmuyor.
Eleven v3 ile klonlanmış sesleri kullanabilir miyim?
Resmî API'de evet: profesyonel, klonlanmış ve tasarlanmış sesler voice ID üzerinden çağrılabiliyor. Ancak pratikte uyumluluk değişiyor. r/ElevenLabs kullanıcıları, mevcut Professional Voice Clone seslerinin v3'te bazen farklı konuşmacılar gibi duyulduğunu bildiriyor. Üreticileri V3 uyumluluğunu belirten PVC'ler ise genellikle daha iyi sonuç veriyor. fal'ın şeması bir ses adı veya ID kabul ediyor, ancak yalnızca hazır sesleri belgeliyor; özel ElevenLabs ses ID'leri burada belgelenmemiş bir alan.
Eleven v3 gerçek zamanlı ses ajanları için iyi mi?
Hayır. ElevenLabs, yüksek gecikme ve değişken tutarlılık nedeniyle gerçek zamanlı ve konuşmalı kullanımı v3 için açıkça uygun görmüyor. Ajanlar için Flash v2.5 (~75 ms, 32 dil) veya Eleven v3 Conversational (~280 ms, 70+ dil, ses etiketi kontrolü) kullanın.
Eleven v3 API üzerinden neden web sitesindekinden farklı ses alıyorum?
Ses önizlemeleri, kendi metninizle elde edeceğiniz sonucu temsil etmiyor. Bu durum r/ElevenLabs saha raporlarında sıkça dile getirilen bir şikâyet. Ayrıca v3 çıktısı üretimler arasında gözle görülür biçimde değişebiliyor. Bir sese karar vermeden önce her adayı gerçek bir metin parçasıyla ve üretimde kullanacağınız stability ayarıyla test edin.
İlgili içerikler: Qwen Audio 3 TTS API rehberi · Replicate fiyatlandırması ve alternatifleri · fal.ai incelemesi 2026