AIREITER

ElevenLabs Eleven v3 API: Fiyatlandırma, Limitler ve Ses Etiketleri

Son Güncelleme: 2026-08-18 01:34:54

Eleven v3, 2 Şubat 2026'da alfa sürecinden çıktı. ElevenLabs API üzerinden çağıracağınız model kimliği ise eleven_v3. ElevenLabs ve fal.ai, 1.000 karakter için aynı şekilde 0,10 $ ücret alıyor. Yani seçimde birim fiyat değil; faturalandırma modeli, eşzamanlılık ve ses erişimi belirleyici. GA sürümüyle birlikte önemli sorunlar da azaldı: genel kullanıma sunulma duyurusuna göre 27 kategori ve 8 dilden oluşan testte yapılandırılmış metin hataları %15,3'ten %4,9'a indi. Yine de entegrasyonu iki kesin sınıra göre planlayın: istek başına 5.000 karakter ve üreticisinin bile gerçek zamanlı kullanım için uygun görmediği bir model.

ElevenLabs Eleven v3 API neler sunuyor?

Eleven v3 API dört ayrı kullanım alanı sağlıyor: konuşma oluşturma, konuşmayı akış olarak aktarma ve çok konuşmacılı ses için ayrı konuşma oluşturma ve konuşma akışı endpoint'leri. Model 70'in üzerinde dili destekliyor, duygu ve konuşma biçimini metin içine yerleştirilen ses etiketleriyle yönlendirebiliyor. GA aşamasında yapılan testlerde de alfa sürümüne kıyasla %72 oranında daha sık tercih edildi.

Kategori bazında Eleven v3 yapılandırılmış metin hata oranları: alfa ve GA karşılaştırması

Yapılandırılmış metinleri v3'e emanet etmeden önce bu testteki kategori ayrıntılarına bakmakta fayda var. Kimyasal formüllerde hata oranı %45,6'dan %0,6'ya, telefon numaralarında %16,9'dan %0,6'ya geriledi; ISBN'lerde ise sıfıra indi. Zayıf halka hâlâ %17,5 hata oranıyla coğrafi koordinatlar. Matematik ifadelerinde oran %6,9 seviyesinde; bu, standart anlatım için kabul edilebilir olsa da koordinat ağırlıklı içeriklerde risk yaratabilir.

Aşağıdaki tabloda v3'ün diğer modeller arasındaki konumunu, resmî modeller dokümanına göre görebilirsiniz:

ModelModel kimliğiDillerİstek başına maks. karakterBelirtilen gecikme1.000 karakter fiyatı
Eleven v3eleven_v370+5.000 (~5 dk.)~250–300 ms (katmana göre)0,10 $
Eleven v3 ConversationalText-to-Dialogue WebSocket üzerinden70+yok~280 ms0,10 $
Multilingual v2eleven_multilingual_v22910.000 (~10 dk.)~250–300 ms0,10 $
Flash v2.5eleven_flash_v2_53240.000 (~40 dk.)~75 ms0,05 $

Dokümantasyonda dikkat edilmesi gereken bir tutarsızlık var: fiyatlandırma sayfası “Multilingual v2/v3” modellerini 40.000 karakterlik katman limiti altında birlikte gösteriyor. Buna karşılık modeller referansında Eleven v3 için istek başına sınır 5.000 karakter olarak belirtilmiş. v3 için gerçek sınır olarak 5.000'i esas alın; bu model özelindeki değer. 40 bin karakter varsayımıyla çalışan uzun içerik iş akışları hata verecektir.

Fiyatlandırma: resmî ElevenLabs mı, fal.ai mı?

Birim fiyat iki platformda da 1.000 karakter başına 0,10 $. Ailenin daha ucuz seçeneği yalnızca 1.000 karakter başına 0,05 $ fiyatlanan Flash v2.5. Asıl fark faturalandırma ve paralel istek kapasitesinde ortaya çıkıyor:

Resmî ElevenLabsfal.ai
Birim fiyat (Eleven v3)1.000 karakter başına 0,10 $1.000 karakter başına 0,10 $
FaturalandırmaDahil kredili abonelik planları veya kullandıkça ödeTamamen kullanım bazlı; “koltuk lisansı yok, abonelik yok, minimum kullanım yok”
Ücretsiz katmanAylık 10 bin Multilingual karakter (Flash için 20 bin)Model sayfasında belirtilmemiş
Örnek planCreator: aylık 22 $ (ilk ay 11 $), 220 bin Multilingual karakteryok
En üst planBusiness: aylık 990 $, 9,9 milyon Multilingual karakteryok
EşzamanlılıkPlana göre: Free'de aynı anda 2 Multilingual isteği, Scale/Business'ta 15–30, Enterprise'ta özel limitSunucusuz kuyruk; model sayfasında hesap başına bir üst sınır belgelenmiyor
Kuyruk etkisiLimiti aşarsanız istekler kuyruğa giriyor ve “genellikle” yaklaşık 50 ms ekleniyorToplu işler için webhook destekli kuyruk API'si
Kontroller (belgelenmiş şema ve kullanıcı raporları)ID ile ses; stability (kullanıcılar v3'te 3 konum bildiriyor)Voice, stability, similarity_boost, speed, language_code, apply_text_normalization, seed, timestamps, output_format
Startup programı12 ay ücretsiz, 33 milyon karakter, daha yüksek eşzamanlılıkyok
1.000 karakter başına TTS API fiyatı: Flash, Multilingual v2, resmî Eleven v3 ve fal.ai üzerindeki Eleven v3 ElevenLabs API fiyatlandırma sayfasındaki TTS bölümü

Resmî tarafta eşzamanlılık plan katmanlarıyla belirleniyor. Free anahtarıyla paralel v3 çağrıları yaptığınızda aynı anda yalnızca 2 istek çalışabiliyor; bu da toplu işleri ciddi biçimde yavaşlatıyor. fal ise tüm işleri sunucusuz bir kuyruktan geçiriyor ve webhook geri çağrıları sunuyor. Her iki platformun fiyatlandırma dokümanında da boşlukların veya köşeli parantez içindeki ses etiketlerinin ücretlendirilen karakter sayısına dahil edilip edilmediği belirtilmiyor. Bütçeyi dahil ediliyormuş gibi hesaplamak en güvenli yaklaşım.

v3'ü yalnızca ara sıra kullanacaksanız ve diğer modellerinizi zaten fal üzerinden çalıştırıyorsanız, platform seçimini fal.ai incelememizde ayrıntılı olarak ele aldık.

Ses etiketleri: duyguyu metnin içinden yönetmek

Ses etiketleri, metnin içine yerleştirilen köşeli parantezli yönlendirmelerdir. Model bunları seslendirmez; performans talimatı olarak yorumlar. fal model sayfasındaki basit bir örnek şöyle:

[slowly] Back then... [chuckles] we had no phones.
[whispers] Just dirt roads and [coughs] big dreams.
[sad] Then it happened.
Kategoriİşe yarayan örnekler
Duygular[happy], [sad], [excited], [angry], [sarcastically], [nervous], [happily]
Seslendirme biçimi[whispers], [shouting], [shouts], [slowly], [quickly], [softly]
Sözsüz sesler[laughs], [chuckles], [sighs], [gasps], [coughs], [gulps], [clears throat], [applause]
Aksanlar[british accent], [southern accent], [strong canadian accent]

Resmî yönlendirme dokümanına göre etiket davranışını belirleyen üç temel kural var. Birincisi, resmî ve eksiksiz bir etiket listesi yok; etiketler doğal dilde verilen yönlendirmeler ve ElevenLabs, yayımlanan örneklerin dışında daha etkili seçenekler bulunabileceğini söylüyor. Bu nedenle ezberden çok test yapmak gerekiyor. İkincisi, SSML duraklama etiketleri desteklenmiyor; tempo noktalama işaretleri, üç noktalar ve satır sonlarıyla ayarlanıyor. Üçüncüsü, sonuç ses ve bağlama göre değişiyor. Sorunlar da tam burada başlıyor:

“V3 harika, kesinlikle en insansı ses” “Bana hâlâ beta sürümü gibi geliyor” — Her iki cümle de aynı gönderiden, u/ConcertNeat8147, r/ElevenLabs v3 saha raporu

Aynı başlıkta, yirmi yıllık deneyime sahip yazılım mühendisi u/poundingCode, duygusal etiketler eklendiğinde konuşmacının aksanının bazen tamamen değişebildiğini aktarıyor. ElevenLabs çalışan hesabından gelen yanıtta ise “bunların hepsi şu anda üzerinde çalıştığımız konular” deniyor.

Aynı başlıktaki içerik üreticilerinin paylaştığı geçici çözümler şöyle (topluluk deneyimi, resmî öneri değil):

  1. Isınma cümlesi. Tonu ve perdeyi belirleyen, sonradan atılacak kısa bir cümleyi metnin başına ekleyin; sesler çoğu zaman üretimin birkaç saniyesinden sonra oturuyor.
  2. Sona end. ekleyin. Metnin sonuna bir satır sonu ve “end.” kelimesi koyarak son kelimelerin kesilmesini önleyin, ardından bu bölümü sesten kırpın.
  3. Cümleleri üç noktayla bitirin. Kullanıcı örneklerine göre cümleleri “...” ile kapatmak, kelime sonlarında yaşanan kesilmeleri azaltabiliyor.
  4. Stability değerini yükseltin. v3'teki stability kontrolünün üç konumu bulunuyor; en yüksek seviye, üretimin başındaki ses kaymasını azaltıyor.

Entegrasyonu belirleyen limitler

  • En kritik sınır 5.000 karakter. Bir istek yaklaşık 5 dakikalık ses üretebiliyor. Bu nedenle sesli kitap ve uzun içerik iş akışlarında metni parçalara ayırmanız gerekir: cümle veya paragraf sınırlarından bölün, cümlenin ortasından kesmeyin ve etiketleri yönlendirdikleri parçanın içinde tutun. Daha az sayıda ama daha büyük istek istiyorsanız Multilingual v2, 10.000 karaktere izin veriyor.
  • Resmî API'de eşzamanlılık plan özelliği. Modeller referansına göre Free anahtarları aynı anda 2 Multilingual katmanı isteğini (Flash için 4), Scale ve Business planları 15–30 isteği destekliyor. Enterprise'ta özel limitler görüşülüyor. Sınır aşıldığında kuyruğa giren istekler “genellikle” yaklaşık 50 ms ek gecikme yaşıyor. Aynı sayfada ElevenLabs'in kapasite tahmini de yer alıyor: 5 eşzamanlılık limiti, konuşma tabanlı iş yükünde yaklaşık 100 eşzamanlı ses yayınına karşılık geliyor. Tekil istek başına maliyet düşük olsa da toplu işlerde yetersiz kapasite ciddi darboğaz yaratabilir.
  • fal herhangi bir maksimum girdi boyutu belirtmiyor. Eleven v3 sayfasında endpoint, parametreler ve formatlar açıklanıyor; ancak girdi sınırı, kuyrukta saklama süresi veya yeniden deneme davranışı hakkında bilgi verilmiyor. Uzun metin göndermenizi engelleyen bir şey yok, fakat bunun garanti edildiği de söylenmiyor.
  • Zaman damgaları platforma göre değişiyor. fal giriş şemasındaki timestamps boolean değeri, altyazı ve dudak senkronu için kullanılabilecek kelime bazında hizalama verisi döndürüyor. Resmî API'de ise v3 diyalog çıktısı zaman damgası içermiyor; geliştiriciler bu eksikliği kamuya açık şekilde gündeme getirdi (r/ElevenLabs: “v3 API, no timestamps?”). Bugün hizalama verisi için belgelenmiş yol fal'ın parametresi.
  • Gerçek zamanlı kullanım hâlâ mümkün değil. ElevenLabs, daha yüksek gecikme ve değişken tutarlılık nedeniyle v3'ü gerçek zamanlı ve konuşmalı kullanım için uygun görmüyor. Önerilen seçenekler, ajanlar için yaklaşık 75 ms gecikmeli Flash v2.5 veya etkililiğin etkileşimli kullanımda da korunması gereken durumlar için WebSocket üzerinden yaklaşık 280 ms gecikmeli Eleven v3 Conversational. Gerçek zamanlı bir v3 varyantı yol haritasında yer alıyor (“gerçek zamanlı bir sürüm üzerinde çalışıyoruz”), ancak GA duyurusu yayımlandığında henüz kullanıma sunulmamıştı.
  • Ticari kullanım. Alfa döneminde geliştiriciler v3 çıktısının ticari amaçlarla kullanılıp kullanılamayacağını açıkça soruyordu. GA duyurusuyla model tüm platformlarda kullanıma açıldı; fal da endpoint'ini doğrudan ticari kullanıma uygun olarak etiketliyor.

İlk isteğiniz: resmî SDK ve fal istemcisi

Resmî yol, hızlı başlangıç dokümanındaki haliyle:

pip install elevenlabs
from elevenlabs import ElevenLabs

client = ElevenLabs(api_key="YOUR_ELEVENLABS_API_KEY")  # or ELEVENLABS_API_KEY env var

audio = client.text_to_speech.convert(
    voice_id="JBFqnCBsd6RMkjVDRZzb",  # "George"
    text="[whispers] The first move is what sets everything in motion.",
    model_id="eleven_v3",
    output_format="mp3_44100_128",
)

fal tarafında ise fal-client kullanılıyor ve istek fal.run endpoint'ine gönderiliyor:

pip install fal-client
import fal_client

result = fal_client.subscribe(
    "fal-ai/elevenlabs/tts/eleven-v3",
    arguments={
        "text": "[whispers] The first move is what sets everything in motion.",
        "voice": "Rachel",          # default voice
        "stability": 0.5,           # 0–1, lower = more expressive variation
        "timestamps": True,         # per-word alignment data
    },
)
print(result["audio"]["url"])       # hosted MP3 URL

Her iki platform da API anahtarlarının istemci tarafı koduna gömülmemesi gerektiği konusunda açıkça uyarıyor. İstekleri kendi sunucunuz üzerinden proxy'leyin. Akış kullanımı için resmî API'de stream-speech endpoint'i bulunuyor; fal tarafında ise fal.stream ve toplu işler için webhook destekli kuyruk API'si sunuluyor.

Hangi endpoint'i kullanmalısınız?

SenaryoKullanılacak seçenek
Kendi klonladığınız seslere (PVC/IVC) veya ID ile tanımlanan tasarım seslerine ihtiyacınız varResmî API: özel sesler çalışma alanınızdaki ID ile çağrılıyor; fal sayfasında yalnızca hazır ses adları belgelenmiş
Dahil kredileri olan bir ElevenLabs planına zaten ödeme yapıyorsunuzResmî API: dahil karakterler zaten ödediğiniz krediler, fal üzerinden yapılan her çağrı ise ek harcama
Toplu sesli kitap/dublaj işleri, abonelik istemiyorsunuz ve tamamlanma webhook'u gerekiyorfal: kullandıkça öde modeli ve webhook akışı tam olarak bu senaryoya yönelik
Görsel, video ve TTS modellerini tek bir yapıda tek API anahtarıyla kullanmak istiyorsunuzfal: v3, fal'daki diğer modellerinizle aynı istemci üzerinden çalışıyor
Ses ajanları veya gecikmeye duyarlı herhangi bir kullanımİki v3 TTS endpoint'i de değil: Flash v2.5 (~75 ms) ya da Eleven v3 Conversational (~280 ms) kullanın
Kurumsal ihtiyaçlar (SOC 2, HIPAA BAA, özel hız limitleri, IP izin listesi)Resmî API: fiyatlandırma sayfasında Enterprise planının özellikleri belgelenmiş; fal'ın model sayfası endpoint'inin hangi sertifikaları kapsadığını belirtmiyor
Fiyatlandırma ve playground içeren fal.ai Eleven v3 model sayfası

Sık sorulan sorular

Eleven v3 model kimliği nedir?

eleven_v3. Standart metinden konuşmaya endpoint'lerinde model_id parametresi olarak gönderilir. Çok konuşmacılı diyalog ise model parametresi yerine ayrı Text-to-Dialogue endpoint'lerini kullanır.

Eleven v3 API akış aktarımını destekliyor mu?

Evet. Resmî API, ses üretildikçe aktaran bir stream-speech endpoint'i sunuyor; fal da aynı model için fal.stream desteği sağlıyor. Ancak akış aktarımı v3'ü gerçek zamanlı kullanım için uygun hâle getirmiyor. Resmî yönlendirme hâlâ konuşmalı kullanımda Flash v2.5 veya Eleven v3 Conversational tercih edilmesi yönünde.

Eleven v3 için karakter limiti nedir?

Resmî modeller referansına göre istek başına 5.000 karakter, yani yaklaşık 5 dakikalık ses. Fiyatlandırma sayfasındaki 40.000 karakter değeri doğrudan v3'e değil, Multilingual katman grubuna uygulanıyor.

Eleven v3 API ne kadar tutuyor?

Her iki platformda da 1.000 karakter başına 0,10 $: 10.000 karakterlik bir hikâye 1,00 $, 1 milyon karakterlik bir sesli kitap 100 $. Plan kredileri resmî API maliyetini düşürebilir; örneğin Creator planı aylık 22 $ karşılığında 220 bin Multilingual karakter içeriyor. fal'da abonelik bulunmuyor.

Eleven v3 ile klonlanmış sesleri kullanabilir miyim?

Resmî API'de evet: profesyonel, klonlanmış ve tasarlanmış sesler voice ID üzerinden çağrılabiliyor. Ancak pratikte uyumluluk değişiyor. r/ElevenLabs kullanıcıları, mevcut Professional Voice Clone seslerinin v3'te bazen farklı konuşmacılar gibi duyulduğunu bildiriyor. Üreticileri V3 uyumluluğunu belirten PVC'ler ise genellikle daha iyi sonuç veriyor. fal'ın şeması bir ses adı veya ID kabul ediyor, ancak yalnızca hazır sesleri belgeliyor; özel ElevenLabs ses ID'leri burada belgelenmemiş bir alan.

Eleven v3 gerçek zamanlı ses ajanları için iyi mi?

Hayır. ElevenLabs, yüksek gecikme ve değişken tutarlılık nedeniyle gerçek zamanlı ve konuşmalı kullanımı v3 için açıkça uygun görmüyor. Ajanlar için Flash v2.5 (~75 ms, 32 dil) veya Eleven v3 Conversational (~280 ms, 70+ dil, ses etiketi kontrolü) kullanın.

Eleven v3 API üzerinden neden web sitesindekinden farklı ses alıyorum?

Ses önizlemeleri, kendi metninizle elde edeceğiniz sonucu temsil etmiyor. Bu durum r/ElevenLabs saha raporlarında sıkça dile getirilen bir şikâyet. Ayrıca v3 çıktısı üretimler arasında gözle görülür biçimde değişebiliyor. Bir sese karar vermeden önce her adayı gerçek bir metin parçasıyla ve üretimde kullanacağınız stability ayarıyla test edin.

İlgili içerikler: Qwen Audio 3 TTS API rehberi · Replicate fiyatlandırması ve alternatifleri · fal.ai incelemesi 2026