Bir kaydı kullanılabilir metne dönüştürmeniz ya da mikrofondan canlı altyazı üretmeniz gerekiyorsa Gemini 3.5 Transcribe değerlendirilmeye değer. Özellikle metin temizleme, özel kelime listeleri ve çok dilli kullanım tarafında güçlü bir seçenek sunuyor. Ancak API'nin iki farklı kullanım yolu birbirinden oldukça farklı sınırlara sahip: Dosya API'si kalıcı transkriptler için, Live API ise kısa ve düşük gecikmeli oturumlar için daha uygun.
Pratik cevap: Canlı altyazıya ihtiyacınız yoksa dosya API'sini seçin
Gemini 3.5 Transcribe, Google'ın konuşmayı metne dönüştürmeye odaklanan model ailesi. 26 Ağustos 2026 itibarıyla herkese açık önizleme sürümünde bulunan hizmet için Google; kayıtlı ve gerçek zamanlı ses akışlarına ayrı model kimlikleri, iletişim yöntemleri, çıktı olayları ve kullanım kısıtları tanımlıyor.
| İhtiyaç | Model kimliği | API yolu | Önemli kısıt |
|---|---|---|---|
| Toplantılar, görüşmeler, yüklenen kayıtlar | gemini-3.5-transcribe | Interactions API | Standart tekil isteklerde 1 saate kadar; konuşmacı ayrıştırma veya kelime zaman damgalarıyla 30 dakikaya kadar |
| Canlı altyazılar, mikrofon girdisi, sesli arayüz | gemini-3.5-transcribe-live | Live API | 10 dakikalık kesintisiz oturum; canlı konuşmacı ayrıştırma ve kelime düzeyinde zaman damgası yok |
Toplantı arşivi, çağrı analizi veya altyazı hazırlığı için gemini-3.5-transcribe ile başlayın. Altyazı önizlemesi ya da bas-konuş arayüzü geliştiriyorsanız gemini-3.5-transcribe-live daha doğru seçim. Google'ın kayıtlı ses transkripsiyonu rehberi ile Live API rehberi bu iki akışı ayrı ayrı açıklıyor.
Şimdilik yalnızca önizleme sürümü var
Google, Gemini 3.5 Transcribe'ı 26 Ağustos 2026'da duyurdu. Geliştirici API'si Google AI Studio ve Google Antigravity üzerinden herkese açık önizleme olarak sunuluyor. Kurumsal erişim de Gemini Enterprise Agent Platform üzerinden önizleme aşamasında. Bu durum; bölgesel kapsamın, kotaların ve kararlılığın genel kullanıma açılmış bir ses hizmetinden farklı olabileceği anlamına geliyor. Bu nedenle yüksek hacimli ve kritik iş yüklerine geçmeden önce kendi ses kayıtlarınızla test yapın.
Gemini 3.5 Transcribe fiyatlarını pratik birimlerle hesaplamak
Google'ın Gemini API fiyatlandırma sayfası, sabit bir transkripsiyon ücreti yerine token tabanlı fiyatları listeliyor. Güncel fiyatlandırma görünümünde gemini-3.5-transcribe için 1 milyon ses girdisi token'ı başına 2 dolar ve 1 milyon metin çıktısı token'ı başına 12 dolar ücret belirtiliyor.
Google'ın ses belgelerine göre ses, saniyede 32 token veya dakikada 1.920 ses token'ı olarak temsil ediliyor. Buna göre, yalnızca ses girdisi tarafı 1 milyon token başına 2 dolar hesabıyla, metin çıktısı ve diğer ücretlendirilebilir token'lar hariç yaklaşık dakikada 0,00384 dolar tutuyor.
| Model | Yayınlanan fiyatlandırma temeli | Yaklaşık karma tahmin | Yaklaşık 1 saatlik tahmin |
|---|---|---|---|
gemini-3.5-transcribe | 1 milyon ses girdisi token'ı başına 2 dolar + 1 milyon metin çıktısı token'ı başına 12 dolar | Dakikada yaklaşık 0,005 dolar | Saatte yaklaşık 0,30 dolar |
gemini-3.5-transcribe-live | Token tabanlı canlı ses ve metin işleme | Dakikada yaklaşık 0,009 dolar | Saatte yaklaşık 0,54 dolar |
Karma maliyet, üretilen transkriptin hacmine bağlı olduğu için bunlar kesin dakika tarifeleri değil, planlama amaçlı tahminler. Yoğun çıktı, tekrarlanan bağlam ve ek talimatlar faturayı değiştirebilir. Önizleme fiyatları değişebileceğinden yüksek hacimli kullanıma geçmeden önce güncel fiyat tablosunu kontrol edin.
Üretimde asıl fark yaratan özellik tercihleri
Kelimesi kelimesine transkripsiyon mu, akıllı temizlik mi?
VERBATIM, Google'ın transkripsiyon belgelerinde varsayılan mod olarak geçiyor. Dolgu kelimelerini, tekrarları, duraksamaları, yarım kalan cümleleri ve konuşmacının yaptığı düzeltmeleri koruyor. Transkriptin kayıt, kanıt, altyazı kaynağı ya da kalite kontrol girdisi olarak kullanılacağı durumlarda tercih edilmesi gereken mod bu.
SMART ise okunabilirliği artıran bir dönüşüm modu. Konuşma bozukluklarını ve gereksiz tekrarları temizliyor, kişinin kendi kendini düzelttiği ifadeleri çözümlüyor; tarihleri, para birimlerini, sayıları, listeleri ve paragrafları daha düzenli biçimde biçimlendirebiliyor. Sözlü olarak söylenen “Salı—hayır, Çarşamba” ifadesi temizlenmiş çıktıda “Çarşamba” olarak görünebilir.
Smart modu, konuşmacı ayrıştırma veya kelime düzeyinde zaman damgalarıyla birlikte kullanılamıyor. Hem okunabilir notlara hem de denetlenebilirliğe ihtiyaç duyan uygulamalarda önce verbatim çıktıyı alın, ardından bunun bir kopyasını ayrıca temizleyin.
Özel kelime listeleri ve dil geçişleri
Google, dil geçişleri de dahil olmak üzere 85'ten fazla yerel ayar arasında otomatik dil algılamayı destekliyor. Dil biliniyorsa tanımayı ilgili dile yönlendirmek için en-US veya es-ES gibi bir BCP-47 kodu gönderebilirsiniz.
Özel kelime listesine en fazla 1.000 terim eklenebiliyor; ancak Google'ın pratik önerisi, sonuçların genellikle 100 veya daha az terimle daha iyi olduğu yönünde. Listeyi sıradan kelimelerle doldurmak yerine ayırt edici ürün adları, kısaltmalar, kişi isimleri, tıbbi terimler veya teknik ifadeler kullanın.
Konuşmacı etiketleri ve kelime zaman damgaları
Kayıtlı seslerde konuşmacı bilgisi ve kelime düzeyinde zamanlama alınabiliyor. API belgelerinde en fazla 8 konuşmacı sınırı veriliyor. Google'ın lansman yazısında ise en fazla üç konuşmacı için ilişkilendirme öne çıkarılırken, üç veya daha fazla konuşmacı desteği deneysel olarak işaretleniyor.
Kelime zaman damgaları verbatim modunda etkinleştiriliyor ve her kelime için başlangıç ile bitiş ofsetlerini sağlıyor. Google, zaman damgalarının genel transkripsiyon doğruluğunu azaltabileceği konusunda uyarıyor. Konuşmacı ayrıştırma ve zaman damgaları, standart ses süresi limitini de 1 saatten 30 dakikaya düşürüyor.
| Gereksinim | Destekleniyor mu? | Kısıt |
|---|---|---|
| Kayıtlı seste konuşmacı etiketleri | Evet | Belgelenen sınır 8; 3 veya daha fazla konuşmacının ilişkilendirilmesi deneysel |
| Kayıtlı seste kelime düzeyinde zaman damgaları | Evet | Yalnızca verbatim modunda; doğruluğu azaltabilir |
| Canlı transkripsiyonda konuşmacı etiketleri | Hayır | Konuşmacı bilgisi önemliyse kayıtlı ses kullanın |
| Canlı transkripsiyonda kelime düzeyinde zaman damgaları | Hayır | Canlı çıktı artımlı ve cümle odaklıdır |
| Etiket veya zaman damgasıyla Smart modu | Hayır | Bu ek açıklamalar için verbatim modunu seçin |
Gemini 3.5 Transcribe API ile kayıtlı dosya gönderme
Google'ın kayıtlı ses rehberi süreci üç aşamada anlatıyor: dosyayı yüklemek, dönen dosya URI'sini Interactions API'ye göndermek ve tamamlanan transkripti interaction.output_text alanından okumak.
- Ses dosyasını Files API ile yükleyin. Birkaç saniyeden uzun kayıtlar veya tekrar kullanacağınız dosyalar için bu yöntemi tercih edin.
- Dönen dosya URI'sini ve
audio/mp3gibi MIME türünü saklayın. - URI'yi Interactions API üzerinden
gemini-3.5-transcribemodeline gönderin. - Metin çıktısını okuyun. İstendiğinde konuşmacı ve zamanlama bilgileri için
word_infoek açıklamalarını inceleyin.
Resmî SDK akışı, aşağıdaki yükle ve transkripsiyon örneği kadar basit hale getirilebilir:
from google import genai
client = genai.Client()
file = client.files.upload(file="path/to/sample.mp3")
interaction = client.interactions.create(
model="gemini-3.5-transcribe",
input=[{
"role": "user",
"content": [{
"type": "audio",
"uri": file.uri,
"mime_type": file.mime_type,
}],
}],
)
print(interaction.output_text)
Files API yüklemesi sonrasında FILE_URI döndüğünde, REST isteği de kısaca şöyle görünüyor:
curl -X POST \
"https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.5-transcribe",
"input": [{
"role": "user",
"content": [{
"type": "audio",
"uri": "FILE_URI",
"mime_type": "audio/mp3"
}]
}]
}'
Temizlenmiş bir transkript almak için smart modunu içeren bir transkripsiyon yapılandırması ekleyin:
{
"generation_config": {
"transcription_config": {
"mode": { "type": "smart" },
"language_codes": ["en-US"],
"custom_vocabulary": ["Kubernetes", "BigQuery", "Acme Ledger"]
}
}
}
Konuşmacı etiketleri ve kelime zamanlaması için bunun yerine verbatim modunu kullanın:
{
"generation_config": {
"transcription_config": {
"mode": {
"type": "verbatim",
"diarization_mode": "speaker",
"timestamp_granularities": ["word"]
}
}
}
}
Smart yapılandırmasını konuşmacı ayrıştırma veya zaman damgalarıyla birleştirmeyin. API'nin belgelenen mod kuralları, bunun basit bir biçimlendirme tercihi değil, doğrudan tasarım kararı olduğunu gösteriyor.
Canlı transkripsiyon nasıl çalışıyor?
Live API, gemini-3.5-transcribe-live kullanarak çift yönlü bir akış bağlantısı açıyor. İstemci sürekli ses gönderirken iki tür metin olayı alıyor:
interim_input_transcription: Altyazı veya arayüz önizlemesi için kullanılan, düşük gecikmeli ve değişebilen geçici tahmin.input_transcription: Transkripte ya da uygulama durumuna kaydedilecek kesinleşmiş metin.
Google'ın canlı kullanım rehberi; ham 16 bit PCM, 16 kHz, mono ve little-endian ses biçimini belirtiyor. Yaklaşık 100 milisaniyelik parçalar, her parçada yaklaşık 1.024–2.048 frame olacak şekilde öneriliyor. Tarayıcı ve mobil istemcilerde normal API anahtarını açığa çıkarmak yerine kısıtlı ephemeral token'lar kullanılmalı. Google'ın örneklerinde 30 dakika geçerli, tek kullanımlık bir token tercih ediliyor.
Canlı uç nokta otomatik dil algılamayı, BCP-47 ipuçlarını, özel kelime listesini ve VERBATIM ya da SMART çıktılarını destekliyor. Canlı konuşmacı ayrıştırma veya kelime düzeyinde zaman damgası sunmuyor. Kesintisiz bir oturumun süresi 10 dakika ile sınırlı. Daha uzun akışlarda oturumları uygulama seviyesinde yönetmek ve transkript parçalarını birleştirmek gerekiyor.
Konuşma sırasındaki dönüş sınırlarını belirlemek için Live API üç yaklaşım sunuyor:
- Otomatik VAD: Konuşmanın başlayıp bittiğini sunucu algılar.
- Hibrit VAD: Konuşmanın bittiğini istemci tarafındaki algılayıcı bildirir; sunucu algılaması yedek mekanizma olarak çalışır.
- Manuel VAD: Bas-konuş arayüzü, aktivitenin başlangıç ve bitiş olaylarını açıkça gönderir.
İlk veriler neyi gösteriyor, neyi göstermiyor?
Google, Artificial Analysis üzerinden akışlı kullanım için ortalama %4,0 WER, akışsız kullanım içinse %2,6 WER değerleri bildiriyor. Lansman yazısında ayrıca FLEURS sonuçları olarak %5,50 akışlı WER ve %5,04 akışsız WER ile Chirp 3'e kıyasla nihai transkripsiyona ulaşma süresinde %70 iyileşme veriliyor.
Ancak bunlar bağımsız bir Gemini 3.5 Transcribe karşılaştırmalı testinin sonucu değil; Google'ın bildirdiği veya referans verdiği lansman verileri. Herkese açık koedesk STT benchmark çalışmasında Gemini 3.5 Flash ve diğer motorlar ölçüldü, fakat Gemini 3.5 Transcribe doğrudan test edilmedi.
İlk kullanıcılar dosya ve canlı kullanım süre limitlerini, WER referans transkriptlerini ve telefon numaralarıyla sipariş kimliklerinin sessiz bölümlerde ne kadar güvenilir olduğunu sorguluyor. Yalnızca ortalama WER değerine güvenmek yerine, kendi ses kayıtlarınızda isimleri, kimlikleri, sayıları, konuşmacı değişimlerini, zamanlama kaymalarını ve gecikmeyi ayrı ayrı test edin.
Gemini 3.5 Transcribe ne zaman tercih edilmeli, ne zaman beklenmeli?
| Durum | Uygunluk | Mantıklı başlangıç yapılandırması |
|---|---|---|
| Temiz toplantı notları veya dikte | Güçlü | File API, SMART, biliniyorsa açık dil ipucu |
| Hukuki, uyumluluk veya arşiv kaydı | Koşullu | File API, VERBATIM; kritik bölümleri manuel olarak gözden geçirin |
| Birden fazla konuşmacının olduğu kayıtlı görüşmeler | Koşullu | File API, VERBATIM + konuşmacı ayrıştırma; oturumları 30 dakikayla sınırlayın |
| Kelime senkronlu altyazılar | Koşullu | File API, VERBATIM + kelime zaman damgaları; zamanlamayı ve doğruluğu kontrol edin |
| Canlı altyazılar | Kısa oturumlar için güçlü | Live API, yalnızca kesinleşmiş metinleri uygulamaya kaydedin |
| Uzun süre çalışan sesli aracı | Mühendislik çalışması gerektirir | Oturumları 10 dakika sınırından önce bölün ve yeniden bağlantıları yönetin |
| Çevrimdışı veya gizli verilerin yerel işlenmesi | Zayıf uyum | Belgelenen akış sesi Google'ın hizmetine gönderir; self-hosted bir ASR çözümünü değerlendirin |
Gemini 3.5 Transcribe, transkripsiyonun daha büyük bir iş akışının ilk adımı olduğu senaryolarda en iyi sonucu veriyor: konuşmayı temizlemek, teknik kelime dağarcığını korumak, konuşmacıları belirlemek ve yapılandırılmış metni sonraki sisteme aktarmak. Tek beklentiniz ucuz ve kelimesi kelimesine transkripsiyon ya da zorunlu çevrimdışı işlemeyse daha zayıf bir tercih.
Gemini 3.5 Transcribe API hakkında sık sorulanlar
Gemini 3.5 Transcribe ücretsiz mi?
Google, Gemini API kullanımı için ücretsiz bir katman sunuyor; ancak kota ve model erişimi değişebilir. Ücretli kullanım token tabanlı. Fiyatlandırma sayfasında şu an kayıtlı transkripsiyon için dakikada yaklaşık 0,005 dolar, canlı model içinse dakikada yaklaşık 0,009 dolar şeklinde gösterge niteliğinde karma tahminler yer alıyor.
Dosya ve canlı modeller arasındaki fark nedir?
gemini-3.5-transcribe, yüklenen kayıtları Interactions API üzerinden işler ve kayıtlı seslerde konuşmacı ayrıştırma ile kelime zaman damgalarını destekler. gemini-3.5-transcribe-live ise ham PCM sesini Live API üzerinden akışla alır, geçici ve kesinleşmiş olaylar döndürür ve canlı konuşmacı ayrıştırma ya da kelime düzeyinde zaman damgası olmadan 10 dakikalık oturumlarla sınırlıdır.
Üç saatlik bir kaydı tek istekte işleyebilir miyim?
Özel kayıtlı transkripsiyon yapılandırmasıyla hayır. Standart tekil istek sınırı 1 saat. Konuşmacı ayrıştırma veya kelime zaman damgaları kullanıldığında bu sınır 30 dakikaya düşüyor. Daha uzun kayıtlar için uygulama seviyesinde parçalama yapılması ve bağlamla konuşmacı sürekliliğinin dikkatle yönetilmesi gerekiyor.
Gemini 3.5 Transcribe'ı çevrimdışı kullanabilir miyim?
Belgelenen akışta ses Google'ın hizmetine yükleniyor veya akışla gönderiliyor. Google, Gemini 3.5 Transcribe için çevrimdışı ya da self-hosted bir sürüm tanımlamıyor.
En güvenli ilk entegrasyon yaklaşımı
Temiz bir demo kaydıyla değil, gerçek iş yükünüzden alacağınız küçük bir örnekle başlayın. Aynı sesi iki kez çalıştırın: önce doğruluk için verbatim modunda, ardından okunabilirlik için smart modunda. Özel isimleri, sayıları, konuşmacı değişimlerini, zaman damgası kaymalarını ve maliyeti ayrı ayrı ölçün.
Ham transkripti doğruluk kaynağı olarak saklayın, kullanıcıya gösterilecek notlarda smart çıktıyı kullanın ve yükleme hatalarıyla önizleme modelindeki değişiklikler için bir geri dönüş mekanizması ekleyin. İstemci 100 milisaniyelik PCM parçalarını, geçici ve kesinleşmiş olayların ayrımını, ephemeral token'ları ve 10 dakikalık oturum sınırını yönetebildiğinde Live API'ye geçin.