ByteDance'in 5 Ağustos 2026'da duyurduğu SeedRealtime, gerçek zamanlı sesli asistanlardan daha fazlasını hedefliyor. Ses, video ve metni uçtan uca tek bir modelde buluşturan görsel-işitsel full-duplex LLM'in asıl iddiası, konuşma sırasını belirlemek için harici bir modüle ihtiyaç duymaması. Geliştiriciler için önemli sınırlama ise şu: lansman itibarıyla ne herkese açık bir API ne de fiyatlandırma var; model ByteDance'in kendi ürünlerinde sunuluyor.
SeedRealtime tam olarak ne yapıyor?
ByteDance'in Seed ekibi tarafından geliştirilen model, ses, video ve metni tek bir mimaride bir araya getiriyor. Veriyi ayrı aşamalar arasında taşıyan yapılardan farklı olarak, kesintisiz çok modlu akışlar üzerinden algılama, anlama, karar verme ve yanıt üretme işlerini birlikte yürütüyor.
ByteDance bunu “aynı anda izle, dinle ve konuş” yaklaşımıyla anlatıyor: Modelin duyduğu ve gördüğü şeyler, gerçek zamanlı her yanıtı birlikte şekillendiriyor. SeedRealtime, Seed model ailesinde Doubao'ya güç veren LLM ailesi Seed2.1'in yanı sıra Seedance (video üretimi), Seedream (görüntü üretimi), Seed Audio 1.0 (ses üretimi) ve Seed GR-RL (robotik) ile yer alıyor.
Modeli klasik kategorilere yerleştirmek kolay değil. Konuşma üretse de yalnızca bir TTS modeli değil; görüntüyü algılasa da yalnızca bir vision modeli değil. Ayrıca sıradan bir gerçek zamanlı ses botundan da daha geniş bir kullanım alanı tarif ediyor.
Asıl fark: Full-duplex çalışma
“Full-duplex”, modelin aynı anda hem dinleyip hem yanıt verebilmesi anlamına geliyor. Gerçek bir sohbet gibi, kimin konuştuğunu ve ne zaman araya girmesi gerektiğini sürekli takip ediyor. SeedRealtime'in iddiası, ses, görüntü, zamanlama ve ifadeyi birbirine eklenmiş modüller yerine tek bir uçtan uca model içinde birleştirerek bunu başarması.
Gerçek zamanlı yapay zekâ etkileşiminde bugüne dek iki yaklaşım öne çıktı. Zincirleme sistemler, ASR'yi (konuşmadan metne), bir LLM veya VLM'i ve TTS'yi (metinden konuşmaya) sırayla bağlar. Modüler olmaları ve hata ayıklamalarının kolaylığı avantajdır; ancak her aktarım gecikme yaratır ve bilgi kaybına yol açar. Tonlama, konuşmaların üst üste binmesi, aksan ve görsel bağlam da çoğu zaman ASR aşamasında kaybolur. Uçtan uca ses modelleri bu aktarımları ortadan kaldırarak daha doğal bir deneyim sunar. Buna rağmen çoğu, konuşma sırasını belirlemek için hâlâ harici bir ses etkinliği algılayıcısına (VAD) yaslanır. Bu da pratikte onları yarı çift yönlü yapıda tutar: bir soru, bir yanıt.
SeedRealtime ise algılama, anlama, karar verme ve ifade üretimini tek modelde topluyor; bunları sürekli görsel-işitsel akış üzerinde paralel biçimde çalıştırıyor. Konuşma sırasını belirleyen harici bir VAD bulunmuyor.
| Yaklaşım | Nasıl çalışır? | Duplex | Konuşma sırası yönetimi | Temel zayıflık |
|---|---|---|---|---|
| Zincirleme (ASR + LLM/VLM + TTS) | Modüller sırayla birbirine bağlanır | Yarı | Sabit bitiş noktası algılama | Her aktarımda gecikme ve bilgi kaybı |
| Uçtan uca + harici VAD | Tek model, harici konuşma sırası algılayıcısı | Yarı | Harici VAD | Hâlâ soru-yanıt düzenine bağlı |
| SeedRealtime | Birleşik görsel-işitsel uçtan uca model | Tam (iddia edilen) | Dahili, çok modlu | En yeni yaklaşım; yetenekler üreticinin açıklamalarına dayanıyor |
Zorluk, videonun konuşmadaki gibi doğal duraklara sahip olmaması. Modelin arka plan gürültüsüne tepki vermeden sürekli olarak hangi nesneye odaklanacağını, hangi sesin önemli olduğunu ve konuşmak için doğru anın gelip gelmediğini belirlemesi gerekiyor.
ByteDance'in öne çıkardığı üç yetenek
ByteDance, SeedRealtime'in davranışlarını üç başlıkta topluyor: ortak görsel-işitsel anlama, proaktif etkileşim ve doğal konuşma zamanlaması. Şirket, benchmark tabloları yerine bunları somut senaryolarla gösteriyor.
Görüntü ve sesi birlikte anlama
Model, belirsiz ifadeleri çözmek için canlı sahnedeki ipuçlarından yararlanıyor. Bir kullanıcı “bunu nasıl yaparım?” dediğinde, ekrandaki içerik, el hareketleri, bakış yönü ve önceki eylemler birlikte değerlendirilerek “bunun” ne olduğu belirleniyor.
ByteDance'in demosunda kullanıcı, akşam yemeğinde dört arkadaşını tek tek tanıtıyor. SeedRealtime isimleri yüzlerle eşleştiriyor, ardından grup tatil planı yaparken her sesi doğru kişiyle ilişkilendirmeyi sürdürüyor: biri plaj istiyor, biri sıcaktan hoşlanmıyor, birinin deniz ürünlerine alerjisi var. Bir Sichuan restoranında ise kameradaki yalnızca Çince menüyü okuyup İngilizce yemek önerileri sunuyor ve “fish-fragrant pork” yemeğinin neden balık içermediğini açıklıyor.
İstenmeden de devreye girebilme
Model, soru gelmesini beklemek yerine sahne değiştiğinde kendi inisiyatifiyle konuşabiliyor. Bir müze gezisinde kullanıcı “Bronz kaplanın geyiği yediği kaideyi gördüğünde beni uyar” diyor; SeedRealtime kamera akışını izliyor, eser göründüğünde hatırlatmayı yapıyor ve parça hakkında ek bağlam sunuyor.
Başka bir örnekte, bir kişinin tam kahve çekirdeklerini doğrudan portafiltreye koyduğunu görünce araya giriyor: önce çekirdeklerin ince toz hâline getirilmesi gerektiğini söylüyor. Ekstraksiyon sonrasında ise crema'nın rengine bakarak bir sonraki shot'ın iki ila üç saniye daha kısa tutulmasını öneriyor. Arama veya rezervasyon gibi araç çağrıları da ayrı bir adım olarak değil, bu yanıtların içine işleniyor.
Daha doğal konuşma ritmi
SeedRealtime, ne zaman konuşacağını, duraklayacağını veya sessiz kalacağını çok modlu bağlama göre belirliyor; yanlış tetiklenmelere karşı da dayanıklı olmayı hedefliyor. Kalabalık bir Pekin havalimanında, bir arkadaşın “Yaşlı Li'nin uçuşu” hakkındaki gelişigüzel sözünü dikkate almıyor. Ancak sorulduğunda, ekrandan çoktan kaybolmuş kalkış panosu bilgisini hatırlıyor; bagaj bandının konumu içinse çevrimiçi arama yapıyor. Ev ortamında, ebeveynin arka plandaki telefon görüşmesine aldırmadan çocuğun İngilizce telaffuzunu düzeltmeye odaklanıyor.
ByteDance'in uçtan uca insan değerlendirmesine göre SeedRealtime, zincirleme modellere kıyasla görsel-işitsel konuşma ritmi sorunlarını yaklaşık yarıya indiriyor. Buna cümle ortasında kesilme, duraklamalardan sonra yavaş yanıt verme ve gürültünün yol açtığı yanlış tetiklenmeler ile tek turdaki konuşmaların akıcı ve eksiksiz tamamlanma oranı da dahil. Bunlar bağımsız benchmark sonuçları değil, üreticinin kendi yürüttüğü değerlendirmeler.
SeedRealtime, GPT-4o Realtime ve Gemini Live karşısında nerede duruyor?
Pratikte asıl soru, SeedRealtime'in geliştiricilerin bugün kullanabildiği gerçek zamanlı sistemlerden nasıl ayrıldığı. Dürüst yanıt şu: Mevcut “realtime” API'lerin çoğu sese odaklanıyor; SeedRealtime'in ayırt edici iddiası ise ses ve videoyu full-duplex biçimde birlikte modellemesi.
OpenAI'nin Realtime API'si ile Google'ın tüketici ürünü Gemini Live ve geliştiricilere yönelik Live API'si, düşük gecikmeli gerçek zamanlı sohbet arayüzleri sunuyor. Ancak bunların merkezinde ses var: konuşma girişi ve konuşma çıkışı. Görüntü ayrı ele alınıyor; konuşma sırası yönetimi de hâlâ endpointing veya VAD'e bağlı. SeedRealtime'in konumlandırması ise yerel görsel-işitsel füzyon, modelin kendi içinde karar verdiği full-duplex zamanlama, proaktif yanıtlar ve sohbet akışına gömülü araç kullanımının birleşimine dayanıyor.
| Model | Yerel modaliteler | Duplex | Konuşma sırası yönetimi | Proaktif davranış / araç kullanımı | Herkese açık API |
|---|---|---|---|---|---|
| SeedRealtime | Ses + video + metin (birleşik) | Tam (iddia edilen) | Dahili, çok modlu | Evet, sohbet akışına gömülü | Hayır (lansmanda) |
| GPT-4o Realtime API | Ses + metin | Gerçek zamanlı, VAD yönetimli | Harici endpointing | Function tools aracılığıyla | Evet |
| Gemini Live / Live API | Ses + metin (tüketici uygulamasında kamera) | Gerçek zamanlı, VAD yönetimli | Harici endpointing | Sınırlı | Evet (Live API, ses) |
| Zincirleme yapı | Metin (ASR/TTS üzerinden ses) | Yarı | Sabit | Özel geliştirme | Kendin oluştur |
SeedRealtime'in avantajlarına ilişkin bilgiler ByteDance'in kendi demoları ve değerlendirmelerinden geliyor. GPT-4o Realtime veya Gemini Live ile yayımlanmış doğrudan bir karşılaştırma bulunmuyor. Bu nedenle yukarıdaki tabloyu ölçülmüş üstünlük olarak değil, mimari konumlandırma olarak okumak gerekiyor.
Geliştiriciler SeedRealtime'i bugün kullanabilir mi?
5 Ağustos 2026'daki lansman itibarıyla SeedRealtime, geliştiricilere açık bir API olarak sunulmuyor. ByteDance modelin “tam olarak kullanıma açıldığını” söylüyor, ancak bu ifade herkesin çağırabileceği açık bir endpoint'i değil, şirketin kendi ürünlerindeki dağıtımı anlatıyor.
Lansmanda SeedRealtime için herkese açık API, fiyatlandırma sayfası veya geliştirici dokümantasyonu yok. ByteDance'in ticari API kolu, Doubao model ailesini barındıran Volcengine (火山引擎). Burada Seed 2.1 Pro ve Turbo LLM'ler, Seed-ASR, Seed-TTS ve başka modeller yer alıyor. Ancak SeedRealtime lansman sırasında listede bulunmuyor; üçüncü taraf aktarıcılar da gerçek zamanlı görsel-işitsel bir alternatif sunmuyor.
Bugün gerçek zamanlı bir endpoint'e ihtiyaç duyan ekipler için kısa vadede gerçekçi seçenekler hâlâ ses odaklı: OpenAI Realtime API, Google Live API veya kurum içinde kurulan zincirleme bir yapı. SeedRealtime ise izlenmesi gereken mimari olarak öne çıkıyor. ByteDance, Volcengine ya da BytePlus üzerinden gelecek gerçek zamanlı API için bir tarih açıklamadı.
Sık sorulan sorular
SeedRealtime herkese açık mı?
5 Ağustos 2026'daki lansman itibarıyla ByteDance'in kendi ürünlerinde kullanıma alınmış durumda. Ancak kayıt olup kullanabileceğiniz, SeedRealtime adlı herkese açık bir uygulama veya endpoint yok.
SeedRealtime'in API'si var mı?
Lansman itibarıyla yok. ByteDance API erişimi, fiyatlandırma veya geliştirici dokümanları yayımlamadı. Muhtemel adres Volcengine'in Doubao API ailesi olsa da SeedRealtime henüz burada listelenmiyor.
SeedRealtime, GPT-4o Realtime'den nasıl ayrılıyor?
GPT-4o Realtime API ses odaklı çalışıyor: konuşma girişi, konuşma çıkışı. SeedRealtime ise ses ve videoyu tek bir full-duplex modelde birlikte işlediğini; zamanlamaya kendi karar verdiğini ve proaktif davranabildiğini iddia ediyor. Henüz bağımsız bir doğrudan karşılaştırma yok.
SeedRealtime ücretsiz mi?
Lansmanda bağımsız, fiyatlandırılmış bir ürün veya API bulunmadığından “ücretsiz ya da ücretli” ayrımı henüz geçerli değil. Bu, ByteDance ürünlerinin içindeki bir yetenek olarak sunuluyor.
Bir yapay zekâ modeli için “full-duplex” ne demek?
Modelin aynı anda dinleyip yanıt verebilmesi ve konuşmanın durumunu sürekli takip etmesi demek. Böylece katı soru-yanıt turlarına sıkışmadan, ne zaman konuşacağına veya duraklayacağına kendisi karar verebiliyor.
İlgili okumalar
- OpenAI Realtime API fiyatlandırması — geliştiricilerin bugün gerçekten çağırabildiği gerçek zamanlı ses endpoint'i
- Qwen Audio 3 Realtime — karşılaştırma için başka bir gerçek zamanlı konuşma modeli