Viele KI-Sprachassistenten reagieren in Echtzeit – doch SeedRealtime soll weitergehen. ByteDance hat das SeedRealtime am 5. August 2026 als natives Audio-Video-LLM mit Full-Duplex vorgestellt. Der entscheidende Punkt ist nicht bloß die Sprachverarbeitung in Echtzeit, sondern ein durchgängiges Modell, das Bild und Ton gemeinsam verarbeitet und selbst entscheidet, wer gerade dran ist. Für Entwickler gibt es allerdings einen Haken: Zum Start fehlen eine öffentliche API und Preise; verfügbar ist das Modell zunächst nur in ByteDances eigenen Produkten.
Was hinter SeedRealtime steckt
Das ByteDance-Team Seed hat ein gemeinsames Modell für Audio, Video und Text entwickelt. Es nimmt fortlaufende multimodale Datenströme wahr, versteht sie, trifft Entscheidungen und antwortet darauf – statt Informationen nacheinander durch getrennte Verarbeitungsschritte zu schleusen.
ByteDance beschreibt den Ansatz mit „sehen, hören und sprechen zugleich“: Was das Modell hört und sieht, fließt gemeinsam in jede Antwort ein. In der Seed-Modellfamilie steht SeedRealtime neben Seed2.1, der LLM-Familie hinter Doubao, sowie Seedance für Videogenerierung, Seedream für Bildgenerierung, Seed Audio 1.0 für Audiogenerierung und Seed GR-RL für Robotik.
Damit passt SeedRealtime in keine der üblichen Schubladen: Es ist kein reines TTS-Modell, denn es erzeugt Sprache und versteht sie zugleich. Es ist auch kein klassisches Vision-Modell, denn das Sehen dient hier der Unterhaltung. Und es soll mehr sein als ein weiterer Voice-Bot mit Echtzeitreaktion.
Full-Duplex ist der Kern des Konzepts
Full-Duplex bedeutet, dass das Modell gleichzeitig zuhören und antworten kann. Es verfolgt fortlaufend, wer spricht und wann ein eigener Beitrag sinnvoll ist – ähnlich wie in einem normalen Gespräch. SeedRealtime will das erreichen, indem Ton, Bild, zeitlicher Kontext und Ausdruck in einem End-to-End-Modell zusammenlaufen, statt einzelne Module aneinanderzureihen.
Bisherige Echtzeit-KI bewegt sich meist zwischen zwei älteren Ansätzen. Kaskadierte Systeme verbinden ASR (Speech-to-Text) mit einem LLM oder VLM und anschließend TTS (Text-to-Speech). Das ist modular und gut nachvollziehbar, kostet aber bei jeder Übergabe Zeit und Informationen. Tonfall, Überlappungen, Akzente und visueller Kontext gehen oft schon beim ASR-Schritt verloren. End-to-End-Sprachmodelle vermeiden diese Übergaben und klingen natürlicher, verlassen sich jedoch meist weiterhin auf eine externe Voice Activity Detection (VAD), die den Sprecherwechsel festlegt. Praktisch bleiben sie damit halbduplex: eine Frage, eine Antwort.
SeedRealtime bündelt Wahrnehmung, Verständnis, Entscheidungsfindung und Ausdruck in einem Modell. Diese Prozesse laufen parallel über fortlaufende Audio-Video-Streams; ein externes VAD-Modul bestimmt die Gesprächszüge nicht.
| Ansatz | Funktionsweise | Duplex | Sprecherwechsel | Größte Schwäche |
|---|---|---|---|---|
| Kaskadiert (ASR + LLM/VLM + TTS) | Module werden nacheinander geschaltet | Halb | Feste Endpunkterkennung | Latenz und Informationsverlust bei jeder Übergabe |
| End-to-End + externes VAD | Ein Modell mit externem Sprecherwechsel-Detektor | Halb | Externes VAD | Weiterhin eine Frage, eine Antwort |
| SeedRealtime | Vereintes Audio-Video-End-to-End-Modell | Voll (laut Anbieter) | Intern, multimodal | Sehr neu; Fähigkeiten stammen aus Herstellerangaben |
Besonders anspruchsvoll ist Video: Anders als Sprache kennt es keine natürlichen Pausen. Das Modell muss permanent entscheiden, welchem Objekt es Aufmerksamkeit schenkt, welche Stimme relevant ist und ob es jetzt sprechen sollte – ohne auf Hintergrundgeräusche hereinzufallen.
Drei zentrale Fähigkeiten
ByteDance ordnet das Verhalten von SeedRealtime drei Bereichen zu: gemeinsames Audio-Video-Verständnis, proaktive Interaktion und natürliches Gesprächs-Timing. Statt Benchmark-Tabellen zeigt das Unternehmen dafür konkrete Szenarien.
Audio und Video im Zusammenhang verstehen
Das Modell löst mehrdeutige Aussagen mithilfe der aktuellen Szene auf. Sagt jemand „Wie mache ich das?“, kombiniert SeedRealtime Bildschirmbild, Gesten, Blickrichtung und vorherige Aktionen, um zu erkennen, was mit „das“ gemeint ist.
In einer ByteDance-Demo stellt ein Nutzer beim Abendessen nacheinander vier Freunde vor. SeedRealtime ordnet Namen den Gesichtern zu und verknüpft anschließend auch die Stimmen mit den jeweiligen Personen, während die Gruppe trotz widersprüchlicher Vorlieben eine Reise plant: Eine Person möchte ans Meer, eine andere hasst Hitze, eine weitere ist allergisch gegen Meeresfrüchte. In einem Sichuan-Restaurant liest das Modell eine ausschließlich chinesische Speisekarte über die Kamera, empfiehlt Gerichte auf Englisch und erklärt, warum „Fish-fragrant pork“ keinen Fisch enthält.
Von sich aus reagieren
Wenn sich die Szene verändert, kann sich das Modell selbst einschalten, statt auf eine Frage zu warten. Bei einem Museumsbesuch sagt ein Nutzer: „Erinnere mich, wenn du den bronzenen Ständer mit Tiger und Hirsch siehst.“ SeedRealtime beobachtet den Kamerastream, bis das Ausstellungsstück auftaucht, und liefert dann die Erinnerung samt Hintergrundinformationen.
Sieht das Modell, wie jemand ganze Kaffeebohnen direkt in einen Siebträger schüttet, greift es ein: Zuerst müssten die Bohnen fein gemahlen werden. Nach der Extraktion empfiehlt es anhand der Farbe der Crema, den nächsten Bezug um zwei bis drei Sekunden zu verkürzen. Tool-Aufrufe wie Suchen oder Buchen sind dabei in die Antworten eingebettet und kein separater Arbeitsschritt.
Natürliches Timing im Gespräch
SeedRealtime entscheidet aus multimodalem Kontext, wann es sprechen, pausieren oder still bleiben sollte, und soll Fehlreaktionen vermeiden. An einem vollen Flughafen in Peking ignoriert es die beiläufige Erwähnung von „Old Li's flight“ durch eine Begleitperson. Auf Nachfrage erinnert es sich jedoch an Informationen der Abflugtafel, die bereits vom Bildschirm verschwunden sind, und sucht anschließend online nach dem Gepäckband. Zu Hause konzentriert es sich auf die Korrektur der englischen Aussprache eines Kindes, obwohl ein Elternteil im Hintergrund telefoniert.
Laut ByteDances End-to-End-Evaluierung mit Menschen halbiert SeedRealtime gegenüber kaskadierten Modellen ungefähr die Probleme beim Audio-Video-Gesprächsrhythmus. Dazu zählen weniger Unterbrechungen mitten im Satz, weniger träge Reaktionen nach Pausen und weniger Fehlauslösungen durch Geräusche. Außerdem werden einzelne Gesprächszüge häufiger flüssig und vollständig abgeschlossen. Dabei handelt es sich um vom Anbieter durchgeführte Tests, nicht um unabhängige Benchmarks.
SeedRealtime im Vergleich mit GPT-4o Realtime, Gemini Live und Kaskaden
Praktisch entscheidend ist die Frage, worin sich SeedRealtime von den Echtzeitsystemen unterscheidet, die Entwickler bereits heute ansprechen können. Die nüchterne Antwort: Die meisten bestehenden „Realtime“-APIs konzentrieren sich auf Audio. SeedRealtime grenzt sich über die gemeinsame Verarbeitung von Audio und Video im Full-Duplex-Betrieb ab.
OpenAIs Realtime API und Googles Verbraucherfunktion Gemini Live mit der zugehörigen Live API für Entwickler bieten latenzarme Echtzeitgespräche. Im Mittelpunkt steht jedoch Audio – Sprache hinein, Sprache heraus. Bildverarbeitung läuft getrennt, während Sprecherwechsel weiterhin von Endpunkterkennung oder VAD abhängen. SeedRealtime positioniert sich anders: native Audio-Video-Fusion, im Modell entschiedenes Full-Duplex-Timing, proaktive Hinweise und in den Gesprächsfluss integrierte Tool-Nutzung.
| Modell | Native Modalitäten | Duplex | Sprecherwechsel | Proaktiv / Tool-Nutzung | Öffentliche API |
|---|---|---|---|---|---|
| SeedRealtime | Audio + Video + Text (fusioniert) | Voll (laut Anbieter) | Intern, multimodal | Ja, integriert | Nein (zum Start) |
| GPT-4o Realtime API | Audio + Text | Echtzeit, VAD-gesteuert | Externe Endpunkterkennung | Über Function Tools | Ja |
| Gemini Live / Live API | Audio + Text (Kamera in der Consumer-App) | Echtzeit, VAD-gesteuert | Externe Endpunkterkennung | Begrenzt | Ja (Live API, Audio) |
| Kaskadierter Stack | Text (Audio über ASR/TTS) | Halb | Fest | Individuell | Selbst bauen |
Die Vorteile von SeedRealtime stützen sich auf ByteDances eigene Demos und Auswertungen. Ein veröffentlichter direkter Vergleich mit GPT-4o Realtime oder Gemini Live fehlt. Die Übersicht oben beschreibt daher die Architektur und keine gemessene Überlegenheit.
Können Entwickler SeedRealtime schon nutzen?
Mit dem Start am 5. August 2026 ist SeedRealtime nicht als Entwickler-API verfügbar. ByteDance spricht zwar von einer „vollständigen Einführung“, meint damit aber die Bereitstellung in eigenen Produkten und keinen offenen Endpunkt, den jeder aufrufen kann.
Zum Start gibt es für SeedRealtime weder eine öffentliche API noch eine Preisseite oder Entwicklerdokumentation. ByteDances kommerzieller API-Zweig ist Volcengine (火山引擎), wo die Doubao-Modellfamilie angeboten wird: die LLMs Seed 2.1 Pro und Turbo, Seed-ASR, Seed-TTS und weitere Modelle. SeedRealtime erscheint dort zum Start nicht in der Liste; auch Drittanbieter-Relays bieten keinen Echtzeit-Ersatz für Audio und Video.
Für Teams, die heute einen Echtzeit-Endpunkt benötigen, bleiben kurzfristig realistischere Optionen daher audiobasiert: OpenAIs Realtime API, Googles Live API oder ein selbst gebauter kaskadierter Stack. SeedRealtime ist vorerst vor allem eine Architektur, die man im Blick behalten sollte. ByteDance hat keinen Termin für eine Echtzeit-API über Volcengine oder BytePlus genannt.
FAQ
Ist SeedRealtime öffentlich verfügbar?
Seit dem Start am 5. August 2026 ist es in ByteDances eigenen Produkten eingebunden. Eine öffentlich zugängliche App oder einen Endpunkt namens SeedRealtime, für den man sich anmelden könnte, gibt es aber nicht.
Gibt es für SeedRealtime eine API?
Zum Start nicht. ByteDance hat weder API-Zugang noch Preise oder Entwicklerdokumentation veröffentlicht. Als möglicher künftiger Ort gilt die Doubao-API-Familie von Volcengine, die SeedRealtime bislang jedoch nicht aufführt.
Wie unterscheidet sich SeedRealtime von GPT-4o Realtime?
Die Realtime API von GPT-4o ist audiozentriert: Sprache hinein, Sprache heraus. SeedRealtime beansprucht dagegen, Audio und Video gemeinsam in einem Full-Duplex-Modell zu verarbeiten, das sein Timing selbst bestimmt und proaktiv handelt. Einen unabhängigen direkten Vergleich gibt es bislang nicht.
Ist SeedRealtime kostenlos?
Zum Start gibt es kein eigenständiges Produkt und keine API mit Preisangabe. Die Frage „kostenlos oder kostenpflichtig“ stellt sich daher noch nicht; es handelt sich um eine Funktion innerhalb von ByteDances Produkten.
Was bedeutet „Full-Duplex“ bei einem KI-Modell?
Das Modell kann gleichzeitig zuhören und antworten sowie den Gesprächszustand kontinuierlich verfolgen. Es entscheidet selbst, wann es sprechen oder pausieren sollte, statt starr zwischen einer Frage und einer Antwort zu wechseln.
Weiterführende Artikel
- OpenAI Realtime API pricing – der Echtzeit-Audio-Endpunkt, den Entwickler heute tatsächlich aufrufen können
- Qwen Audio 3 Realtime – ein weiteres Echtzeit-Sprachmodell zum Vergleich