AIREITER

SeedRealtime: ByteDances Audio-Video-LLM mit Full-Duplex

Zuletzt aktualisiert: 2026-08-05 06:59:13

Viele KI-Sprachassistenten reagieren in Echtzeit – doch SeedRealtime soll weitergehen. ByteDance hat das SeedRealtime am 5. August 2026 als natives Audio-Video-LLM mit Full-Duplex vorgestellt. Der entscheidende Punkt ist nicht bloß die Sprachverarbeitung in Echtzeit, sondern ein durchgängiges Modell, das Bild und Ton gemeinsam verarbeitet und selbst entscheidet, wer gerade dran ist. Für Entwickler gibt es allerdings einen Haken: Zum Start fehlen eine öffentliche API und Preise; verfügbar ist das Modell zunächst nur in ByteDances eigenen Produkten.

Ankündigung von SeedRealtime auf ByteDances Seed-Website mit der Überschrift "An Audio-Visual Full-Duplex LLM" und dem Datum 5. August 2026.

Was hinter SeedRealtime steckt

Das ByteDance-Team Seed hat ein gemeinsames Modell für Audio, Video und Text entwickelt. Es nimmt fortlaufende multimodale Datenströme wahr, versteht sie, trifft Entscheidungen und antwortet darauf – statt Informationen nacheinander durch getrennte Verarbeitungsschritte zu schleusen.

ByteDance beschreibt den Ansatz mit „sehen, hören und sprechen zugleich“: Was das Modell hört und sieht, fließt gemeinsam in jede Antwort ein. In der Seed-Modellfamilie steht SeedRealtime neben Seed2.1, der LLM-Familie hinter Doubao, sowie Seedance für Videogenerierung, Seedream für Bildgenerierung, Seed Audio 1.0 für Audiogenerierung und Seed GR-RL für Robotik.

Die Modellkarte von SeedRealtime auf ByteDances Seed-Modellseite neben Seed2.1, Seedance 2.5, Seedream 5.0 Pro, Seed Audio 1.0 und Seed GR-RL.

Damit passt SeedRealtime in keine der üblichen Schubladen: Es ist kein reines TTS-Modell, denn es erzeugt Sprache und versteht sie zugleich. Es ist auch kein klassisches Vision-Modell, denn das Sehen dient hier der Unterhaltung. Und es soll mehr sein als ein weiterer Voice-Bot mit Echtzeitreaktion.

Full-Duplex ist der Kern des Konzepts

Full-Duplex bedeutet, dass das Modell gleichzeitig zuhören und antworten kann. Es verfolgt fortlaufend, wer spricht und wann ein eigener Beitrag sinnvoll ist – ähnlich wie in einem normalen Gespräch. SeedRealtime will das erreichen, indem Ton, Bild, zeitlicher Kontext und Ausdruck in einem End-to-End-Modell zusammenlaufen, statt einzelne Module aneinanderzureihen.

Bisherige Echtzeit-KI bewegt sich meist zwischen zwei älteren Ansätzen. Kaskadierte Systeme verbinden ASR (Speech-to-Text) mit einem LLM oder VLM und anschließend TTS (Text-to-Speech). Das ist modular und gut nachvollziehbar, kostet aber bei jeder Übergabe Zeit und Informationen. Tonfall, Überlappungen, Akzente und visueller Kontext gehen oft schon beim ASR-Schritt verloren. End-to-End-Sprachmodelle vermeiden diese Übergaben und klingen natürlicher, verlassen sich jedoch meist weiterhin auf eine externe Voice Activity Detection (VAD), die den Sprecherwechsel festlegt. Praktisch bleiben sie damit halbduplex: eine Frage, eine Antwort.

SeedRealtime bündelt Wahrnehmung, Verständnis, Entscheidungsfindung und Ausdruck in einem Modell. Diese Prozesse laufen parallel über fortlaufende Audio-Video-Streams; ein externes VAD-Modul bestimmt die Gesprächszüge nicht.

AnsatzFunktionsweiseDuplexSprecherwechselGrößte Schwäche
Kaskadiert (ASR + LLM/VLM + TTS)Module werden nacheinander geschaltetHalbFeste EndpunkterkennungLatenz und Informationsverlust bei jeder Übergabe
End-to-End + externes VADEin Modell mit externem Sprecherwechsel-DetektorHalbExternes VADWeiterhin eine Frage, eine Antwort
SeedRealtimeVereintes Audio-Video-End-to-End-ModellVoll (laut Anbieter)Intern, multimodalSehr neu; Fähigkeiten stammen aus Herstellerangaben

Besonders anspruchsvoll ist Video: Anders als Sprache kennt es keine natürlichen Pausen. Das Modell muss permanent entscheiden, welchem Objekt es Aufmerksamkeit schenkt, welche Stimme relevant ist und ob es jetzt sprechen sollte – ohne auf Hintergrundgeräusche hereinzufallen.

Drei zentrale Fähigkeiten

ByteDance ordnet das Verhalten von SeedRealtime drei Bereichen zu: gemeinsames Audio-Video-Verständnis, proaktive Interaktion und natürliches Gesprächs-Timing. Statt Benchmark-Tabellen zeigt das Unternehmen dafür konkrete Szenarien.

ByteDances Ankündigungsbeitrag zu SeedRealtime vom 5. August 2026 mit den drei zentralen Durchbrüchen.

Audio und Video im Zusammenhang verstehen

Das Modell löst mehrdeutige Aussagen mithilfe der aktuellen Szene auf. Sagt jemand „Wie mache ich das?“, kombiniert SeedRealtime Bildschirmbild, Gesten, Blickrichtung und vorherige Aktionen, um zu erkennen, was mit „das“ gemeint ist.

In einer ByteDance-Demo stellt ein Nutzer beim Abendessen nacheinander vier Freunde vor. SeedRealtime ordnet Namen den Gesichtern zu und verknüpft anschließend auch die Stimmen mit den jeweiligen Personen, während die Gruppe trotz widersprüchlicher Vorlieben eine Reise plant: Eine Person möchte ans Meer, eine andere hasst Hitze, eine weitere ist allergisch gegen Meeresfrüchte. In einem Sichuan-Restaurant liest das Modell eine ausschließlich chinesische Speisekarte über die Kamera, empfiehlt Gerichte auf Englisch und erklärt, warum „Fish-fragrant pork“ keinen Fisch enthält.

Von sich aus reagieren

Wenn sich die Szene verändert, kann sich das Modell selbst einschalten, statt auf eine Frage zu warten. Bei einem Museumsbesuch sagt ein Nutzer: „Erinnere mich, wenn du den bronzenen Ständer mit Tiger und Hirsch siehst.“ SeedRealtime beobachtet den Kamerastream, bis das Ausstellungsstück auftaucht, und liefert dann die Erinnerung samt Hintergrundinformationen.

Sieht das Modell, wie jemand ganze Kaffeebohnen direkt in einen Siebträger schüttet, greift es ein: Zuerst müssten die Bohnen fein gemahlen werden. Nach der Extraktion empfiehlt es anhand der Farbe der Crema, den nächsten Bezug um zwei bis drei Sekunden zu verkürzen. Tool-Aufrufe wie Suchen oder Buchen sind dabei in die Antworten eingebettet und kein separater Arbeitsschritt.

Natürliches Timing im Gespräch

SeedRealtime entscheidet aus multimodalem Kontext, wann es sprechen, pausieren oder still bleiben sollte, und soll Fehlreaktionen vermeiden. An einem vollen Flughafen in Peking ignoriert es die beiläufige Erwähnung von „Old Li's flight“ durch eine Begleitperson. Auf Nachfrage erinnert es sich jedoch an Informationen der Abflugtafel, die bereits vom Bildschirm verschwunden sind, und sucht anschließend online nach dem Gepäckband. Zu Hause konzentriert es sich auf die Korrektur der englischen Aussprache eines Kindes, obwohl ein Elternteil im Hintergrund telefoniert.

Laut ByteDances End-to-End-Evaluierung mit Menschen halbiert SeedRealtime gegenüber kaskadierten Modellen ungefähr die Probleme beim Audio-Video-Gesprächsrhythmus. Dazu zählen weniger Unterbrechungen mitten im Satz, weniger träge Reaktionen nach Pausen und weniger Fehlauslösungen durch Geräusche. Außerdem werden einzelne Gesprächszüge häufiger flüssig und vollständig abgeschlossen. Dabei handelt es sich um vom Anbieter durchgeführte Tests, nicht um unabhängige Benchmarks.

SeedRealtime im Vergleich mit GPT-4o Realtime, Gemini Live und Kaskaden

Praktisch entscheidend ist die Frage, worin sich SeedRealtime von den Echtzeitsystemen unterscheidet, die Entwickler bereits heute ansprechen können. Die nüchterne Antwort: Die meisten bestehenden „Realtime“-APIs konzentrieren sich auf Audio. SeedRealtime grenzt sich über die gemeinsame Verarbeitung von Audio und Video im Full-Duplex-Betrieb ab.

OpenAIs Realtime API und Googles Verbraucherfunktion Gemini Live mit der zugehörigen Live API für Entwickler bieten latenzarme Echtzeitgespräche. Im Mittelpunkt steht jedoch Audio – Sprache hinein, Sprache heraus. Bildverarbeitung läuft getrennt, während Sprecherwechsel weiterhin von Endpunkterkennung oder VAD abhängen. SeedRealtime positioniert sich anders: native Audio-Video-Fusion, im Modell entschiedenes Full-Duplex-Timing, proaktive Hinweise und in den Gesprächsfluss integrierte Tool-Nutzung.

ModellNative ModalitätenDuplexSprecherwechselProaktiv / Tool-NutzungÖffentliche API
SeedRealtimeAudio + Video + Text (fusioniert)Voll (laut Anbieter)Intern, multimodalJa, integriertNein (zum Start)
GPT-4o Realtime APIAudio + TextEchtzeit, VAD-gesteuertExterne EndpunkterkennungÜber Function ToolsJa
Gemini Live / Live APIAudio + Text (Kamera in der Consumer-App)Echtzeit, VAD-gesteuertExterne EndpunkterkennungBegrenztJa (Live API, Audio)
Kaskadierter StackText (Audio über ASR/TTS)HalbFestIndividuellSelbst bauen

Die Vorteile von SeedRealtime stützen sich auf ByteDances eigene Demos und Auswertungen. Ein veröffentlichter direkter Vergleich mit GPT-4o Realtime oder Gemini Live fehlt. Die Übersicht oben beschreibt daher die Architektur und keine gemessene Überlegenheit.

Können Entwickler SeedRealtime schon nutzen?

Mit dem Start am 5. August 2026 ist SeedRealtime nicht als Entwickler-API verfügbar. ByteDance spricht zwar von einer „vollständigen Einführung“, meint damit aber die Bereitstellung in eigenen Produkten und keinen offenen Endpunkt, den jeder aufrufen kann.

Zum Start gibt es für SeedRealtime weder eine öffentliche API noch eine Preisseite oder Entwicklerdokumentation. ByteDances kommerzieller API-Zweig ist Volcengine (火山引擎), wo die Doubao-Modellfamilie angeboten wird: die LLMs Seed 2.1 Pro und Turbo, Seed-ASR, Seed-TTS und weitere Modelle. SeedRealtime erscheint dort zum Start nicht in der Liste; auch Drittanbieter-Relays bieten keinen Echtzeit-Ersatz für Audio und Video.

Für Teams, die heute einen Echtzeit-Endpunkt benötigen, bleiben kurzfristig realistischere Optionen daher audiobasiert: OpenAIs Realtime API, Googles Live API oder ein selbst gebauter kaskadierter Stack. SeedRealtime ist vorerst vor allem eine Architektur, die man im Blick behalten sollte. ByteDance hat keinen Termin für eine Echtzeit-API über Volcengine oder BytePlus genannt.

FAQ

Ist SeedRealtime öffentlich verfügbar?

Seit dem Start am 5. August 2026 ist es in ByteDances eigenen Produkten eingebunden. Eine öffentlich zugängliche App oder einen Endpunkt namens SeedRealtime, für den man sich anmelden könnte, gibt es aber nicht.

Gibt es für SeedRealtime eine API?

Zum Start nicht. ByteDance hat weder API-Zugang noch Preise oder Entwicklerdokumentation veröffentlicht. Als möglicher künftiger Ort gilt die Doubao-API-Familie von Volcengine, die SeedRealtime bislang jedoch nicht aufführt.

Wie unterscheidet sich SeedRealtime von GPT-4o Realtime?

Die Realtime API von GPT-4o ist audiozentriert: Sprache hinein, Sprache heraus. SeedRealtime beansprucht dagegen, Audio und Video gemeinsam in einem Full-Duplex-Modell zu verarbeiten, das sein Timing selbst bestimmt und proaktiv handelt. Einen unabhängigen direkten Vergleich gibt es bislang nicht.

Ist SeedRealtime kostenlos?

Zum Start gibt es kein eigenständiges Produkt und keine API mit Preisangabe. Die Frage „kostenlos oder kostenpflichtig“ stellt sich daher noch nicht; es handelt sich um eine Funktion innerhalb von ByteDances Produkten.

Was bedeutet „Full-Duplex“ bei einem KI-Modell?

Das Modell kann gleichzeitig zuhören und antworten sowie den Gesprächszustand kontinuierlich verfolgen. Es entscheidet selbst, wann es sprechen oder pausieren sollte, statt starr zwischen einer Frage und einer Antwort zu wechseln.

Weiterführende Artikel