AIREITER

SeedRealtime:ByteDance 的音視訊全雙工 LLM

最近更新: 2026-08-05 07:02:55

即時語音 AI 不稀奇,真正困難的是讓模型一邊看、一邊聽,也能自然判斷該不該插話。ByteDance 於 2026 年 8 月 5 日推出的 SeedRealtime,主打原生音視訊全雙工 LLM:音訊與影像由同一個端到端模型共同處理,不需要額外模組替它判斷誰該說話。不過,對開發者來說目前的限制很明確:推出時尚無公開 API 或定價,僅整合於 ByteDance 自家產品中。

ByteDance Seed 網站上的 SeedRealtime 發表公告,標題為「An Audio-Visual Full-Duplex LLM」,日期為 2026 年 8 月 5 日。

SeedRealtime 究竟是什麼?

SeedRealtime 由 ByteDance 的 Seed 團隊打造,以單一架構融合音訊、視訊與文字。它不是把資料依序丟進不同處理階段,而是在持續流動的多模態輸入中,同步完成感知、理解、判斷與回應。

ByteDance 對它的描述是「同時觀看、聆聽與說話」:模型每一次回應,都會一起考量聽到的內容與看到的畫面。SeedRealtime 也納入 Seed 模型陣容,與支援 Doubao 的 LLM 系列 Seed2.1、影片生成模型 Seedance、圖像生成模型 Seedream、音訊生成模型 Seed Audio 1.0,以及機器人模型 Seed GR-RL 並列。

ByteDance Seed 模型頁面上的 SeedRealtime 模型卡,與 Seed2.1、Seedance 2.5、Seedream 5.0 Pro、Seed Audio 1.0 及 Seed GR-RL 一同展示。

它不太適合塞進既有分類:雖然能生成語音,卻不是單純的 TTS 模型;雖然能看見畫面,卻不是只做視覺辨識;更不只是另一個即時語音機器人。

全雙工,才是 SeedRealtime 的關鍵

所謂「全雙工」,是指模型可以一面聽、一面回應,持續掌握對話中是誰正在說話、何時適合接話,如同真人交談。SeedRealtime 的核心主張,在於它將聲音、影像、時間節奏與表達能力放進同一個端到端模型裡,而非將各種功能模組拼接起來。

過去的即時 AI 互動,大致卡在兩條路線之間。串接式架構會依序串起 ASR(語音轉文字)、LLM 或 VLM,以及 TTS(文字轉語音)。模組化設計易於除錯,但每次交接都會增加延遲並流失資訊;語氣、重疊發言、口音與畫面脈絡,往往在 ASR 階段就消失了。端到端語音模型雖然移除了這些交接,對話聽起來更自然,但多數仍仰賴外部語音活動偵測器(VAD)判斷輪到誰說話,因此實際上仍偏向半雙工:一問一答。

SeedRealtime 則把感知、理解、決策與表達收進單一模型,針對連續的音視訊流平行運作,不再由外部 VAD 決定對話輪次。

架構運作方式雙工模式輪次判斷主要弱點
串接式(ASR + LLM/VLM + TTS)多個模組依序串接半雙工固定端點判定每次交接都會帶來延遲與資訊流失
端到端 + 外部 VAD單一模型搭配外部輪次偵測器半雙工外部 VAD仍是一問一答的互動模式
SeedRealtime整合式音視訊端到端模型全雙工(官方宣稱)內建、多模態產品最新,能力描述主要來自廠商

尤其視訊沒有像語音那樣明顯的停頓。模型得持續判斷該注意哪個物體、哪個人的聲音最重要,以及此刻是否適合開口,同時不能被背景雜訊誤觸發。

ByteDance 強調的三項能力

ByteDance 在發表文章中,將 SeedRealtime 的表現歸納為三項能力:音視訊聯合理解、主動互動與自然的對話時機。官方並未以跑分表呈現,而是透過具體情境示範。

ByteDance 發布的 SeedRealtime 文章,日期為 2026 年 8 月 5 日,列出三項核心突破。

結合畫面與聲音理解情境

模型能利用現場畫面解開含糊的說法。當使用者問「這個要怎麼做」,SeedRealtime 會結合螢幕內容、手勢、視線和先前操作,判斷「這個」實際指的是什麼。

ByteDance 的示範中,使用者在晚餐時逐一介紹四位朋友,SeedRealtime 能將姓名對應到臉孔;之後這群人討論旅遊行程時,它也持續把每個人的聲音連結到身分,理解有人想去海邊、有人怕熱、有人對海鮮過敏。在四川餐廳裡,它能從鏡頭讀取只有中文的菜單,用英文推薦菜色,還會解釋為什麼「魚香肉絲」其實沒有魚。

主動在需要時介入

場景有變化時,模型可以自行開口,而不是被動等待提問。例如參觀博物館時,使用者說「看到銅虎食人卣時提醒我」,SeedRealtime 便會持續查看鏡頭畫面,直到該文物出現,再主動提醒並補充相關背景。

若它看到有人把整顆咖啡豆直接倒進粉碗,也會立刻提醒應先研磨成細粉;萃取完成後,還會根據 crema 的顏色,建議下一杯將萃取時間縮短兩到三秒。查詢、預約等工具呼叫也會融入對話回應,而不是另開一個處理步驟。

掌握該說話還是安靜的時機

SeedRealtime 會從多模態脈絡判斷何時該說、該停,或乾脆保持安靜,並避免誤觸發。在繁忙的北京機場,它不會因為同行者隨口提到「老李的航班」就插話;但使用者真的詢問時,它能回想起已從螢幕上捲走的航班看板資訊,接著上網查詢行李轉盤位置。在家中,即使家長正在背景通電話,它仍能專注協助孩子修正英文發音。

依據 ByteDance 的端到端人工評估,與串接式模型相比,SeedRealtime 可大致將音視訊對話節奏問題減半,包括說到一半被打斷、停頓後反應遲緩與雜訊造成的誤觸發;單一輪對話能流暢且完整完成的比例也更高。不過,這些是廠商自行執行的評估,而非獨立基準測試。

與 GPT-4o Realtime、Gemini Live、串接式方案有何不同?

實務上最重要的問題,是 SeedRealtime 與開發者目前已能呼叫的即時系統有何差異。比較直接的答案是:現有多數「realtime」API 都以音訊為中心;SeedRealtime 的差異化主張,則是以全雙工方式聯合建模音訊與視訊。

OpenAI 的 Realtime API,以及 Google 面向消費者的 Gemini Live 功能與開發者用的 Live API,都是低延遲的即時對話介面,但核心仍是音訊,也就是語音輸入、語音輸出;視覺通常另行處理,對話輪次仍依賴端點判定或 VAD。SeedRealtime 的定位在於整合這些要素:原生音視訊融合、模型內部決定全雙工節奏、主動提示,以及嵌入對話流程的工具使用。

模型原生模態雙工模式輪次判斷主動互動/工具使用公開 API
SeedRealtime音訊 + 視訊 + 文字(融合)全雙工(官方宣稱)內建、多模態有,融入對話無(推出時)
GPT-4o Realtime API音訊 + 文字即時、由 VAD 管理外部端點判定透過 function tools有
Gemini Live / Live API音訊 + 文字(消費者 App 可使用鏡頭)即時、由 VAD 管理外部端點判定有限有(Live API,音訊)
串接式方案文字(透過 ASR/TTS 處理音訊)半雙工固定自行客製自行建置

SeedRealtime 的優勢主要來自 ByteDance 自家的展示與評估,目前尚未公布與 GPT-4o realtime 或 Gemini Live 的直接對比。因此,上述比較應視為架構定位,而非已量測出的效能優勢。

開發者現在能用 SeedRealtime 嗎?

截至 2026 年 8 月 5 日推出時,SeedRealtime 尚未提供開發者 API。ByteDance 表示它已「全面推出」,但這指的是已部署在公司自家產品內,並非任何人都能呼叫的公開端點。

推出時,SeedRealtime 沒有公開 API、定價頁面或開發者文件。ByteDance 的商業 API 平台是 Volcengine(火山引擎),目前提供 Doubao 模型家族,包括 Seed 2.1 Pro 與 Turbo LLM、Seed-ASR、Seed-TTS 等服務。SeedRealtime 在推出時並未列於其中,第三方轉接服務也沒有真正可替代的即時音視訊方案。

對於現在就需要即時端點的團隊,較務實的選項仍是以音訊為主的 OpenAI Realtime API、Google Live API,或自行搭建串接式方案;SeedRealtime 則是值得持續觀察的架構方向。ByteDance 尚未公布 Volcengine 或 BytePlus 即時 API 的推出日期。

常見問題

SeedRealtime 已開放給一般使用者嗎?

截至 2026 年 8 月 5 日推出時,它已部署於 ByteDance 自家產品,但目前沒有名為 SeedRealtime、可自行註冊使用的公開 App 或端點。

SeedRealtime 有 API 嗎?

推出時沒有。ByteDance 尚未提供 API 存取、價格或開發者文件;未來最可能的上架位置是 Volcengine 的 Doubao API 家族,但目前尚未列出 SeedRealtime。

SeedRealtime 和 GPT-4o realtime 有什麼不同?

GPT-4o 的 Realtime API 以音訊為主,處理語音輸入與語音輸出。SeedRealtime 的主張則是在單一全雙工模型中共同建模音訊與視訊,自行決定互動時機,並可主動介入。目前尚無獨立的直接對比測試。

SeedRealtime 免費嗎?

推出時它沒有獨立產品或 API 定價,因此目前還不適用「免費或付費」的問題;它是整合在 ByteDance 產品中的一項能力。

AI 模型的「全雙工」是什麼意思?

意思是模型可同時聆聽與回應,持續掌握對話狀態,自行決定何時開口或停頓,而非鎖定在一問一答的輪次模式。

延伸閱讀