AIREITER

Qwen3.8 LiveTranslate API 定價與 WebSocket 設定

最近更新: 2026-09-18 18:56:50

如果即時翻譯服務能在約 2.3 秒內回應,看起來確實很適合拿來支援會議。但 Qwen3.8-LiveTranslate 目前只提供為 Alibaba Cloud/Model Studio 的託管式 API,無法下載到本機執行;而 2.3 秒也是官方宣稱的數字,並非獨立的正式環境測試結果。這個差異,會直接影響成本估算與部署策略。

30 秒看懂:現在適不適合買

如果你需要透過即時連線取得串流語音翻譯、字幕和語音輸出,Qwen3.8-LiveTranslate 適合拿來做有控管的原型。不過,不要把官方標示的延遲當成在吵雜會議、多人搶話或所有語言組合下都能達成的保證;目前針對這個確切版本的獨立實測證據仍然有限。

對於能在後端安全保存 API 金鑰、也能接受 Alibaba Cloud 特定區域部署方式的服務來說,這個模型算是合理選擇。但如果你的需求是下載模型權重、使用成熟的第三方託管環境,或是在制定正式上線規格前就拿到經驗證的準確率基準,它目前就不太適合。

目前到底提供了什麼

確切的託管模型 ID 是 qwen3.8-livetranslate-flash-realtime。Alibaba Cloud 官方文件與 Model Studio 更新紀錄將它列為 2026 年 9 月 17 日推出的即時服務。官方模型頁面則標示可辨識 60 種來源語言,並支援 29 種語音輸出語言。

問題目前答案
已經發布了嗎?是,以託管式 API 模型形式提供
模型 IDqwen3.8-livetranslate-flash-realtime
主要傳輸方式Realtime API,包括 WebSocket
輸入音訊與影像內容
輸出文字與音訊,視工作階段設定而定
官方延遲宣稱端到端約 2.3 秒
開放權重尚未找到官方證據

所以,這次發布比單純的產品預告更具體,但仍然不等於開放模型下載。官方文件提供的是透過 Model Studio 存取推論服務,而不是可在本機使用的模型檢查點。

Qwen3.8 LiveTranslate 官方模型頁面

先算成本,再開始寫程式

以國際/新加坡部署為例,官方價目表將計費拆成四個類別,以下價格均以每一百萬個 token 計算:

計費項目官方價格
音訊輸入$7.50 / 1M tokens
影像輸入$0.55 / 1M tokens
文字輸出$20 / 1M tokens
音訊輸出$30 / 1M tokens

Qwen 的即時翻譯指南指出,音訊輸入按每秒 7 個 token 計算,音訊輸出則是每秒 12.5 個 token。以連續串流來估算輸入與輸出成本,大致如下:

  • 60 秒音訊輸入:420 個 token,按照音訊輸入價格計算約為 $0.00315
  • 產生 60 秒音訊輸出:750 個 token,按照音訊輸出價格計算約為 $0.0225

但這些數字不能直接當成完整的「每分鐘成本」。它們不包含文字輸出、影像、連線行為,也沒有考慮翻譯後的音訊可能比原始內容更長或更短。若只要求文字輸出,適用的計費項目也會不同。實際使用前,請以你真正採用的區域與部署方式為準,查閱官方的 model pricing page

Qwen Model Studio 定價參考

真正關鍵的是 WebSocket 串接方式

官方文件描述的是後端即時工作階段,而不是一般的一次性翻譯請求。Realtime API overview 將 WebSocket 列為伺服器應用程式與原型最直接的選項。

最小可行的實作流程大致如下:

  1. 建立指定區域的即時 WebSocket URL,並將 qwen3.8-livetranslate-flash-realtime 設為模型。
  2. 在握手階段送出 Authorization: Bearer <API_KEY>;API 金鑰應只保留在後端。
  3. 傳送 session.update,設定來源/目標語言,以及需要的輸出模式。
  4. 使用 input_audio_buffer.append 串流傳送 base64 音訊。
  5. 提交音訊緩衝區,或讓已設定的語音活動偵測機制觸發處理。
  6. 持續接收翻譯文字與音訊事件,直到該輪處理完成。

端點會依工作區與區域而不同,因此即使事件 payload 正確,直接複製其他部署的主機名稱仍可能連線失敗。實作工作階段設定、VAD、熱詞或手動提交時,應以 LiveTranslate client-event reference 為準。

適合哪些工作,哪些情境先別急著用

工作負載適配程度原因
受控串流的即時字幕適合做原型串流音訊與文字輸出符合 API 設計
雙向應用程式的後端翻譯適合,但要先測試WebSocket 能維持工作階段,也能回傳音訊
輪流發言清楚的小型會議有機會適用官方定位包含具備說話者感知能力的即時翻譯
充滿噪音且頻繁插話的會議尚未證實目前沒有獨立證據衡量多人重疊發言、口音或噪音下的表現
高風險的醫療或法律口譯不建議直接採用現有證據不足以證明術語處理的可靠性
本機/離線部署不適合官方發布的是託管服務,不是可下載模型

開源的 AlbusWei/LiveTranslate implementation 是一個值得參考的生態訊號。它的 README 列出個人翻譯、檔案配音與會議模式,傳輸方式以 WebRTC 優先,WebSocket 作為備援。這證明開發者可以在 Qwen 即時模型之上打造實用的包裝層,但不能用來證明 Qwen3.8 的準確度或正式環境可用性。

目前的證據能證明什麼,又不能證明什麼

官方文件已經提供具體的功能與價格資訊,但獨立測試仍是最薄弱的一環。社群討論中,針對這個確切版本的文章數量不多,也沒有找到專門討論 Qwen3.8-LiveTranslate 的實質 Reddit 討論串。

一則真實使用者貼文很謹慎地總結了它在延遲方面的 headline 變化:

“2.3 秒還沒有消失,但已經更接近人類能自然接話的節奏了。” — @WukongNumber1, X

這可以視為使用者對延遲宣稱的直觀感受,但不能當成基準測試。另一則討論較早期 Qwen 翻譯使用經驗的 Reddit 貼文也呈現兩極反應:u/ReplacementTommy 寫道:「老實說,Qwen AI 是我用過的翻譯工具中,準確度最高、聽起來也最自然的。」另一方面,u/Valhall22 則表示,在英文、德文和法文測試中,Qwen 沒有進入他們心目中的前五名。這些留言既沒有指明確切的 Qwen3.8 即時模型,也不是受控測試,因此不應據此做出排名。

比較務實的結論是:Qwen3.8-LiveTranslate 已經可以透過官方服務呼叫,計費方式有文件可查,即時架構也足以開始開發。至於困難語音環境下的準確度,仍然是採購方必須自行驗證的項目。

Qwen3.8 LiveTranslate API 常見問題

Qwen3.8 LiveTranslate 現在可以使用嗎?

可以。Alibaba Cloud 文件將 qwen3.8-livetranslate-flash-realtime 列為託管式 Model Studio API 模型。目前沒有證據顯示它已推出開放權重版本。

Qwen3.8 LiveTranslate 使用 WebSocket 嗎?

是。官方 Realtime API 與 LiveTranslate 事件文件都說明了 WebSocket 存取、驗證、工作階段更新、音訊緩衝區事件,以及串流輸出。

Qwen3.8 LiveTranslate 每分鐘要多少錢?

它沒有單一、固定的每分鐘價格,因為音訊輸入、文字輸出、音訊輸出與影像內容分別使用不同的計費項目。按照文件中的每秒 7 個輸入 token 與每秒 12.5 個輸出 token 計算,在列出的國際價格下,1 分鐘音訊輸入約為 $0.00315,1 分鐘產生的音訊約為 $0.0225;這還不包含文字及其他用量。

可以只回傳文字,不要翻譯後的音訊嗎?

可以。工作階段能設定輸出模式,包括只輸出文字,或同時輸出文字與音訊。正式上線前,請先查閱官方 client-event 文件,確認目前使用的事件名稱。

它支援多少種語言?

官方模型資訊列出 60 種可辨識語言,以及 29 種語音輸出語言。因此,音訊輸出的語言數量少於可辨識的語言數量。

可以即時翻譯影片嗎?

這個模型接受音訊與影像內容,定位上也涵蓋影音翻譯。不過,這不代表所有檔案式影片配音流程都會使用這個即時模型;Qwen 另外也提供非即時的音訊/影片翻譯路徑。

可以下載模型並在本機執行嗎?

目前沒有找到這個確切即時模型的官方開放權重版本。在 Qwen 發布獨立檢查點與授權條款之前,應以託管式推論服務為部署前提。

實際建議:先做原型,並保留切換開關

Qwen3.8-LiveTranslate 值得拿來做受控的 API 原型,但不適合在未驗證的情況下直接投入正式環境。正式導入前,至少要用自己的音訊測試三件事:首次收到翻譯輸出的實測時間、包含人名與領域術語的語言組合品質,以及靜音、插話和重新連線時的行為。

把模型放在設定開關後面,讓你之後能切換區域、傳輸方式或供應商,而不必重寫整個應用程式。這是目前比較合理的取捨:API 介面與價格已經具備足夠的實用性,可以開始建置;但吵雜環境下的準確度與長時間穩定性,仍應交給自己的測試計畫驗證,而不是只看發布公告。

查閱過的來源