Qwen-Audio-3.0-TTS:登頂競技場的 TTS 模型

最近更新: 2026-07-20 10:08:32

在 2026 年 7 月,阿里巴巴的 Qwen-Audio-3.0-TTS-Plus 以 1,237 的 Quality Elo 分數登上了 Artificial Analysis Text-to-Speech 競技場 的第一名,領先 Google 的 Gemini 3.1 Flash TTS、MiniMax Speech 2.8 HD,以及 ElevenLabs 的 Eleven v3。其價格也列為 每百萬字元 27.6 美元,約為 ElevenLabs 和 MiniMax 對其所超越的分級所收費用的三分之一。它不是排行榜上最便宜的模型,但沒有其他模型能以這個價格同時具備它的第一名品質。(數據截至 2026 年 7 月 20 日;供應商經常變動排名與價格,因此在規劃使用前請先確認兩者。)

Artificial Analysis Text-to-Speech leaderboard with Qwen-Audio-3.0-TTS-Plus ranked first

以下是該模型是什麼、它如何獲得該排名、其費用,以及何時它是——或不是——正確選擇。

首先,不要把它與 Qwen3-TTS 混淆

搜尋「Qwen audio 3.0 TTS」時,大多數結果都指向 Qwen3-TTS,這是 Alibaba 先前發布的開放權重語音系列,並已發表在 GitHubHugging Face demo 上。這就是人們會在本機執行、接入 ComfyUI,並在 Reddit 上對其聲音複製功能讚不絕口的模型。它與本指南中的產品不同。

Qwen-Audio-3.0-TTS 是較新的託管式生成版本,透過 Alibaba Cloud Model Studio (Bailian) 提供,而不是以可下載權重的形式發布。它分為兩個層級:

  • Plus — 以品質優先為主的方案(也是獲得第 1 名排名的方案),適用於有聲書、旁白與配音等對自然度比毫秒更重要的場景。
  • Flash — 以延遲優先的方案,首包延遲約 300 ms,專為語音代理與即時助理等即時互動而打造。

同一個排行榜上的世代差距非常明顯:較舊的 Qwen3 TTS Flash 的 Elo 為 929(排名約第 76),而新的 Plus 等級則以 1,237 領先。雖然同屬同一品牌系列,但模型層級已不同。

兩者也各自扮演不同的角色。如果你要在它們之間做選擇,可以這樣區分:

Qwen3-TTS(開放權重)Qwen-Audio-3.0-TTS(託管)
如何取得下載權重(GitHub / Hugging Face)透過 Alibaba Cloud Model Studio 的 API
自行託管 / 本機執行可以不行 — 僅限託管
ComfyUI & 社群節點可以不行
方案單一開放家族Plus(品質)/ Flash(約 300 ms)
語言覆蓋約 10 種語言16 種語言 + 20 種中文方言
Arena 品質 Elo約 929(Qwen3 TTS Flash)1,237(Plus,#1)
最適合本機控制、資料駐留、動手調整頂級品質、方言、規模化生產

當託管控制權或零邊際成本最重要時,請選擇 open-weight 系列;當品質、方言覆蓋範圍,或不需要自行運行 GPU 更重要時,請選擇託管的 3.0 方案。

贏得該排名的基準測試

Artificial Analysis 競技場是一個由獨立第三方進行的盲測、以人類偏好為基準的排名:聆聽者在不知道是哪個模型產生音訊的情況下比較片段,而 Elo 分數則反映每個模型獲勝的頻率。

截至 2026 年 7 月 20 日,以下是競技場的頂端:

排名模型品質 EloAPI 價格 / 100萬字元
1Qwen-Audio-3.0-TTS-Plus (Alibaba)1,237$27.6
2Simba 3.2 (SpeechifyAI)1,232$10.0
3Gemini 3.1 Flash TTS (Google)1,211$18.3
4Sonic 3.5 (Cartesia)1,211$49.0
8MiniMax Speech 2.8 HD1,180$100.0
11ElevenLabs Eleven v31,173$100.0

阿里巴巴自行公布的指標也與獨立排名一致。在多語言 CV3-Eval 基準上,該供應商報告 Plus 方案的平均詞/字元錯誤率為 3.96,Flash 方案為 3.87——這表示合成語音回轉為文字時,幾乎與原始文本一樣準確。說話人相似度是衡量複製語音與參考語音匹配程度的指標,據報 Plus 在全部 16 種測試語言中的得分為 82.75。這兩個數字都是阿里巴巴自行提供的;上面的 Elo 分數則不是。請將任何單一基準視為起點,並使用你自己的音訊進行測試。

它的優點

此排名來自在生產環境中重要的四項能力,詳見 官方 Qwen-Audio-3.0-TTS 技術頁面

Qwen-Audio-3.0-TTS capability overview and CV3-Eval results

自由風格指令控制。 你可以用自然語言來引導語音——「把這段念得像一位焦慮的深夜電台主持人,結尾放慢一點」——涵蓋角色、情緒、說話風格、語速、音色和口音。對於這些大方向,不需要另外學習一套標記語言。

細緻的內嵌標籤。 為了精準控制,模型會讀取直接放在文字中的 86 個內嵌標籤,包括像笑聲、呼吸、咳嗽和嘆息等非語言事件。這就是平鋪直述與表演之間的差異,也是讓模型可用於遊戲對話、敘述和電影配音的原因。

語言與方言覆蓋廣度。 它涵蓋 16 種語言——其中 7 種為新加入,包括阿拉伯語、印尼語、葡萄牙語、泰語、越南語、馬來語和他加祿語——以及 20 個中文方言區域,從粵語、上海話到四川話和東北話。對於面向東南亞或跨中文市場部署的團隊來說,這種方言覆蓋在其他地方很難匹敵。

穩健性與輸出品質。 它可從含雜訊、混響或不清晰的參考音訊中複製聲音,且無需額外的降噪步驟;可在單次傳遞中合成長達三分鐘的長篇旁白,並輸出 48 kHz 音訊(48 kHz 的控制台上線排程為 7 月 24 日)。三分鐘單次生成之所以重要,是因為拼接較短的片段時,韻律和音色通常會漂移。

價格:頂級品質,無需頂級帳單

文字轉語音會依輸入文字的字元數計費,因此成本會直接隨著您朗讀的內容多寡而增加。

每百萬字元 $27.6 的價格來看,Qwen-Audio-3.0-TTS-Plus 的成本只是它所超越的兩個傳統頂級品牌的一小部分:ElevenLabs Eleven v3 和 MiniMax Speech 2.8 HD 兩者的標價都是每百萬字元 $100,約高出 3.6 倍。以實際使用來說,一本 100,000 字元的有聲書(大約是一部短篇小說)在 Plus 上的費用約為$2.76,而在這兩個產品上則約為$10

不過,Plus 並不是整體上最便宜的選項。有兩個品質略低一級的模型壓低了它的價格:Gemini 3.1 Flash TTS 每百萬字元 $18.3(排名第 3),以及 Simba 3.2 每百萬字元 $10(排名第 2,Elo 幾乎持平)。因此,準確的說法應該更聚焦一些——Qwen 以中等價位提供頂尖排名的品質,而不是棋盤上最低的價格。如果幾個 Elo 分數對你的使用情境並不重要,你就可以付更少。 (公開競技場列出的是 Plus 的定價;Flash 的每字元費率目前尚未在那裡公布,因此請到控制台查看即時的 Flash 數字。)

如何使用 Qwen-Audio-3.0-TTS

直接路徑是 Alibaba Cloud Model Studio (Bailian),其請求格式與 SDK 請見 Model Studio 文件:先建立 API key,然後透過 model-market 端點呼叫 qwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flash 模型。合理的起點是先在 Flash 上做原型,看看其延遲是否符合需求,接著用 Plus 執行相同的腳本並比較——正確的方案取決於你的使用情境是即時互動,還是讓聽眾從頭到尾聽完的旁白。

已經透過相容的聚合器(如 AIReiter)將多家供應商導入同一計費介面的團隊,可以直接在那裡新增,而不必另外開設獨立的 Alibaba 帳戶;如果這是你唯一需要的模型,直接使用會最簡單。

如果你需要即時對話,而不是一次性朗讀,那麼 TTS model 只是其中一層——與其搭配的 omni Realtime API 和 streaming ASR,已在 Qwen Audio 3 Realtime guide 中說明。

您應該使用它嗎?

  • 選擇 Plus 如果你要生成中文、方言或多語言旁白、有聲書或配音,並且希望以每美元獲得最高的自然度。
  • 選擇 Flash 如果你正在打造即時語音代理,而約 300 ms 的首包時間比最後幾個 Elo 分數點的品質更重要。
  • 考慮 Gemini 3.1 Flash TTS 或 Simba 3.2 如果成本是決定因素,而且接近頂尖的品質就已足夠——兩者都比 Plus 更便宜。
  • 若你依賴 ElevenLabs 或 Cartesia,則繼續使用它們 如果你仰賴它們成熟的 SDK、更大的預建語音庫,或以英文優先的工具與生態系,而在這些方面它們仍然領先,不受榜單排名影響。

在這裡比較的模型中,#1 的 arena 排名、20 個中文方言地區,以及 $27.6/M 定價的組合,只有 Plus 提供——這就是為什麼,如果這種組合符合你的使用情境,在正式採用之前,值得先用你自己的腳本跑一遍,而不是只憑排名就全盤相信。

常見問題

Qwen-Audio-3.0-TTS 是免費的嗎?

不——託管的 Plus 和 Flash 方案皆為付費,並透過 Alibaba Cloud Model Studio 按字元計費,其中 Plus 為每百萬字元 27.6 美元。Alibaba Cloud 曾不定期提供免費試用額度,因此請查看控制台,確認您所在區域是否有最新優惠。開源權重的 Qwen3-TTS 可免費自行託管。

Qwen-Audio-3.0-TTS 是開源的嗎?我可以下載它嗎?

託管的 Qwen-Audio-3.0-TTS-Plus/Flash 等級並非以權重形式提供。開源模型是較早的 Qwen3-TTS 系列,可在 GitHub 和 Hugging Face 上取得,用於本機使用、複製以及 ComfyUI 工作流程。它們彼此相關,但屬於不同的發佈版本。

它支援聲音複製嗎?

是。它會從參考音訊複製目標聲音,並且專門調校過,即使參考音訊有雜訊或混響也能維持效果——不需要額外的清理步驟。Plus 方案在 16 種語言中的說話者相似度平均為 82.75。

Qwen-Audio-3.0-TTS 與 Qwen3-TTS-Flash——有什麼差別?

Qwen3-TTS-Flash 屬於較早期的開放權重版本,在競技場中的排名相對較低(Elo 約 929)。Qwen-Audio-3.0-TTS 是新的託管版本;其 Flash 層級主打低延遲,而 Plus 層級則以 Elo 1,237 名列品質排行榜首位。

有提供示範或 ComfyUI 支援嗎?

開放權重的 Qwen3-TTS 提供公開的 Hugging Face demo 和社群 ComfyUI 節點。託管式的 Qwen-Audio-3.0-TTS 方案則是透過阿里雲 Model Studio 控制台存取,而不是透過獨立的 demo 頁面。