2026 年 7 月,阿里巴巴的 Qwen-Audio-3.0-TTS-Plus 以 1,237 的 Quality Elo,登上 Artificial Analysis Text-to-Speech arena 第一名,領先 Google Gemini 3.1 Flash TTS、MiniMax Speech 2.8 HD 與 ElevenLabs Eleven v3。更值得注意的是,它的價格為每百萬字元 $27.6
以下會從模型定位、登頂原因、定價,到適合與不適合採用它的情境,一次說清楚。
別把它和 Qwen3-TTS 搞混
搜尋「Qwen audio 3.0 TTS」時,多數結果其實會指向較早推出的開放權重語音模型家族 Qwen3-TTS。阿里巴巴已將其發布在 GitHub,也提供了 Hugging Face demo。這是使用者可以本機執行、串接 ComfyUI,並因聲音複製能力而在 Reddit 上受到熱議的那一套模型;和本文介紹的產品不是同一個。
Qwen-Audio-3.0-TTS 是更新一代的託管式服務,透過 Alibaba Cloud Model Studio (Bailian) 提供,而非下載模型權重自行部署。目前分為兩個層級:
- Plus:以聲音品質為優先,也就是登上榜首的版本,適合有聲書、旁白與配音等重視自然度、不那麼在意數毫秒差距的工作。
- Flash:以低延遲為目標,首包延遲約 300 ms,面向語音代理、即時助理等需要即時互動的場景。
同一份排行榜已清楚顯示兩代之間的差距:較早的 Qwen3 TTS Flash Elo 為 929 左右、排名約第 76;新的 Plus 則以 1,237 居首。雖然同屬 Qwen 產品脈絡,模型等級已經不同。
兩者的適用工作也不一樣。若你正在兩者之間選擇,可參考以下比較:
| Qwen3-TTS(開放權重) | Qwen-Audio-3.0-TTS(託管式) | |
|---|---|---|
| 取得方式 | 下載權重(GitHub / Hugging Face) | 透過 Alibaba Cloud Model Studio API 使用 |
| 自行託管/本機執行 | 可以 | 不行,僅提供託管服務 |
| ComfyUI 與社群節點 | 支援 | 不支援 |
| 方案 | 單一開放模型家族 | Plus(品質)/Flash(約 300 ms) |
| 語言涵蓋範圍 | 約 10 種語言 | 16 種語言 + 20 個中文方言區域 |
| Arena Quality Elo | 約 929(Qwen3 TTS Flash) | 1,237(Plus,第一名) |
| 最適合的需求 | 本機控制、資料落地需求、實驗與調校 | 頂尖品質、方言支援與大規模正式部署 |
若最重視自行託管的掌控權或零邊際成本,應選開放權重系列;若品質、方言廣度,或不想維護自家 GPU 更重要,則應考慮託管式 3.0 方案。
讓它登頂的評測是什麼?
Artificial Analysis arena 是由獨立第三方進行的盲測人類偏好排名。聽眾在不知道音檔出自哪個模型的情況下比較片段,Elo 分數則反映各模型勝出的頻率。
以下是截至 2026 年 7 月 20 日的排行榜前段班:
| 排名 | 模型 | Quality Elo | API 價格/每 100 萬字元 |
|---|---|---|---|
| 1 | Qwen-Audio-3.0-TTS-Plus (Alibaba) | 1,237 | $27.6 |
| 2 | Simba 3.2 (SpeechifyAI) | 1,232 | $10.0 |
| 3 | Gemini 3.1 Flash TTS (Google) | 1,211 | $18.3 |
| 4 | Sonic 3.5 (Cartesia) | 1,211 | $49.0 |
| 8 | MiniMax Speech 2.8 HD | 1,180 | $100.0 |
| 11 | ElevenLabs Eleven v3 | 1,173 | $100.0 |
阿里巴巴自行公布的指標,也與這份獨立排名呈現相近方向。在多語言 CV3-Eval 基準測試中,官方表示 Plus 的平均詞/字元錯誤率為 3.96,Flash 為 3.87,代表合成語音轉錄回文字時,和原始文本幾乎同樣準確。至於衡量複製聲音與參考音檔接近程度的說話者相似度,Plus 在 16 種受測語言的平均值為 82.75。這兩項數字來自阿里巴巴,而前述 Elo 並非如此。任何單一基準都只能作為起點,實際仍應以自己的音訊素材測試。
實務上最有感的四項能力
它能取得高排名,主要來自四項適合實際部署的能力,相關細節可見官方 Qwen-Audio-3.0-TTS 技術頁面。
自由文字指令控制。你可以直接用自然語言引導聲音,例如「用焦慮的深夜電台主持人口吻朗讀,結尾放慢速度」。角色、情緒、說話風格、語速、音色和口音都能涵蓋,不需要為基本控制另外學一套標記語言。
細緻的行內標籤。若要更精準控制,模型可辨識直接嵌入文字中的 86 種行內標籤,包含笑聲、呼吸、咳嗽與嘆氣等非語言事件。這正是平鋪直敘的朗讀與帶有表演感的演出之間的差異,也是它適合遊戲對白、旁白與影視配音的原因。
語言與方言覆蓋廣。它支援 16 種語言,其中新增了 7 種,包括阿拉伯語、印尼語、葡萄牙語、泰語、越南語、馬來語與他加祿語;另涵蓋 20 個中文方言區域,從粵語、上海話到四川話與東北話皆在其中。對要進入東南亞市場,或服務各中文語言市場的團隊而言,這樣的方言支援很難在其他產品中找到對手。
穩定性與輸出品質。即使參考音檔帶有噪音、混響或不夠清晰,它也能複製聲音,不需先經過獨立降噪流程;長篇旁白可單次合成最長三分鐘,並輸出 48 kHz 音訊(48 kHz 的控制台功能預計於 7 月 24 日推出)。單次生成三分鐘的重要性在於,將多個短片段拼接時,韻律與音色通常最容易產生漂移。
定價:榜首品質,不必付頂級帳單
文字轉語音通常依輸入文本的字元數計費,因此成本會隨旁白文字量直接增加。
Qwen-Audio-3.0-TTS-Plus 的價格是每百萬字元 $27.6,相較於它排名更高的兩個傳統高階品牌,成本低了許多:ElevenLabs Eleven v3 與 MiniMax Speech 2.8 HD 都是每百萬字元 $100,約為 Plus 的 3.6 倍。換成實際情境來看,一本 100,000 字元的有聲書,大致相當於一部短篇小說,在 Plus 上約需$2.76;上述兩者約需$10。
不過,Plus 並不是整體最便宜的選擇。有兩款品質稍低一級的模型價格更低:Gemini 3.1 Flash TTS 每百萬字元 $18.3、排名第 3;Simba 3.2 每百萬字元 $10、排名第 2,Elo 幾乎持平。因此較精確的說法是:Qwen 以中階價格提供榜首品質,而不是提供全榜最低價格。若應用不在乎幾個 Elo 分差,確實可以選擇更便宜的方案。(公開 arena 列出了 Plus 的價格,但尚未公布 Flash 的每字元費率;請至控制台確認 Flash 的即時價格。)
如何使用 Qwen-Audio-3.0-TTS
最直接的方式是使用 Alibaba Cloud Model Studio (Bailian)。請先參考 Model Studio 文件中的請求格式與 SDK:建立 API key 後,透過模型市集端點呼叫 qwen-audio-3.0-tts-plus 或 qwen-audio-3.0-tts-flash。一個合理的起手方式,是先用 Flash 做原型,確認延遲是否符合需求,再將相同腳本改跑 Plus 比較結果;該選哪一層,取決於你的情境是即時互動,還是聽眾會完整收聽的旁白內容。
若團隊已透過像 AIReiter 這類相容聚合平台整合多家供應商,並希望帳務集中在同一處,也可以直接在該平台加入此模型,不必另開阿里巴巴帳戶;若只需要這一款模型,直接使用通常最簡單。
如果需求是即時對話,而不是一次性的旁白生成,TTS 只是整個架構的一層;與其搭配的 omni Realtime API 和串流 ASR,可參考 Qwen Audio 3 Realtime guide。
你該選它嗎?
- 選 Plus:若你要生成中文、方言或多語言旁白、有聲書、配音,並希望以合理成本取得最高自然度。
- 選 Flash:若你正在打造即時語音代理,且約 300 ms 的首包延遲比最後幾個 Elo 品質分數更重要。
- 考慮 Gemini 3.1 Flash TTS 或 Simba 3.2:若成本才是決定因素,且接近頂級的品質已經足夠;兩者都比 Plus 便宜。
- 繼續使用 ElevenLabs 或 Cartesia:若你的工作流程依賴它們成熟的 SDK、更大的預建聲音庫,或以英文為主的工具與生態系統;這些仍是它們的優勢,不會因 arena 排名而改變。
在本文比較的模型中,同時具備 arena 第一名、20 個中文方言區域與每百萬字元 $27.6 定價的,只有 Plus。若這組合正好符合你的需求,與其直接相信排行榜,不如先拿自己的腳本實跑測試,再決定是否正式導入。
常見問題
Qwen-Audio-3.0-TTS 免費嗎?
不免費。託管式 Plus 與 Flash 都是付費方案,透過 Alibaba Cloud Model Studio 按字元計費;Plus 為每百萬字元 $27.6。Alibaba Cloud 曾不定期提供免費試用額度,請至控制台查看你所在區域目前的方案。開放權重的 Qwen3-TTS 則可免費自行託管。
Qwen-Audio-3.0-TTS 是開源的嗎?可以下載嗎?
託管式的 Qwen-Audio-3.0-TTS-Plus/Flash 不提供模型權重下載。可開源使用的模型是較早的 Qwen3-TTS 系列,可透過 GitHub 與 Hugging Face 用於本機部署、聲音複製與 ComfyUI 工作流程。兩者有關聯,但屬於不同版本的產品。
它支援聲音複製嗎?
支援。它能根據參考音檔複製目標聲音,且特別針對含噪音或混響的參考素材進行優化,不需先獨立清理音檔。Plus 在 16 種語言上的平均說話者相似度為 82.75。
Qwen-Audio-3.0-TTS 和 Qwen3-TTS-Flash 有什麼差別?
Qwen3-TTS-Flash 屬於較早的開放權重世代,在 arena 的排名低得多,Elo 約為 929。Qwen-Audio-3.0-TTS 則是新一代託管式產品:Flash 主打低延遲,Plus 則以 1,237 Elo 登上品質排行榜第一名。
有 Demo 或 ComfyUI 支援嗎?
開放權重的 Qwen3-TTS 有公開的 Hugging Face demo,也有社群提供的 ComfyUI 節點。託管式 Qwen-Audio-3.0-TTS 則透過 Alibaba Cloud Model Studio 控制台使用,而非提供獨立 Demo 頁面。