Qwen-Audio-3.0-TTS:登顶竞技场的 TTS 模型

最后更新: 2026-07-20 10:08:10

在 2026 年 7 月,阿里巴巴的 Qwen-Audio-3.0-TTS-PlusArtificial Analysis Text-to-Speech arena 上以 1,237 的 Quality Elo 夺得第一名,领先于 Google 的 Gemini 3.1 Flash TTS、MiniMax Speech 2.8 HD 和 ElevenLabs 的 Eleven v3。其定价也为 每百万字符 27.6 美元,约为 ElevenLabs 和 MiniMax 对其所超越的那些档位收费的三分之一。它并不是榜单上最便宜的模型,但没有其他模型能以这样的价格同时拥有其第一的质量表现。(数据截至 2026 年 7 月 20 日;供应商经常调整排名和价格,因此在围绕它们做计划之前,请先确认这两项。)

Artificial Analysis Text-to-Speech leaderboard with Qwen-Audio-3.0-TTS-Plus ranked first

以下是该模型是什么、它如何获得该排名、它的费用,以及它在何种情况下是合适的选择——或不是。

首先,不要把它和 Qwen3-TTS 混淆

搜索“Qwen audio 3.0 TTS”,大多数结果都会指向 Qwen3-TTS,这是阿里巴巴早些时候发布并在 GitHubHugging Face demo 上公开的开源权重语音家族。那是人们在本地运行、接入 ComfyUI,并因语音克隆在 Reddit 上津津乐道的模型。它与本指南中的那个产品并不相同。

Qwen-Audio-3.0-TTS 是较新的托管生成版本,通过 Alibaba Cloud Model Studio (Bailian) 提供,而不是以可下载权重的形式发布。它分为两个层级:

  • Plus — 以质量优先为核心的层级(可获得第 1 名排名),面向有声书、旁白和配音等对自然度比毫秒更重要的场景。
  • Flash — 以延迟优先为核心的层级,首包延迟约 300 毫秒,专为语音代理和实时助手等交互式实时场景打造。

同一排行榜上的代际差距十分明显:较早的 Qwen3 TTS Flash 以 929 的 Elo 分数位列其中(大约第 76 名),而新的 Plus 级别则以 1,237 领先。虽然同属一个品牌谱系,但模型等级却不同。

这两者的用途也不同。如果你在它们之间做选择,可以这样区分:

Qwen3-TTS (开放权重)Qwen-Audio-3.0-TTS (托管)
获取方式下载权重(GitHub / Hugging Face)通过 Alibaba Cloud Model Studio 的 API
自行托管 / 本地运行否 — 仅托管
ComfyUI & 社区节点
档位单一开放系列Plus(高质量)/ Flash(约 300 毫秒)
语言覆盖约 10 种语言16 种语言 + 20 种中文方言
Arena 质量 Elo约 929(Qwen3 TTS Flash)1,237(Plus,#1)
最适合本地控制、数据驻留、折腾调试顶级质量、方言、规模化生产

当托管控制或零边际成本最重要时,选择开源权重系列;当质量、方言覆盖范围,或无需自行运行 GPU 更重要时,选择托管的 3.0 套餐。

赢得该排名的基准测试

Artificial Analysis 对战场是由独立第三方运行的盲测、以人类偏好为基础的排名:听众在不知道是哪种模型生成片段的情况下进行比较,而 Elo 分数反映了每个模型获胜的频率。

截至 2026 年 7 月 20 日,以下是竞技场顶部:

排名模型质量 EloAPI 价格 / 100万字符
1Qwen-Audio-3.0-TTS-Plus (Alibaba)1,237$27.6
2Simba 3.2 (SpeechifyAI)1,232$10.0
3Gemini 3.1 Flash TTS (Google)1,211$18.3
4Sonic 3.5 (Cartesia)1,211$49.0
8MiniMax Speech 2.8 HD1,180$100.0
11ElevenLabs Eleven v31,173$100.0

阿里巴巴自报的指标也指向同样的结论,与独立排名一致。在多语言 CV3-Eval 基准上,厂商报告 Plus 档的平均词/字符错误率为 3.96,Flash 档为 3.87——这意味着合成语音回转成文本时,其准确度几乎与源文本相当。说话人相似度用于衡量克隆语音与参考语音的接近程度,据报告 Plus 在全部 16 种测试语言中的得分为 82.75。这两个数字是阿里巴巴自家的;上面的 Elo 不是。请将任何单一基准都视为起点,并在你自己的音频上进行测试。

它的优点

该排名来自在生产环境中至关重要的四项能力,详见 Qwen-Audio-3.0-TTS 官方技术页面

Qwen-Audio-3.0-TTS capability overview and CV3-Eval results

自由风格指令控制。 你可以用通俗语言来引导语音——“把这段读得像一位焦虑的深夜电台主持人,结尾处放慢一点”——涵盖角色、情绪、说话风格、语速、音色和口音。对于这些大方向,不需要额外学习一套独立的标记语言。

细粒度行内标签。 为了实现精确控制,模型会读取直接放在文本中的 86 个行内标签,其中包括笑声、呼吸、咳嗽和叹息等非语言事件。这就是平铺式朗读与表演之间的区别,也正是使该模型可用于游戏对话、叙述和电影配音的原因。

语言和方言覆盖广度。它涵盖 16 种语言——其中 7 种为新加入,包括阿拉伯语、印度尼西亚语、葡萄牙语、泰语、越南语、马来语和塔加洛语——以及 20 个中文方言地区,从粤语和上海话到四川话和东北话。对于面向东南亚或中国市场各地区发布产品的团队而言,这种方言覆盖在其他地方很难匹敌。

鲁棒性和输出质量。它可从嘈杂、带有混响或不清晰的参考音频中克隆声音,无需单独的降噪步骤,可在单次生成中合成长达三分钟的长篇旁白,并输出 48 kHz 音频(48 kHz 的控制台发布计划于 7 月 24 日进行)。三分钟单次生成之所以重要,是因为将较短片段拼接起来时,韵律和音色通常会发生漂移。

定价:高品质,无高价账单

文本转语音按输入文本的字符数计费,因此成本会直接随着你朗读的内容多少而变化。

每百万字符 $27.6 的价格,Qwen-Audio-3.0-TTS-Plus 仅为它所超越的两个传统高端品牌的一小部分:ElevenLabs Eleven v3 和 MiniMax Speech 2.8 HD 的标价都是每百万字符 $100,约高出 3.6 倍。按实际工作量计算,一部 100,000 字符的有声书(大致相当于一部短篇小说)在 Plus 上的费用约为$2.76,而在这两款产品上则约为$10

不过,Plus 并不是整体上最便宜的选项。有两个质量稍低一档的模型比它更便宜:Gemini 3.1 Flash TTS 的价格为每百万字符 18.3 美元(排名第 3),Simba 3.2 为 10 美元(排名第 2,Elo 几乎持平)。因此,更准确的表述应当是:Qwen 以中等价位提供顶尖排名的质量,而不是全场最低价。如果几个 Elo 点数对你的使用场景无关紧要,你就可以花更少的钱。(公开竞技场列出了 Plus 的定价;Flash 的每字符费率在那里尚未公布,所以请在控制台查看实时的 Flash 数值。)

如何使用 Qwen-Audio-3.0-TTS

直接路径是 Alibaba Cloud Model Studio(Bailian),其请求格式和 SDK 见 Model Studio documentation:先申请一个 API key,然后通过 model-market endpoint 调用 qwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flash 模型。一个合理的起点是先在 Flash 上做原型,看看它的延迟是否合适,再用 Plus 运行相同的脚本并进行比较——合适的层级取决于你的用例是实时交互,还是听众从头到尾听完的旁白。

已经通过像 AIReiter 这样的兼容聚合器接入多个提供商、以便在一个平台上统一计费的团队,可以直接在那儿添加它,而不必单独开通一个 Alibaba 账户;如果这只是你唯一需要的模型,直接使用则最简单。

如果你需要实时对话而不是一次性朗读,那么 TTS 模型只是其中一层——与之配套的 omni Realtime API 和 streaming ASR 已在 Qwen Audio 3 Realtime guide 中介绍。

你应该使用它吗?

  • 选择 Plus 如果你生成中文、方言或多语言旁白、有声书或配音,并且希望以每美元获得最高的自然度。
  • 选择 Flash 如果你正在构建一个实时语音代理,而约 300 ms 的首包时间比最后几分 Elo 质量更重要。
  • 看看 Gemini 3.1 Flash TTS 或 Simba 3.2 如果成本是决定性因素,并且接近顶级的质量就足够了——两者都比 Plus 更便宜。
  • 如果你依赖 ElevenLabs 或 Cartesia 更成熟的 SDK、更大的预置语音库,或以英语为先的工具和生态系统,那么就继续使用它们;无论竞技场排名如何,它们在这些方面仍然领先。

在这里比较的模型中,#1 竞技场排名、20 个中文方言地区以及 $27.6/M 定价的组合只有 Plus 提供——这就是为什么,如果这种组合适合你的使用场景,那么在最终决定之前,值得先把你自己的脚本通过它跑一遍,而不是盲目相信排名。

常见问题

Qwen-Audio-3.0-TTS 是免费的吗?

不——托管的 Plus 和 Flash 套餐是付费的,通过 Alibaba Cloud Model Studio 按字符计费,Plus 的价格为每百万字符 27.6 美元。Alibaba Cloud 会不定期提供免费试用额度,因此请在控制台中查看您所在地区当前是否有优惠。开源权重的 Qwen3-TTS 可免费自行托管。

Qwen-Audio-3.0-TTS 是开源的吗?我可以下载它吗?

托管的 Qwen-Audio-3.0-TTS-Plus/Flash 层级并非以权重形式分发。开源模型是更早的 Qwen3-TTS 系列,可在 GitHub 和 Hugging Face 上获取,用于本地使用、克隆以及 ComfyUI 工作流。它们彼此相关,但属于不同的发布版本。

它支持声音克隆吗?

是的。它会根据参考音频克隆目标声音,并且经过专门调优,即使参考音频存在噪声或混响也能保持效果——无需单独的清理步骤。Plus 版本在 16 种语言中的说话人相似度平均为 82.75。

Qwen-Audio-3.0-TTS 与 Qwen3-TTS-Flash —— 有什么区别?

Qwen3-TTS-Flash 属于较早的开放权重一代,在竞技场中的排名要低得多(Elo 约 929)。Qwen-Audio-3.0-TTS 是新一代托管版本;其 Flash 级别面向低延迟,而 Plus 级别则在质量排名中位居榜首,Elo 达到 1,237。

有演示或 ComfyUI 支持吗?

开源权重的 Qwen3-TTS 提供公开的 Hugging Face 演示和社区 ComfyUI 节点。托管的 Qwen-Audio-3.0-TTS 分级服务可通过阿里云 Model Studio 控制台访问,而不是通过独立的演示页面。