2026 年 7 月,阿里巴巴的 Qwen-Audio-3.0-TTS-Plus 以 1,237 的 Quality Elo 登上 Artificial Analysis Text-to-Speech arena 榜首,超过 Google Gemini 3.1 Flash TTS、MiniMax Speech 2.8 HD 和 ElevenLabs Eleven v3。它的公开价格为每百万字符 $27.6,约为它所超越的 ElevenLabs 和 MiniMax 相应档位价格的三分之一。它并非榜单中最便宜的模型,但没有其他模型能同时给出第一的质量排名和这个价位。(数据截至 2026 年 7 月 20 日;厂商排名和价格变动频繁,做方案前请自行确认。)
下面从模型定位、登顶依据、价格,以及它适合和不适合哪些场景几个方面展开。
别把它和 Qwen3-TTS 搞混
搜索“Qwen audio 3.0 TTS”时,很多结果实际上会指向更早发布的开源语音模型家族 Qwen3-TTS。阿里巴巴已将其发布在 GitHub,并提供了 Hugging Face demo。人们通常在本地运行它、接入 ComfyUI,也常在 Reddit 上讨论它的声音克隆能力。但这不是本文要讲的产品。
Qwen-Audio-3.0-TTS 是更新一代的托管服务,只能通过 Alibaba Cloud Model Studio (Bailian) 调用,而不是下载模型权重。它分为两个档位:
- Plus:追求成品音质——Arena 榜首对应的就是这一档,面向有声书、旁白和配音等自然度优先、对毫秒级延迟不那么敏感的场景。
- Flash:优先降低延迟——首包延迟约 300 ms,适合语音智能体、实时助手等交互类应用。
从同一份榜单就能看出代际差距:较早的 Qwen3 TTS Flash Elo 为 929 左右,排名约第 76;新 Plus 档则以 1,237 领跑。品牌脉络相同,模型能力却不在一个量级。
两者的适用任务也不同。若你正在二选一,可以这样看:
| Qwen3-TTS(开放权重) | Qwen-Audio-3.0-TTS(托管服务) | |
|---|---|---|
| 获取方式 | 下载权重(GitHub / Hugging Face) | 通过 Alibaba Cloud Model Studio API 调用 |
| 自托管 / 本地运行 | 可以 | 不可以,仅提供托管服务 |
| ComfyUI 与社区节点 | 支持 | 不支持 |
| 档位 | 单一开放模型家族 | Plus(质量)/ Flash(约 300 ms) |
| 语言覆盖 | 约 10 种语言 | 16 种语言 + 20 个中文方言区域 |
| Arena Quality Elo | 约 929(Qwen3 TTS Flash) | 1,237(Plus,第一名) |
| 更适合 | 本地控制、数据驻留、动手折腾 | 追求顶级质量、方言覆盖和规模化生产 |
最在意部署控制权或零边际成本,就选开放权重路线;更重视质量、方言广度,或不想自己维护 GPU,则更适合托管的 3.0 档位。
它为何能登顶:看懂这项基准测试
Artificial Analysis arena 是独立第三方运营的盲测真人偏好榜。听众不知道音频由哪家模型生成,只比较不同片段;Elo 分数反映的是一个模型相对其他模型获胜的频率。
截至 2026 年 7 月 20 日,榜单前列如下:
| 排名 | 模型 | Quality Elo | API 价格 / 100 万字符 |
|---|---|---|---|
| 1 | Qwen-Audio-3.0-TTS-Plus (Alibaba) | 1,237 | $27.6 |
| 2 | Simba 3.2 (SpeechifyAI) | 1,232 | $10.0 |
| 3 | Gemini 3.1 Flash TTS (Google) | 1,211 | $18.3 |
| 4 | Sonic 3.5 (Cartesia) | 1,211 | $49.0 |
| 8 | MiniMax Speech 2.8 HD | 1,180 | $100.0 |
| 11 | ElevenLabs Eleven v3 | 1,173 | $100.0 |
阿里巴巴公布的自测指标也指向相近结论。在多语言 CV3-Eval 基准中,厂商报告 Plus 的平均词/字符错误率为 3.96,Flash 为 3.87,也就是说,合成语音被转写回来时,内容与原文几乎一致。衡量克隆音色与参考音频接近程度的说话人相似度方面,Plus 在测试的全部 16 种语言中达到 82.75。这两项数据来自阿里巴巴自身,前面的 Elo 则不是。任何单项基准都只能作为起点,最终仍应拿自己的音频和脚本实测。
实际能力:强在哪里
根据官方 Qwen-Audio-3.0-TTS 技术页面,它的生产力主要来自四项能力。
自然语言指令控制。你可以直接用日常语言塑造声音,例如“用焦虑的深夜电台主持人口吻念这段话,结尾放慢一些”。角色、情绪、说话风格、语速、音色和口音都能控制,无须先学习一套专门的标记语言。
文本内联标签细调。需要精细控制时,模型能识别直接写进文本的 86 种内联标签,包括笑声、呼吸、咳嗽和叹气等非语言事件。这正是平铺直叙与带表演感朗读之间的差别,也让它能用于游戏台词、旁白和影视配音。
语言和方言覆盖广。它支持 16 种语言,其中新增了 7 种,包括阿拉伯语、印度尼西亚语、葡萄牙语、泰语、越南语、马来语和他加禄语;同时覆盖 20 个中文方言区域,从粤语、上海话到四川话、东北话都有涉及。对于面向东南亚或多个中文市场发布产品的团队,这样的方言覆盖并不容易在其他方案中找到。
复杂素材下的稳定性与输出质量。即便参考音频带有噪声、混响或本身不够清晰,它也能克隆声音,无须额外进行降噪;长篇旁白可一次合成最长三分钟,输出音频为 48 kHz(控制台的 48 kHz 支持计划于 7 月 24 日上线)。三分钟单次生成很重要,因为将短音频拼接起来时,韵律和音色往往最容易漂移。
价格不低到极致,但顶级质量不必付顶级账单
文本转语音通常按输入文本的字符数计费,因此成本会随旁白文本量直接增长。
每百万字符 $27.6 的 Qwen-Audio-3.0-TTS-Plus,价格仅是它所超越的两大传统高端方案的一部分:ElevenLabs Eleven v3 与 MiniMax Speech 2.8 HD 均为每百万字符 $100,约为 Plus 的 3.6 倍。换算到实际项目,一本 100,000 字符的有声书——约相当于一部短篇小说——在 Plus 上约为 $2.76,而在后两者上约为 $10。
不过,Plus 并不是整体最便宜的选择。有两款质量稍低一档的模型价格更低:Gemini 3.1 Flash TTS 每百万字符 $18.3,排名第 3;Simba 3.2 每百万字符仅 $10,排名第 2,与 Plus 的 Elo 非常接近。因此更准确的说法是:Qwen 以中档价格提供了榜首质量,而不是提供了榜单最低价。如果业务不在意少数几个 Elo 分差,确实可以花得更少。(公开 Arena 目前列出了 Plus 的价格;Flash 的按字符价格尚未公布,请到控制台查看实时价格。)
如何使用 Qwen-Audio-3.0-TTS
最直接的入口是 Alibaba Cloud Model Studio (Bailian)。请求格式和 SDK 可参考 Model Studio documentation:创建 API key 后,通过模型市场端点调用 qwen-audio-3.0-tts-plus 或 qwen-audio-3.0-tts-flash。一个合理的起步方式是先用 Flash 做原型,确认延迟是否符合预期,再用同一批脚本测试 Plus 并做对比。最终选哪个档位,取决于你的应用是实时交互,还是供用户从头听到尾的旁白内容。
如果团队已通过兼容聚合平台——例如 AIReiter——接入多个服务商,希望在同一处管理账单,也可以在那里添加该模型,无须单独开通阿里巴巴账户;如果你只需要这一款模型,直接接入通常最简单。
如果你的需求是实时对话,而不是一次性生成旁白,TTS 只是其中一层;与之配套的 omni Realtime API 和流式 ASR,可参考 Qwen Audio 3 Realtime guide。
该不该选它?
- 选择 Plus:如果你要生成中文、方言或多语言旁白、有声书和配音,并希望以较高性价比获得最自然的效果。
- 选择 Flash:如果你在构建实时语音智能体,约 300 ms 的首包延迟比质量上最后几个 Elo 分数更重要。
- 考虑 Gemini 3.1 Flash TTS 或 Simba 3.2:如果成本是决定性因素,而接近顶尖的质量已足够,两者都比 Plus 更便宜。
- 继续使用 ElevenLabs 或 Cartesia:如果你依赖其成熟 SDK、更大的预置音色库,或以英语为中心的工具链和生态;这些方面它们仍有优势,不受 Arena 排名影响。
在本文比较的模型中,第一的 Arena 排名、20 个中文方言区域和 $27.6/M 定价这三项组合,只有 Plus 同时具备。如果这正是你的应用所需,与其完全相信榜单,不如先拿自己的脚本跑一遍,再决定是否投入使用。
常见问题
Qwen-Audio-3.0-TTS 免费吗?
不免费。托管的 Plus 和 Flash 都是付费档位,通过 Alibaba Cloud Model Studio 按字符计费;Plus 为每百万字符 $27.6。Alibaba Cloud 曾不定期提供免费试用额度,请在控制台查看你所在地区当前的优惠。开放权重的 Qwen3-TTS 可免费自行托管。
Qwen-Audio-3.0-TTS 是开源的吗?可以下载吗?
托管的 Qwen-Audio-3.0-TTS-Plus/Flash 不提供模型权重下载。开源的是更早的 Qwen3-TTS 家族,可通过 GitHub 和 Hugging Face 用于本地运行、声音克隆和 ComfyUI 工作流。两者有关联,但属于独立发布的产品。
它支持声音克隆吗?
支持。它可根据参考音频克隆目标声音,并针对有噪声或混响的参考素材进行了优化,无须额外清理步骤。Plus 在 16 种语言上的平均说话人相似度为 82.75。
Qwen-Audio-3.0-TTS 和 Qwen3-TTS-Flash 有什么区别?
Qwen3-TTS-Flash 属于较早的开放权重一代,在 Arena 上排名低得多,Elo 约为 929。Qwen-Audio-3.0-TTS 是新一代托管服务:Flash 档面向低延迟,Plus 档则以 1,237 Elo 登顶质量榜单。
有演示页面或 ComfyUI 支持吗?
开放权重的 Qwen3-TTS 有公开的 Hugging Face 演示页面和社区 ComfyUI 节点。托管的 Qwen-Audio-3.0-TTS 档位则通过 Alibaba Cloud Model Studio 控制台访问,并没有独立的演示页面。