AIREITER
API 文档价格
模板
  • AIReiter
  • 博客
  • Qwen-Audio-3.0-TTS:登顶 Arena 的 TTS 模型

Qwen-Audio-3.0-TTS:登顶 Arena 的 TTS 模型

最后更新: 2026-07-22 07:45:26

2026 年 7 月,阿里巴巴的 Qwen-Audio-3.0-TTS-Plus 以 1,237 的 Quality Elo 登上 Artificial Analysis Text-to-Speech arena 榜首,超过 Google Gemini 3.1 Flash TTS、MiniMax Speech 2.8 HD 和 ElevenLabs Eleven v3。它的公开价格为每百万字符 $27.6,约为它所超越的 ElevenLabs 和 MiniMax 相应档位价格的三分之一。它并非榜单中最便宜的模型,但没有其他模型能同时给出第一的质量排名和这个价位。(数据截至 2026 年 7 月 20 日;厂商排名和价格变动频繁,做方案前请自行确认。)

Artificial Analysis Text-to-Speech leaderboard with Qwen-Audio-3.0-TTS-Plus ranked first

下面从模型定位、登顶依据、价格,以及它适合和不适合哪些场景几个方面展开。

别把它和 Qwen3-TTS 搞混

搜索“Qwen audio 3.0 TTS”时,很多结果实际上会指向更早发布的开源语音模型家族 Qwen3-TTS。阿里巴巴已将其发布在 GitHub,并提供了 Hugging Face demo。人们通常在本地运行它、接入 ComfyUI,也常在 Reddit 上讨论它的声音克隆能力。但这不是本文要讲的产品。

Qwen-Audio-3.0-TTS 是更新一代的托管服务,只能通过 Alibaba Cloud Model Studio (Bailian) 调用,而不是下载模型权重。它分为两个档位:

  • Plus:追求成品音质——Arena 榜首对应的就是这一档,面向有声书、旁白和配音等自然度优先、对毫秒级延迟不那么敏感的场景。
  • Flash:优先降低延迟——首包延迟约 300 ms,适合语音智能体、实时助手等交互类应用。

从同一份榜单就能看出代际差距:较早的 Qwen3 TTS Flash Elo 为 929 左右,排名约第 76;新 Plus 档则以 1,237 领跑。品牌脉络相同,模型能力却不在一个量级。

两者的适用任务也不同。若你正在二选一,可以这样看:

Qwen3-TTS(开放权重)Qwen-Audio-3.0-TTS(托管服务)
获取方式下载权重(GitHub / Hugging Face)通过 Alibaba Cloud Model Studio API 调用
自托管 / 本地运行可以不可以,仅提供托管服务
ComfyUI 与社区节点支持不支持
档位单一开放模型家族Plus(质量)/ Flash(约 300 ms)
语言覆盖约 10 种语言16 种语言 + 20 个中文方言区域
Arena Quality Elo约 929(Qwen3 TTS Flash)1,237(Plus,第一名)
更适合本地控制、数据驻留、动手折腾追求顶级质量、方言覆盖和规模化生产

最在意部署控制权或零边际成本,就选开放权重路线;更重视质量、方言广度,或不想自己维护 GPU,则更适合托管的 3.0 档位。

它为何能登顶:看懂这项基准测试

Artificial Analysis arena 是独立第三方运营的盲测真人偏好榜。听众不知道音频由哪家模型生成,只比较不同片段;Elo 分数反映的是一个模型相对其他模型获胜的频率。

截至 2026 年 7 月 20 日,榜单前列如下:

排名模型Quality EloAPI 价格 / 100 万字符
1Qwen-Audio-3.0-TTS-Plus (Alibaba)1,237$27.6
2Simba 3.2 (SpeechifyAI)1,232$10.0
3Gemini 3.1 Flash TTS (Google)1,211$18.3
4Sonic 3.5 (Cartesia)1,211$49.0
8MiniMax Speech 2.8 HD1,180$100.0
11ElevenLabs Eleven v31,173$100.0

阿里巴巴公布的自测指标也指向相近结论。在多语言 CV3-Eval 基准中,厂商报告 Plus 的平均词/字符错误率为 3.96,Flash 为 3.87,也就是说,合成语音被转写回来时,内容与原文几乎一致。衡量克隆音色与参考音频接近程度的说话人相似度方面,Plus 在测试的全部 16 种语言中达到 82.75。这两项数据来自阿里巴巴自身,前面的 Elo 则不是。任何单项基准都只能作为起点,最终仍应拿自己的音频和脚本实测。

实际能力:强在哪里

根据官方 Qwen-Audio-3.0-TTS 技术页面,它的生产力主要来自四项能力。

Qwen-Audio-3.0-TTS capability overview and CV3-Eval results

自然语言指令控制。你可以直接用日常语言塑造声音,例如“用焦虑的深夜电台主持人口吻念这段话,结尾放慢一些”。角色、情绪、说话风格、语速、音色和口音都能控制,无须先学习一套专门的标记语言。

文本内联标签细调。需要精细控制时,模型能识别直接写进文本的 86 种内联标签,包括笑声、呼吸、咳嗽和叹气等非语言事件。这正是平铺直叙与带表演感朗读之间的差别,也让它能用于游戏台词、旁白和影视配音。

语言和方言覆盖广。它支持 16 种语言,其中新增了 7 种,包括阿拉伯语、印度尼西亚语、葡萄牙语、泰语、越南语、马来语和他加禄语;同时覆盖 20 个中文方言区域,从粤语、上海话到四川话、东北话都有涉及。对于面向东南亚或多个中文市场发布产品的团队,这样的方言覆盖并不容易在其他方案中找到。

复杂素材下的稳定性与输出质量。即便参考音频带有噪声、混响或本身不够清晰,它也能克隆声音,无须额外进行降噪;长篇旁白可一次合成最长三分钟,输出音频为 48 kHz(控制台的 48 kHz 支持计划于 7 月 24 日上线)。三分钟单次生成很重要,因为将短音频拼接起来时,韵律和音色往往最容易漂移。

价格不低到极致,但顶级质量不必付顶级账单

文本转语音通常按输入文本的字符数计费,因此成本会随旁白文本量直接增长。

每百万字符 $27.6 的 Qwen-Audio-3.0-TTS-Plus,价格仅是它所超越的两大传统高端方案的一部分:ElevenLabs Eleven v3 与 MiniMax Speech 2.8 HD 均为每百万字符 $100,约为 Plus 的 3.6 倍。换算到实际项目,一本 100,000 字符的有声书——约相当于一部短篇小说——在 Plus 上约为 $2.76,而在后两者上约为 $10。

不过,Plus 并不是整体最便宜的选择。有两款质量稍低一档的模型价格更低:Gemini 3.1 Flash TTS 每百万字符 $18.3,排名第 3;Simba 3.2 每百万字符仅 $10,排名第 2,与 Plus 的 Elo 非常接近。因此更准确的说法是:Qwen 以中档价格提供了榜首质量,而不是提供了榜单最低价。如果业务不在意少数几个 Elo 分差,确实可以花得更少。(公开 Arena 目前列出了 Plus 的价格;Flash 的按字符价格尚未公布,请到控制台查看实时价格。)

如何使用 Qwen-Audio-3.0-TTS

最直接的入口是 Alibaba Cloud Model Studio (Bailian)。请求格式和 SDK 可参考 Model Studio documentation:创建 API key 后,通过模型市场端点调用 qwen-audio-3.0-tts-plus 或 qwen-audio-3.0-tts-flash。一个合理的起步方式是先用 Flash 做原型,确认延迟是否符合预期,再用同一批脚本测试 Plus 并做对比。最终选哪个档位,取决于你的应用是实时交互,还是供用户从头听到尾的旁白内容。

如果团队已通过兼容聚合平台——例如 AIReiter——接入多个服务商,希望在同一处管理账单,也可以在那里添加该模型,无须单独开通阿里巴巴账户;如果你只需要这一款模型,直接接入通常最简单。

如果你的需求是实时对话,而不是一次性生成旁白,TTS 只是其中一层;与之配套的 omni Realtime API 和流式 ASR,可参考 Qwen Audio 3 Realtime guide。

该不该选它?

  • 选择 Plus:如果你要生成中文、方言或多语言旁白、有声书和配音,并希望以较高性价比获得最自然的效果。
  • 选择 Flash:如果你在构建实时语音智能体,约 300 ms 的首包延迟比质量上最后几个 Elo 分数更重要。
  • 考虑 Gemini 3.1 Flash TTS 或 Simba 3.2:如果成本是决定性因素,而接近顶尖的质量已足够,两者都比 Plus 更便宜。
  • 继续使用 ElevenLabs 或 Cartesia:如果你依赖其成熟 SDK、更大的预置音色库,或以英语为中心的工具链和生态;这些方面它们仍有优势,不受 Arena 排名影响。

在本文比较的模型中,第一的 Arena 排名、20 个中文方言区域和 $27.6/M 定价这三项组合,只有 Plus 同时具备。如果这正是你的应用所需,与其完全相信榜单,不如先拿自己的脚本跑一遍,再决定是否投入使用。

常见问题

Qwen-Audio-3.0-TTS 免费吗?

不免费。托管的 Plus 和 Flash 都是付费档位,通过 Alibaba Cloud Model Studio 按字符计费;Plus 为每百万字符 $27.6。Alibaba Cloud 曾不定期提供免费试用额度,请在控制台查看你所在地区当前的优惠。开放权重的 Qwen3-TTS 可免费自行托管。

Qwen-Audio-3.0-TTS 是开源的吗?可以下载吗?

托管的 Qwen-Audio-3.0-TTS-Plus/Flash 不提供模型权重下载。开源的是更早的 Qwen3-TTS 家族,可通过 GitHub 和 Hugging Face 用于本地运行、声音克隆和 ComfyUI 工作流。两者有关联,但属于独立发布的产品。

它支持声音克隆吗?

支持。它可根据参考音频克隆目标声音,并针对有噪声或混响的参考素材进行了优化,无须额外清理步骤。Plus 在 16 种语言上的平均说话人相似度为 82.75。

Qwen-Audio-3.0-TTS 和 Qwen3-TTS-Flash 有什么区别?

Qwen3-TTS-Flash 属于较早的开放权重一代,在 Arena 上排名低得多,Elo 约为 929。Qwen-Audio-3.0-TTS 是新一代托管服务:Flash 档面向低延迟,Plus 档则以 1,237 Elo 登顶质量榜单。

有演示页面或 ComfyUI 支持吗?

开放权重的 Qwen3-TTS 有公开的 Hugging Face 演示页面和社区 ComfyUI 节点。托管的 Qwen-Audio-3.0-TTS 档位则通过 Alibaba Cloud Model Studio 控制台访问,并没有独立的演示页面。

>_AIReiter 模型目录

快速访问与本指南相关的模型 API

Gemini 3.1 Pro

Chat
Google获取 API Key >

Gemini 3 Pro

Chat
Google获取 API Key >

Gemini 3.6 Flash

Chat

一款用于高级推理、编程和智能体任务的快速 Gemini 模型。

Google获取 API Key >

Gemini 3.8 Flash

Chat

面向长上下文编码、智能体和企业工作流的 Flash 文本模型。

Google获取 API Key >

Claude Fable 5

Chat

一款用于深度推理和复杂长篇任务的高级 Claude 模型。

Anthropic获取 API Key >

最新文章

OpenRouter 美国区域内路由:设置方法与限制

2026-09-10

Civitai 替代方案:Hugging Face、Tensor.Art、SeaArt 与 ComfyUI

2026-09-10

Kling API 定价:官方成本与聚合平台对比(2026)

2026-09-10

OpenRouter Shell 工具与 Files API 指南(Beta)

2026-09-10
AIREITER

有问题?请联系我们
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

AI 视频

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

AI 图片

GPT-Image 2.5Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image Turbo

博客

查看全部 →

公司

隐私政策服务条款退款政策

© 2026 AIReiter。保留所有权利。