AIREITER

Qwen3.8 LiveTranslate API 定价与 WebSocket 接入指南

最后更新: 2026-09-18 18:55:17

如果一个实时翻译器能在约 2.3 秒内给出回应,听起来已经足以进入会议室了。Qwen3.8-LiveTranslate 目前确实可以使用,但它只能通过 Alibaba Cloud/Model Studio 的托管 API 调用;所谓 2.3 秒是官方宣称,并非独立的生产环境实测结果。对预算和部署方案来说,这个区别非常关键。

30 秒决定是否值得买

如果你需要通过实时连接完成流式语音翻译、字幕生成和音频输出,Qwen3.8-LiveTranslate适合拿来做有保护措施的原型验证。但不要把宣传中的延迟当成噪杂会议、多人抢话或所有语言组合下的保证:目前针对这一具体版本的独立实测证据仍然有限。

对于能够将 API 密钥安全保存在后端,并且可以接受区域相关 Alibaba Cloud 部署方式的服务,它是一个合理的选择。如果你需要可下载的模型权重、成熟的第三方托管生态,或者在制定生产要求前就拿到经过验证的准确率基准,那么它目前并不适合。

现在到底能用什么

官方托管模型 ID 是 qwen3.8-livetranslate-flash-realtime。Alibaba Cloud 官方文档和 Model Studio 更新日志将其列为一项于 2026 年 9 月 17 日发布的实时服务。官方模型页面显示,它支持识别 60 种源语言,并支持 29 种语音输出语言。

问题当前答案
已经发布了吗?是,以托管 API 模型形式提供
模型 IDqwen3.8-livetranslate-flash-realtime
主要传输方式Realtime API,包括 WebSocket
输入音频和图像上下文
输出文本和音频,具体取决于会话配置
官方延迟宣称端到端约 2.3 秒
开放权重未找到官方证据

因此,这次发布已经比产品预告更具体,但它仍然不等于开放模型下载。官方文档提供的是通过 Model Studio 进行推理访问,而不是本地模型检查点。

Qwen3.8 LiveTranslate 官方模型页面

写代码之前,先算清成本

对于国际版/新加坡部署,官方价格表将计费拆成四类,价格均按每 100 万 token 计算:

计费项官方价格
音频输入$7.50 / 1M tokens
图像输入$0.55 / 1M tokens
文本输出$20 / 1M tokens
音频输出$30 / 1M tokens

Qwen 的实时翻译指南显示,音频输入按每秒 7 个 token 计算,音频输出按每秒 12.5 个 token 计算。对于持续音频流,可以先这样估算输入和音频输出成本:

  • 60 秒音频输入:420 个 token,按当前音频输入价格计算约为 $0.00315
  • 生成 60 秒音频输出:750 个 token,按当前音频输出价格计算约为 $0.0225

这还不能算完整的“每分钟成本”。其中不包括文本输出、图像输入、连接行为,也没有考虑译文音频可能比源音频更长或更短。只请求文本输出时,计费项也会发生变化。实际使用前,应以你所选区域和部署方式对应的官方模型价格页面为准。

Qwen Model Studio 价格参考

真正关键的 WebSocket 接入路径

官方文档给出的集成方式是服务端实时会话,而不是普通的一次性翻译请求。官方 Realtime API 概览将 WebSocket 列为服务端应用和原型项目中较直接的方案。

一个最小实现大致包含以下步骤:

  1. 创建区域专属的实时 WebSocket URL,并将 qwen3.8-livetranslate-flash-realtime 指定为模型。
  2. 在握手阶段发送 Authorization: Bearer <API_KEY>;API 密钥必须保存在后端。
  3. 发送 session.update,配置源语言、目标语言和所需的输出模态。
  4. 通过 input_audio_buffer.append 持续发送 base64 音频。
  5. 提交音频缓冲区,或等待已配置的语音活动检测触发处理。
  6. 持续接收翻译文本和音频事件,直到本轮处理完成。

端点取决于工作区和区域,即使事件负载完全正确,直接复制其他部署的主机名也可能失败。实现会话配置、VAD、热词或手动提交时,应参考 LiveTranslate 客户端事件参考

适合哪些场景,又不适合哪些场景

工作负载适配度原因
受控直播流的实时字幕适合做原型流式音频和文本输出符合 API 的设计
双向应用的后端翻译适合,但需要测试WebSocket 可以保持会话,并支持返回音频
轮流发言清晰的小型会议有一定可行性实时翻译和说话人感知属于官方文档描述的定位
嘈杂、频繁打断的会议尚未验证目前没有独立证据衡量多人重叠发言、口音或噪声环境下的表现
高风险的医疗或法律口译不应默认选用现有证据无法证明其术语可靠性
本地/离线部署不适合官方发布形式是托管服务,而不是可下载模型

开源项目 AlbusWei/LiveTranslate 实现可以作为一个有价值的生态信号。其 README 介绍了单人翻译、文件配音和会议模式,并采用 WebRTC 优先、WebSocket 兜底的传输方式。这说明开发者可以围绕 Qwen 实时模型构建实用封装,但并不能证明 Qwen3.8 的准确率或生产环境可用性。

现有证据能说明什么,又不能说明什么

官方文档已经给出了明确的功能和价格信息,但独立测试仍是薄弱环节。社区讨论中,针对这一具体版本的帖子数量很少,也没有找到专门讨论 Qwen3.8-LiveTranslate 的实质性 Reddit 讨论。

一位真实用户对这次延迟变化的评价比较谨慎:

“2.3 秒还没有消失,但已经更接近人类能自然接话的节奏了。” — @WukongNumber1,X

这可以作为用户对延迟宣称的直观感受,但不能当作基准测试。另一个关于早期 Qwen 翻译体验的 Reddit 讨论同样意见不一:u/ReplacementTommy 写道:“说实话,在我用过的翻译工具里,Qwen AI 的准确度和自然度是最高的。”而 u/Valhall22 则表示,在英语、德语和法语测试中,Qwen 没有进入自己的前五名。这些评论既没有明确指向 Qwen3.8 实时模型,也不是受控测试,因此不能据此排出排名。

更准确的结论是:Qwen3.8-LiveTranslate 已经可以正式调用,计费方式有文档说明,实时架构也足够明确,可以开始开发。至于复杂语音环境下的准确率,仍然需要由使用方自行验证。

Qwen3.8 LiveTranslate API 常见问题

Qwen3.8 LiveTranslate 现在可以使用吗?

可以。Alibaba Cloud 文档将 qwen3.8-livetranslate-flash-realtime 列为 Model Studio 的托管 API 模型。现有证据没有显示它已经开放权重。

Qwen3.8 LiveTranslate 使用 WebSocket 吗?

使用。官方 Realtime API 和 LiveTranslate 事件参考文档介绍了 WebSocket 接入、身份验证、会话更新、音频缓冲区事件以及流式输出。

Qwen3.8 LiveTranslate 每分钟多少钱?

它没有统一的每分钟价格,因为音频输入、文本输出、音频输出和图像上下文分别使用不同计费项。按照文档中的每秒 7 个输入 token 和每秒 12.5 个输出 token 计算,在当前列出的国际版价格下,1 分钟音频输入约为 $0.00315,1 分钟生成音频约为 $0.0225;这还不包括文本和其他用量。

它能只返回文本、不返回翻译音频吗?

可以。会话可以配置输出模态,包括仅文本,或文本加音频。正式上线前,请以官方客户端事件文档中当前的事件名称为准。

它支持多少种语言?

官方模型信息列出 60 种可识别语言和 29 种语音输出语言。因此,音频输出语言数量少于可识别语言数量。

它能实时翻译视频吗?

该模型接受音频和图像上下文,并定位于视听翻译场景。但这并不意味着所有基于文件的视频配音流程都使用这一实时模型;Qwen 还为非实时音频/视频翻译提供了独立路径。

可以下载模型并在本地运行吗?

目前没有找到针对这一具体实时模型的官方开放权重版本。在 Qwen 发布独立检查点和许可证之前,应按托管推理方案进行规划。

实际建议:先做原型,并保留切换开关

Qwen3.8-LiveTranslate 值得做一次受控的 API 原型验证,但不值得在没有测试的情况下直接投入生产。上线前,至少要用自己的音频验证三件事:首次返回翻译结果所需的实际时间、包含人名和领域术语时的语言组合质量,以及静音、打断和重连场景下的行为。

建议通过配置开关控制模型,这样即使需要更换区域、传输方式或服务商,也不用重写整个应用。现阶段最稳妥的做法就是这样:API 接口和价格已经足够明确,可以开始构建;但噪声环境下的准确率和持续运行可靠性等最关键的生产问题,仍应交给你的测试计划,而不是发布公告来回答。

已核查来源