Qwen3.8 开放权重:发布日期、爆料与预期内容

最后更新: 2026-07-20 03:25:32

阿里巴巴在 X 上的官方 Qwen 账号于 2026 年 7 月 19 日宣布了 Qwen3.8-Max-Preview,并表示开源权重“即将推出”,但没有给出日期。所以你今天能试用的这个模型是一个托管预览版,而不是可下载版本。开源权重的发布才是人们真正等待的东西,而目前时间线相互矛盾,标题中的 2.4 万亿参数数字掩盖了真正重要的那个数字。已确认的细节很少,泄露的时间线指向三个不同方向,而决定实际成本的那个数字至今根本没有公布。

Qwen3.8-Max-Preview 实际上是什么

Qwen3.8-Max-Preview 是阿里巴巴下一代旗舰产品的托管早期访问版本。阿里巴巴的 Qwen 账号将其描述为一个拥有 2.4 万亿参数的全模态模型(将文本、图像等整合于一个模型中),并将其定位为“仅次于”Anthropic 的 Claude Fable 5。

您现在可以测试它,但仅限于特定场景:阿里云的 Token Plan 订阅,以及 Qoder 和 QoderWork 智能代理平台。它并不是免费 Qwen Chat 网页应用中的默认选项,后者仍会加载上一代的 Qwen3.7-Plus。

Qwen Chat web app showing Qwen3.7-Plus as the default model, not Qwen3.8

“预览”在这里是字面意义上的警告。阿里巴巴表示,在预览期间,该模型的能力会持续变化,因此你今天看到的任何分数或行为,在权重发布前都可能发生变化。

“Kaleb” 隐蔽测试让它察觉到了这一点

这个预览并非凭空出现。在正式发布之前,X 上的测试者就曾指出,Qwen3.8-Max 一直以隐秘代号“Kaleb”在 LMArena 的公开模型对比竞技场中运行。实验室会使用匿名代号,在为模型贴上自家品牌之前收集盲测的一对一投票。

这一细节之所以重要,原因在于:关于该模型在前端代码生成方面表现强劲的早期热议,源自那些盲测的 Kaleb 对战,而不是阿里巴巴的营销。这几乎是目前能找到的最接近第三方信号的证据,不过还没有人发布归档的 Kaleb 结果来确认其身份,所以应将其视为一个强烈的社区说法,而不是确凿证据。

Qwen3.8 开放权重什么时候发布?

目前流传着三条不同的时间线,而且它们并不一致:

来源声称的时间表
Alibaba Qwen,X 上的官方帖子“Open-weight soon,” 未注明日期
X 上的发布日泄露帖子到 2026 年 7 月底全球推出
Reddit r/Qwen_AI(转述,巴黎会议上的阿里巴巴员工)2026 年 8 月

“Soon”、“7月底”和“8月”不是同一个承诺。7月底的说法来自 X 上的首发日爆料帖子。8月这个时间则是 Reddit 上转述的一名阿里巴巴员工评论,应当将其视为三者中最不确定的说法。

还有一个业绩记录问题。阿里巴巴最近的两个旗舰 Max 模型在首发当天都没有发布 open weights,而上一代在发布后一段时间内也一直保持封闭。附加在预览版上的开源权重承诺只是一个承诺,不是一次发布。

相比之下,Moonshot 为其竞争产品 Kimi K3 的权重附上了一个具体的日历日期,而不是含糊的“soon”。确切日期和硬件计算详情见我们的 Kimi K3 open weights 解析。Qwen3.8 目前还没有对应的明确硬日期。

2.4T 这个数字并不是关键

“2.4 万亿参数”是最引人注目的数字,但对于 mixture-of-experts(MoE)模型来说,它也是最没用的一个。MoE 模型只会将每个 token 路由通过其总参数中的一小部分,即每个 token 的“活跃参数”,因此总参数量几乎无法告诉你有关速度或服务成本的任何信息。

阿里巴巴尚未公布激活参数数量。在此之前,你无法估算运行该模型的成本、它的速度有多快,或自托管副本需要什么硬件。2.4T 的总参数量在每个 token 上可能激活从数百亿到两千亿级参数不等,而这些不同情况的成本影响差异很大。

对于任何计划自托管的人来说,这无疑是最重要的缺口。一位 X 上的测试者开玩笑说,要运行 4-bit 量化版本可能需要几张 RTX 6000 Pro 显卡,而在可激活参数数量和实际权重文件出现之前,这仍只能靠猜测。

早期测试者实际看到的内容

由于预览已上线,第一手反馈已经出现,而且在基准测试与实际使用之间出现了明显分化。

在基准测试方面,社区报告的 KingBench 3 数据显示,Qwen3.8-Max 的表现高于 Opus 4.8 和 Kimi K3,只有 Fable 5 领先。一位在 X 上以 @Leo_R_UK 发帖的开发者表示,通过直接 API 运行的六任务编码代理套件得分为 59/60,这是他们记录过的最高结果。

Community-reported KingBench 3 scores placing Qwen3.8-Max-Preview second behind Claude Fable 5

将该图表视为供应商和社区宣称的,而非已验证的。阿里巴巴没有发布任何官方基准测试表,因此这里的每个数字要么是其自身的声明,要么是基于小样本的用户运行评估。

现实中的反馈更让人觉得酷。X 上的 @synthwavedd 和 @VoltraceGG 等测试者表示,这个模型在日常 agent 工作中的表现感觉比它的分数低一个档次。有人形容它在实际使用中落后于 Kimi K3,尽管基准测试成绩领先;还有人做了私下评测,结果显示它“离 Fable 5 甚至一点都不接近”。一个常见的评价是:它很快,有时快得可疑,而且它在 frontend-design 方面的输出大致处于 GLM-5.2 的水平,而不是最前沿。等 weights 开放、任何人都能复现这些测试后,真正值得关注的就是这种榜单成绩与实际体验之间的差距。

如何判断权重何时是真实的

“Soon”将通过具体产出变成“已发布”,而不是又一则公告。在把 Qwen3.8 视为一个你可以基于其构建的开权重模型之前,请关注以下所有内容:

  • 一则官方 Alibaba/Qwen 发布公告,指向可下载内容,而不只是“即将发布”的帖子。
  • 一个在 Alibaba 的 Qwen 组织下、包含实际权重文件的 Hugging Face 仓库,以及你已经阅读过的许可证文件(开放权重和开源许可证并不是一回事)。
  • 一份列出激活参数、上下文长度和模态,而不只是 2.4T 总量的 model card。
  • 来自第三方基准测试,由不是 Alibaba 的人执行,并且基于已发布的权重而不是预览版运行。
  • 托管版本的稳定 API 定价,这样你就可以将每 token 成本与 Kimi K3 和 Claude 进行比较。

如果你今天正在选择一个要基于其构建的模型,我们关于最适合编程的开源 LLM的综述涵盖了那些权重已经可以下载的选项。一旦 Qwen3.8 的权重和稳定 API 上线,它也将能够通过与 Anthropic 兼容的 API 网关(如 AIReiter)与其他前沿模型一起访问,因此你可以将它与你当前的模型进行 A/B 测试,而无需重写你的集成。

常见问题

Qwen 是开源权重的吗?

早期的 Qwen 模型已经发布了开放权重,但每次发布都是一个单独的决定。Qwen3.8 的权重已承诺公开,但尚未发布,而阿里巴巴最近两款旗舰在发布时仍保持封闭,因此“Qwen 是开放的”并不自动适用于 3.8。

Qwen3.8 可以免费使用吗?

现在还不行。Qwen3.8-Max-Preview 目前位于阿里云的付费 Token Plan 和 Qoder 平台之后。免费的 Qwen Chat 应用仍然运行较旧的 Qwen3.7-Plus。

Qwen3.8 比 DeepSeek 或 Claude 更好吗?

在社区报告的 KingBench 3 分数中,Qwen3.8-Max 略胜 Opus 4.8,但落后于 Fable 5。不过,这些都只是未经验证的说法,而且有几位测试者发现,它在真实世界中的 agent 表现低于其基准排名。目前还没有针对 DeepSeek V4 或 Claude 的独立正面对比,因为权重尚未发布。

Qwen3.8 开放权重版本的发布日期是什么时候?

阿里巴巴只说了“很快”。上线当天的泄露信息指向 2026 年 7 月下旬发布,而一则二手 Reddit 报告则暗示为 8 月。阿里巴巴尚未确认任何确切日期。