Qwen3.8 開放權重:發布日期、爆料與預期內容

最近更新: 2026-07-20 03:25:48

阿里巴巴在 X 上的官方 Qwen 帳號於 2026 年 7 月 19 日宣布了 Qwen3.8-Max-Preview,並表示 open weights「coming soon」,但沒有給出日期。因此,你今天可以試用的模型其實是託管預覽版,而不是可下載版本。大家真正等待的是 open-weight 版本的發布,而目前時間表彼此矛盾,標題上 2.4 兆參數的數字則掩蓋了真正重要的那個數字。已確認的細節很少,外流的時間表指向三個不同方向,而決定實際成本的那一個數字根本還沒有公布。

Qwen3.8-Max-Preview 實際上是什麼

Qwen3.8-Max-Preview 是 Alibaba 下一代旗艦模型的託管搶先體驗版本。Alibaba 的 Qwen 帳號將其描述為一個 2.4 兆參數、完全多模態的模型(將文字、圖像等整合於同一模型中),並將其定位為「僅次於」Anthropic 的 Claude Fable 5。

您現在可以試用它,但僅限於特定地方:Alibaba Cloud 的 Token Plan 訂閱,以及 Qoder 和 QoderWork 代理平台。它在免費的 Qwen Chat 網頁應用中並非預設,該應用程式目前仍載入上一代的 Qwen3.7-Plus。

Qwen Chat web app showing Qwen3.7-Plus as the default model, not Qwen3.8

「預覽」在這裡是字面上的警告。Alibaba 表示,該模型的能力在預覽期間會持續變化,因此你今天看到的任何分數或行為,都可能在權重正式發布前有所改變。

讓它察覺到的「Kaleb」隱蔽測試

這次預覽並非憑空出現。在正式揭曉之前,X 上的測試者就曾指出,Qwen3.8-Max 一直以隱密代號「Kaleb」在 LMArena 的公開模型比較競技場上運行。實驗室會使用匿名代號來收集盲測的一對一投票,之後才將自家品牌名稱掛到模型上。

這個細節之所以重要,只有一個原因:外界早期對這個模型在前端程式碼生成方面表現出色的熱議,源自那些盲測的 Kaleb 對戰,而不是阿里巴巴的行銷。到目前為止,這是最接近第三方訊號的證據,不過還沒有人公開存檔的 Kaleb 結果來確認其身分,因此應將其視為社群中的強烈主張,而非證明。

Qwen3.8 開放權重何時發布?

目前流傳著三個不同的時間線,而且它們彼此並不一致:

來源聲稱時間表
Alibaba Qwen,X 上的官方貼文「Open-weight soon,」未提供日期
X 上的發佈日爆料貼文2026 年 7 月底前全球推出
Reddit r/Qwen_AI(轉述,自巴黎會議上的 Alibaba 員工)2026 年 8 月

「Soon」、「7 月底」和「8 月」不是同一個承諾。7 月底的說法來自 X 上發表的上市當天爆料貼文。8 月這個說法則是 Reddit 上轉述的阿里巴巴員工評論,應視為三者中最不具確定性的說法。

此外還有一個記錄問題。Alibaba 最近兩代旗艦 Max 模型在第一天都沒有以開放權重形式發布,而上一代在上市後也曾封閉了一段時間。附帶在 preview 上的開放權重承諾,只是承諾,不是發布。

作為對比,Moonshot 為其競爭對手 Kimi K3 權重附上了具體的日曆日期,而不是模糊的「soon」。確切日期與硬體計算詳見我們的 Kimi K3 open weights 分析。Qwen3.8 目前還沒有對應的確定日期。

2.4T 這個數字不是重點

「2.4 兆個參數」是最醒目的數字,但對於專家混合(MoE)模型來說,這卻是最沒用的一個。MoE 模型會將每個 token 只路由ผ่าน其總參數的一小部分,也就是每個 token 的「啟用參數」,因此總參數量幾乎無法告訴你速度或服務成本的任何資訊。

Alibaba 尚未公布 active-parameter count。直到它公布之前,你無法估算這個模型的運行成本有多高、速度會有多快,或自架部署的副本需要什麼硬體。2.4T 的總參數量,每個 token 可能啟用從數百億到兩千億左右的參數,而這些情境各自對成本的影響都非常不同。

這是任何計劃自行架設者最重要的缺口。有位 X 上的測試者開玩笑說,可能需要好幾張 RTX 6000 Pro 顯卡才能執行 4-bit 量化版本,而在實際的啟用參數數量與真正的權重檔案出現之前,這仍然只能靠猜測。

早期測試者實際看到的是什麼

由於預覽已經上線,第一手反應也已經出現,而且在基準測試與實際使用之間出現了明顯分歧。

在基準測試方面,社群回報的 KingBench 3 數據顯示,Qwen3.8-Max 高於 Opus 4.8 和 Kimi K3,只有 Fable 5 領先。一位在 X 上以 @Leo_R_UK 發文的開發者表示,透過 direct API 執行的六項 coding-agent 套件測試拿下 59/60,這是他們記錄過的最高成績。

Community-reported KingBench 3 scores placing Qwen3.8-Max-Preview second behind Claude Fable 5

將該圖表視為供應商與社群聲稱的內容,而非已驗證。Alibaba 尚未發布任何官方基準測試表,因此此處的每個數字要不是其自身的宣稱,就是使用者在小型樣本上進行的評估。

實際世界的報告更酷。像 @synthwavedd 和 @VoltraceGG 這些在 X 上的測試者表示,這個模型在日常 agent 工作中的感受,比它的分數低了一個檔次。有人形容,儘管基準測試領先,但在實際使用中它仍落後於 Kimi K3,其他人也做了私人評測,結果顯示它和 Fable 5「連遠遠都稱不上接近」。一個常見的評語是:它很快,有時快得可疑,而且它的 frontend-design 輸出大致落在 GLM-5.2 的水準,而不是處於前沿。當 weights 開放、任何人都能重現這些測試時,真正該留意的就是這種排行榜與實際體驗之間的落差。

如何判斷權重何時是真實的

「Soon」將透過具體的產物變成「已交付」,而不是另一則公告。在把 Qwen3.8 視為可供你在其上開發的開放權重模型之前,請留意以下所有項目:

  • 一則官方 Alibaba/Qwen 發布公告,指向可下載內容,而不只是「即將推出」的貼文。
  • 一個 Hugging Face repo,包含實際的權重檔案,位於 Alibaba 的 Qwen org 之下,並附有你已閱讀的 license 檔案(open weights 和 open-source licenses 並不相同)。
  • 一份 model card,列出 active parameters、context length 和 modalities,而不只是 2.4T 的總數。
  • 來自第三方的 benchmarks,由非 Alibaba 的人員執行,且是在已發布的權重上而非 preview 上測試。
  • 穩定的 API pricing,適用於 hosted version,讓你可以將每 token 成本與 Kimi K3 和 Claude 進行比較。

如果你現在正在選擇要基於哪個 model 來開發,我們整理的最佳開源 LLM 編碼模型清單涵蓋了那些權重已可下載的選項。一旦 Qwen3.8 的權重與穩定的 API 上線,它也將能透過像 AIReiter 這類相容 Anthropic 的 API gateway 與其他 frontier models 一起存取,因此你可以在不重寫整合的情況下,將它與你目前的 model 進行 A/B 測試。

常見問題

Qwen 是開放權重嗎?

先前的 Qwen 模型已釋出開放權重,但每次發布都是一個獨立的決定。Qwen3.8 的權重已承諾會釋出,但目前尚未推出,而阿里巴巴最近兩款旗艦模型在發表時仍維持封閉,因此「Qwen 是開放的」並不會自動適用於 3.8。

Qwen3.8 可以免費使用嗎?

目前還不行。Qwen3.8-Max-Preview 目前僅供 Alibaba Cloud 的付費 Token Plan 和 Qoder 平台使用。免費的 Qwen Chat app 仍在使用較舊的 Qwen3.7-Plus。

Qwen3.8 比 DeepSeek 或 Claude 更好嗎?

在社群回報的 KingBench 3 分數上,Qwen3.8-Max 略勝於 Opus 4.8,並落後於 Fable 5。但這些都未經驗證,且有幾位測試者發現,它在實際世界中的 agent 表現低於其基準排名。目前還沒有與 DeepSeek V4 或 Claude 的獨立一對一比較,因為釋出的權重尚未公開。

Qwen3.8 開放權重版本的發布日期是什麼?

阿里巴巴只說了「soon」。發佈日的外洩消息指向 2026 年 7 月下旬推出,而 Reddit 的二手消息則暗示是 8 月。阿里巴巴尚未確認確切日期。