AIREITER

Qwen 3.8 Max vs Kimi K3:輸出成本更低,Kimi 程式能力更強(2026)

最近更新: 2026-08-06 07:47:49

同樣是中國推出的 MoE 旗艦模型、同樣提供百萬 Token 上下文,也都預設以最高強度推理;兩者相隔三週推出,價格卻完全不是同一個級距。Kimi K3在程式能力上更勝一籌,但每百萬輸出 Token 收費 $15,是Qwen 3.8 Max $6 的 2.5 倍。Qwen 3.8 Max 則是更便宜、也更新的選擇,於 2026 年 8 月 3 日正式 GA,並在圖表理解與電腦操作任務占優。要留意的是,兩款模型開箱即採最高推理強度,Kimi K3 較高的輸出單價會在每次請求中持續累積;而 Qwen 的開放權重則要到約 8 月 11 日才會推出。

規格接近,真正差異在使用情境

Qwen 3.8 Max 與 Kimi K3 都是兆級參數的 mixture-of-experts 模型,具備百萬 Token 上下文視窗與原生視覺能力,並在 2026 年年中相隔不到三週發表。從紙面規格來看,兩者屬於同一級距,因此許多比較最後只剩下基準分數的拉鋸。實際選擇重點更明確:你是否願意為更好的程式品質承擔更高輸出成本,以及現在是否需要開放權重或強大的多模態能力。

規格Qwen 3.8 MaxKimi K3
總參數量2.4T2.8T
每 Token 啟用參數~95B104B
架構MoE(~4% 啟用)MoE(896 位專家中啟用 16 位)
上下文視窗~1M(最大輸入 991K)1,048,576
視覺能力有(文字 + 圖片輸入)有(原生支援)
預設推理xhigh,開啟 thinkingmax effort,開啟 reasoning
開放權重否(預計 ~8 月 11 日)是(HF,7 月 27 日,1.56TB MXFP4)
API 狀態GA,2026 年 8 月 3 日GA

資料來源:yottalabs 正面比較、透過 AIReiter 整理的 Alibaba QwenCloud,以及 Moonshot platform.kimi.ai;於 2026 年 8 月 6 日核實。

API 定價、實際工作負載成本與取得方式

兩家廠商都公開了按 Token 計價的價格,而價差並不在總參數量看起來最顯眼的地方,而是集中於輸出 Token。這正是推理模型最容易燒預算的一環。Kimi K3 每百萬輸出 Token 收 $15,Qwen 3.8 Max 則為 $6;兩者又都預設會輸出推理過程,因此這個輸出價格不只計算最終回答,也包含 reasoning traces。

每 1M Token 價格Qwen 3.8 MaxKimi K3
輸入(快取未命中)$2.00$3.00
輸入(快取命中)$0.25$0.30
輸出(含 thinking)$6.00$15.00
上下文~1M1,048,576

資料來源:Alibaba QwenCloud 模型頁面(2026 年 8 月 2 日更新)與 Moonshot platform.kimi.ai/docs/pricing/chat-k3;於 2026 年 8 月 6 日核實。

Moonshot 平台上的 Kimi K3 官方 API 定價:每百萬快取未命中輸入 $3.00、快取讀取 $0.30、輸出 $15.00,以及 1,048,576 Token 上下文

以常見的程式工作負載估算:輸入 20M Token、快取命中率 60%,再加上 5M Token 輸出,Kimi K3 的總成本約為 $103(輸入 $27.60 加上輸出 $75);Qwen 3.8 Max 約為 $49(輸入 $19 加上輸出 $30)。約 2 倍的差距幾乎全來自輸出端:快取會縮小輸入成本差異,卻無法降低輸出差距;加上兩款模型預設都採最高推理強度,輸出所占的比重自然很大。

兩者的取得方式並不對等。Qwen 3.8 Max 已於 2026 年 8 月 3 日在 Alibaba API 正式 GA,但權重尚未公開;模型頁面仍標示 Open Source: No,預計在 8 月 11 日當週登上 Hugging Face 與 ModelScope(Alibaba 資訊,經 Qwen 3.8 Max 定價頁面整理)。Kimi K3 則是目前可開放使用的選項:Moonshot 已於 7 月 27 日釋出 1.56 TB MXFP4 checkpoint,API 也已上線。

此外,也能透過 AIReiter 的Kimi K3 API endpoint使用 Kimi K3,價格與 Moonshot 官方費率相同、不加價;若想在同一張帳單下與其他模型一起測試 K3,這會相當方便。Qwen 3.8 Max 目前尚未整合至該平台。

Kimi K3 的優勢:代理式程式開發

若工作涉及多步驟程式任務,例如 agent loop、整個 repository 的重構,或必須呼叫工具、從錯誤路徑中恢復的 SWE 類任務,Kimi K3 是更適合的模型。它在公開的代理式基準測試中穩定領先 Qwen 3.8 Max,且差距在最貼近實際工程工作的測項特別明顯。

正面基準比較:Kimi K3 在 TerminalBench 2.1、FrontierSWE 與 CharXiv-with-tool 領先;Qwen 3.8 Max 則在 CharXiv-without-tool 和 PerceptionBench 領先
基準測試Qwen 3.8 MaxKimi K3
FrontierSWE73.581.2
TerminalBench 2.186.688.3
CharXiv(使用工具)88.491.3

資料來源:yottalabs 正面比較,於 2026 年 8 月 6 日核實。

社群觀感也大致呼應這些數字,只是同樣帶著本次比較最核心的成本保留:

「K3 是神級。Qwen 3.8 幾乎能與它相提並論。不過,這兩款模型目前的訂閱或 API 成本都不太合理……」— r/Qwen_AI

「在這個練習中,K3 大幅輾壓 Qwen 3.8;不過 Qwen 生成這個 landing page 的速度是 Kimi 的 3 倍。」— X 上的 @filicroval

Kimi K3 的原始智慧分數也較高,Artificial Analysis Intelligence Index 為 57;但速度偏慢,輸出速度約每秒 39 Token,首 Token 時間為 3.1 秒(Artificial Analysis)。這是一筆以延遲與成本換取品質及開放性的交易。

Qwen 3.8 Max 的優勢:多模態與成本效益

如果你的工作負載偏向閱讀圖表、解析截圖、操作瀏覽器,或更在意輸出成本而非程式基準多拿幾分,Qwen 3.8 Max 會是較佳選擇。它在文件與感知基準上勝過 Kimi K3,也在一項電腦操作基準維持經核實的最佳成績,同時輸出單價只有 Kimi K3 的 40%。

基準測試Qwen 3.8 MaxKimi K3
CharXiv(不使用工具)93.584.8
PerceptionBench63.558.5
OSWorld-Verified86.1%(SOTA)無公開分數

資料來源:yottalabs 正面比較,於 2026 年 8 月 6 日核實。

Qwen 3.8 Max 的弱點,剛好就是 Kimi K3 最強、也最接近前沿閉源模型的領域。在 SWE-bench Pro 上,它取得 67.7 分,明顯落後 Claude Fable 5 的 80 分(Alibaba 公布的表格,廠商自行測試),因此不適合用於最困難的軟體工程評測。撰文當下,它的 API 上線僅三天,正式 GA 為 2026 年 8 月 3 日;權重也仍未開放(取得方式如前所述)。若今天就必須自行部署,只能等待或改選 Kimi K3。

依工作負載選模型

該選哪一款,與其說取決於哪個模型客觀上更強,不如說取決於你要拿它做什麼。以下整理常見工作負載、建議選擇及背後已核實的理由。

你的工作負載是……建議選擇原因
Agent loop、repository 重構、SWE 任務(成本不是主要限制)Kimi K3FrontierSWE 81.2 vs 73.5,TerminalBench 88.3 vs 86.6
文件/圖表解析、瀏覽器或電腦操作,且對成本敏感Qwen 3.8 MaxCharXiv 93.5、OSWorld 86.1% SOTA,輸出 $6 vs $15
今天就要自行部署Kimi K3權重自 7 月 27 日起已在 HF;Qwen 預計約 8 月 11 日推出

常見問題

Qwen 3.8 Max 在程式開發上比 Kimi K3 好嗎?

不是。Kimi K3 在關鍵的代理式程式基準中領先,包括 FrontierSWE 81.2 比 73.5、TerminalBench 2.1 的 88.3 比 86.6。因此在多步驟工程任務上,Kimi K3 是更強的選擇。

Qwen 3.8 Max 和 Kimi K3 哪一個比較便宜?

Qwen 3.8 Max 較便宜。它每百萬輸出 Token 收費 $6,Kimi K3 為 $15;輸入則是 $2 對 $3,快取命中價格相近。在典型程式工作負載下,整體成本約有 2 倍差距。

在最高推理強度的代理式程式任務中,哪一個更便宜?

仍然是 Qwen 3.8 Max。兩款模型在最高推理強度下,都會將推理 Token 計為輸出;因此 Kimi K3 的 $15/M 費率,恰恰會在它較有優勢的程式工作負載中進一步拉大成本差距。

兩款模型都支援百萬 Token 上下文嗎?

是。Qwen 3.8 Max 約可接受 991K 輸入 Token,啟用 thinking 時會更少;Kimi K3 則為 1,048,576。兩者名義上都是百萬 Token 上下文視窗。

模型權重是開放的嗎?

Kimi K3 是。Moonshot 已於 2026 年 7 月 27 日釋出 1.56 TB MXFP4 checkpoint。Qwen 3.8 Max 尚未開放;Alibaba 將其列為閉源,預計在 8 月 11 日當週於 Hugging Face 與 ModelScope 發布。

延伸閱讀