AIREITER
API 文件價格
範本
  • AIReiter
  • 部落格
  • Kimi K3 開放權重釋出:1.56 TB 到底誰跑得動?

Kimi K3 開放權重釋出:1.56 TB 到底誰跑得動?

最近更新: 2026-07-28 08:18:37

模型權重開放,不等於你就有能力跑起來。Moonshot 在 Kimi K3 API 上線 11 天後,於 2026 年 7 月 27 日釋出完整開放權重;任何人都能下載,但 96 個 safetensors 分片合計 1.56 TB 的容量,很快就會讓多數人明白「開放」和「可部署」是兩回事。以下整理這次釋出的內容、授權條款,以及實際提供推論服務需要付出的硬體代價。

這次 Kimi K3 開放了哪些內容?

完整 checkpoint 已上架 Hugging Face 的 moonshotai/Kimi-K3,中國使用者則可透過 ModelScope mirror 下載。整個 repo 容量為 1.56 TB,包含 96 個 safetensors 分片、config.json、模型與 tokenizer 程式碼(modeling_kimi_k3.py、encoding_k3.py、一個 160K 詞彙量的 tiktoken model)、視覺前處理程式,以及 LICENSE 檔案。MoonshotAI GitHub repo 也同步公開了技術報告。

Hugging Face 上 moonshotai/Kimi-K3 的檔案列表,顯示 repo 容量為 1.56 TB、帶有 kimi-k3 授權標籤,並獲得 6.6k 個讚

比起參數總量,model card 裡有三項資訊更值得注意:

  • 每個 token 實際啟用 104B 參數。2.8T 總參數中,每個 token 會路由至 896 個專家中的 16 個,另有 2 個共享專家,模型共 93 層。在權重釋出前,這個啟用參數數字並未公開。
  • 權重原生採用 MXFP4。Moonshot 從 SFT 階段起就導入 quantization-aware training,activation 使用 MXFP8。這不是把 BF16 checkpoint 事後量化;此次釋出的模型本身就是 4-bit 權重。
  • 注意力層採 69/24 配置。在 1,048,576-token context window 下,包含 69 層 Kimi Delta Attention 與 24 層 Gated MLA。

社群跟進速度很快。根據提交紀錄,初始 commit 上線隔天,也就是 2026 年 7 月 28 日,repo 已累積 6.6k 個讚;社群轉檔也已出現:unsloth/Kimi-K3-GGUF 在同一天晚上建立,而 GrEarl/Kimi-K3-GGUF 到隔天早上就上傳了完整的 Q2_K 轉換版本。

Kimi K3 License 並不是 MIT 授權

過去的 Kimi 旗艦模型使用 Modified MIT license,但 K3 不一樣。它採用名為 Kimi K3 License 的授權文件。主體雖然源自 MIT,允許使用、複製、修改、合併、發布、散布、再授權、銷售、微調與建立衍生作品,卻額外加上兩項條件;在將它納入產品規劃前,務必先仔細閱讀。

Model-as-a-Service 條款。條文核心內容是:「若 Licensee 或其任何 affiliate 經營 Model as a Service 業務,且 Licensee 與其 affiliates 在任意連續 12 個月內的合計營收超過 2,000 萬美元……Licensee 在將 Software 或其衍生作品用於任何商業用途前,必須先與 Moonshot AI 簽訂另一份協議。」授權中對 MaaS 的定義,是以第三方能控制輸入、參數或訓練資料的方式,提供推論或微調存取。條款也明確排除兩種不屬於 MaaS 的情況:把模型能力嵌入特定功能的終端使用者產品,以及單純轉送請求至他方託管模型的服務。

標示歸屬條款。若基於 K3 的商業產品月活躍使用者超過 1 億,或每月營收超過 2,000 萬美元,該產品 UI 必須明顯顯示「Kimi K3」。

純內部使用可豁免這兩項條款,也就是不向第三方暴露模型、模型輸出或其能力的任何用途;透過 Moonshot 官方產品或認證推論合作夥伴存取時,同樣豁免。依條文直接解讀,在內部資料上微調 K3 受到第 4(a) 節的內部使用例外保障;將它嵌入產品功能,則在第 2 節被列為不屬於 MaaS 的情況。真正針對這些新增條款的,是把 K3 推論轉售為服務的模式;跨過 2,000 萬美元門檻後,問題也不再只是授權,而是需要進入合約談判。正式投入產品路線圖前,請自行閱讀LICENSE;上述內容僅是對條文的解讀,並非法律意見。

1.56 TB 權重背後的硬體門檻

Kimi K3 的開放權重人人可下載,但不是人人都能提供服務。

vLLM 的官方 K3 recipe寫得很直接:至少需要 8× GB300,若要承接真正的生產流量,則需多節點部署。AMD 平台方面,文件列出至少 8× MI355X 或 MI350X,並搭配 ROCm image。SGLang 也發布了同級硬體目標的 K3 cookbook。

若你真的準備建置環境,recipe 裡的營運細節尤其值得反覆確認。服務必須使用專屬的 vllm/vllm-openai:kimi-k3 image,AMD 則使用 vllm/vllm-openai_rocm:kimi-k3,不能直接拿一般版 vLLM 來跑。跨節點流量建議在 RDMA 上使用 --all2all-backend deepep_v2,或在 NVLink 上使用 flashinfer_nvlink_one_sided;同時設定 UCX_TLS="rc,cuda_copy",讓 KV cache 傳輸維持在 RDMA 上。MoE backend 的建議也取決於拓撲:expert-parallel 部署適合 deep_gemm_mega_moe,TP>1 則適合 flashinfer_trtllm。此外,recipe 還提到 K3 偶爾會輸出連自己的 parser 都無法接受的 tool-call 格式,因此從一開始就應在 serving layer 加入 schema validation 與 retry 機制。

常見的解法是進一步量化,但這次幾乎行不通,因為 MXFP4 本來就約等於每個參數 4.25 bits。過去讓 1T 級模型勉強能在工作站部署的壓縮空間,在下載前就已經用掉了。首批出現的社群 2-bit GGUF 轉換版本,仍有 928 GB、共 94 個分片;雖然比原始大小節省 40%,卻沒有解決原本真正的瓶頸。

載入項目容量
官方 MXFP4 safetensors1,561 GB
社群 Q2_K GGUF929 GB
每個 token 啟用的參數104B

若要接近 1M-token context,還得加上 KV cache,實際工作集只會繼續膨脹。首日最引人注意的自架回報,來自一個聲稱以 80× RTX 5090s 運行官方 MXFP4 權重的團隊:使用一般 Ethernet、不用 HBM、不重新量化,單串流未調校下約為每秒 20 tokens。這只是單一貼文中未經審核的首日說法,不是 benchmark,一種配置也不能定義最低門檻。它值得引用的原因只在於方向性:目前已知最便宜的消費級硬體執行路徑,仍得動用 80 張旗艦 GPU,而速度多數人都會覺得偏慢。

Ollama 值得特別說明,因為它往往是大家第一個嘗試的工具。Ollama library 確實有對應項目,但實際解析為 kimi-k3:cloud,代表 Ollama 的託管路由,而不是可在本機 pull 的模型。目前沒有筆電或單一工作站可行的部署路徑;而 MXFP4 是原生格式,不是方便使用的量化版本,因此社群慣用的激進再量化手段,比起 K2 系列也更缺乏發揮空間。llama.cpp 支援仍在持續推進,請確認最新狀態,不要先入為主地假設支援或不支援。

目前哪些平台能直接使用 Kimi K3?

對幾乎所有人來說,務實的選擇是託管 endpoint。開放權重釋出的典型效應也立刻出現:第三方服務商在一天內陸續上線。以下價格均為 2026 年 7 月 28 日列出的每百萬 tokens 輸入/輸出費率。

服務商量化格式Context價格
Moonshot AIMXFP4(原生)1M$3 / $15
BasetenFP81M$3 / $15
Fireworks未說明1M$3 / $15(另有 $4.50 / $22.50 級距)
NebiusFP48K$3 / $15

挑選前有兩件事要先確認。第一,context window 差異非常大。Nebius 雖然提供相同的牌價,但 context window 僅有 8K,等於犧牲了使用 K3 最重要的理由。第二,量化精度並不一致:Moonshot 提供原生 MXFP4、Baseten 使用 FP8,另有多個服務商完全未揭露精度。若是長週期的 agentic 工作,參考實作的原生精度與完整 1M context,通常比價差更重要;若是高量短 prompt,延遲與區域可用性則很可能優先於兩者。

除了直接使用各家 endpoint,OpenRouter 也透過單一 key 整合這些服務;多模型 gateway 則讓 K3 與其他中國開放前沿模型一同提供路由。若現有工具已支援該協定,AIReiter 可透過相容 Anthropic 的 API提供同類模型。Moonshot 自家 endpoint 同時提供 OpenAI 與 Anthropic 相容介面。完整費率與級距細節可參考 Kimi K3 pricing breakdown。

該自架,還是直接用託管 API?

先把帳算清楚。以每百萬 tokens 輸入 $3、輸出 $15 計算,10 億 output tokens 要 $15,000,10 億 input tokens 則是 $3,000。接著對照最基本可行的自架規格:一台 8× GB300 等級的節點,無論是資料中心資本支出,還是按 accelerator-hour 計費的租賃,都還得加上互連、電力、散熱,以及一名熟悉 --all2all-backend 的工程師。NVIDIA 與主要雲端業者都沒有公開這種配置的牌價,因此應以即時報價而不是經驗法則比較;也要記得硬體成本是固定支出,API 成本則會隨實際使用量增加。

自行部署 Kimi K3 開放權重,真正划算的情境只有三種,而且範圍比聽起來更窄:

  1. 隔離網路或資料落地需求。沒有任何第三方 endpoint 能滿足的情況下,這是最有力的理由,成本不是決策主因。
  2. 以專有資料進行微調。授權明確允許,且這是託管 endpoint 不會提供的能力。不過訓練成本需另計,而且高於 serving 成本。
  3. 長期滿載的持續流量。若多節點叢集能全天候維持高使用率,自有硬體可能壓低每 token 成本;偶發的尖峰流量不算。

如果你的需求不屬於上述任何一種,直接使用 endpoint,將權重當成選項而非既定計畫。對多數團隊而言,開放權重前沿模型的價值不在於他們真的會自己跑,而在於託管版本的價格,從此必須和「我們其實可以自己跑」這個可能性競爭。

常見問題

Kimi K3 是開源模型嗎?

它是 open-weight,而非嚴格意義上的開源。完整 2.8T checkpoint 可下載,Kimi K3 License 也允許使用、修改、散布與微調。不過訓練資料與完整訓練流程並未公開,且授權對 Model-as-a-Service 營運商加入營收觸發條款,因此不屬於 OSI 風格的 open source。

我可以在本機用 Ollama 跑 Kimi K3 嗎?

不行。Ollama 的 kimi-k3 項目實際上是 kimi-k3:cloud,會路由至託管 endpoint。原生 MXFP4 權重有 1.56 TB,就算是社群 2-bit GGUF 版本也仍有 928 GB,因此消費級硬體沒有本機部署途徑。

Kimi K3 權重採用什麼授權?

採 Kimi K3 License。它源自 MIT,但若你經營 Model-as-a-Service 業務,且任意 12 個月內營收超過 $20M,就必須先與 Moonshot 另行簽約;產品月活躍使用者超過 100M 或每月營收超過 $20M 時,還必須在 UI 標示歸屬。內部使用則豁免這兩項條件。

不下載模型的話,哪裡可以使用 Kimi K3?

可使用 Moonshot 自家 API 和 Kimi app,也可選擇 Baseten、Fireworks 與 Nebius。四者在 2026 年 7 月 28 日列出的基本費率均為每百萬 tokens $3/$15,但比較時仍有條件差異:Fireworks 還有 $4.50/$22.50 級距,Nebius 雖採基本費率,context window 卻是 8K 而非 1M。想了解模型定位與 benchmark 表現,可參考 Kimi K3 overview。

>_AIReiter 模型目錄

快速存取與本指南相關的模型 API

Kimi K3

Chat

一款適用於程式碼撰寫、寫作、分析與 agent 工作流程的長上下文推理模型。

Moonshot取得 API Key >

GLM-5.3 Flash

Chat

用於高頻聊天、圖像理解與抽取的多模態 1M-context 模型。

Zhipu取得 API Key >

Claude Fable 5

Chat

一款適合深度推理與複雜長篇工作的高級 Claude 模型。

Anthropic取得 API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

Anthropic取得 API Key >

Claude Opus 4.8

Chat

一款具備高能力的 Claude 模型,適用於高難度推理與專業工作。

Anthropic取得 API Key >

最新文章

如何在 Janitor AI 使用 DeepSeek(2026 設定教學)

2026-09-08

免費 LLM API 額度比較:11 家供應商(2026)

2026-09-08

Muse Spark 1.3 API 定價:Standard 與 Contributor 怎麼選

2026-09-08

GPT-6 Astra API 評測(2026):為代理打造,不是即插即用

2026-09-07
AIREITER

有問題?請聯絡我們
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

AI 影片

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

AI 圖片

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

部落格

查看全部 →

公司

隱私政策服務條款退款政策

© 2026 AIReiter。保留所有權利。