2026 年 7 月 27 日,Moonshot 正式放出 Kimi K3 开放权重,距离其通过 API 上线仅过去 11 天。权重确实公开可下载,但 96 个 safetensors 分片合计 1.56 TB,也让大多数人立刻意识到:模型“开放”不等于自己就“跑得起来”。下面拆解这次发布包含什么、许可证怎么规定,以及真正提供服务需要哪些条件。
Moonshot 这次到底发布了什么
完整 checkpoint 已上线 Hugging Face:moonshotai/Kimi-K3,中国用户可通过 ModelScope mirror 下载镜像。整个仓库大小为 1.56 TB,包括 96 个 safetensors 分片,以及 config.json、模型与 tokenizer 代码(modeling_kimi_k3.py、encoding_k3.py、一个 160K 词表的 tiktoken 模型)、视觉预处理文件和 LICENSE 文件。MoonshotAI GitHub 仓库也同步发布了技术报告。
比起 headline 上的参数量,模型卡中有三项信息更值得关注:
- 每个 token 实际激活 104B 参数。总参数为 2.8T,每个 token 会路由至 896 个专家中的 16 个,另有 2 个共享专家,模型共 93 层。在权重发布前,这个激活参数规模尚未公开。
- 权重原生采用 MXFP4。Moonshot 从 SFT 阶段开始就采用量化感知训练,激活值为 MXFP8。这并非把 BF16 checkpoint 后期量化得到的版本;本次发布的权重本身就是 4-bit。
- 注意力层采用 69/24 的组合。在 1,048,576-token 上下文窗口内,Kimi Delta Attention 层与 Gated MLA 层的比例为 69/24。
社区跟进速度很快。根据其提交历史,初始 commit 落地一天后的 2026 年 7 月 28 日,仓库已获得 6.6k 点赞;社区转换版本也随即出现:unsloth/Kimi-K3-GGUF 当晚创建,到了次日早晨,GrEarl/Kimi-K3-GGUF 已上传完整的 Q2_K 转换版本。
Kimi K3 License 不是 MIT 许可证
此前的 Kimi 旗舰模型采用 Modified MIT license,K3 则不再如此。它使用名为 Kimi K3 License 的许可证。其主体沿用 MIT 风格,允许使用、复制、修改、合并、发布、分发、再授权、销售、微调和创建衍生作品,但在实际基于它开发前,有两项附加条件必须读清楚。
Model-as-a-Service 条款。核心原文是:“If the Licensee or any of its affiliates operates a Model as a Service business, and the aggregate revenue of the Licensee and its affiliates exceeds 20 million US dollars ... in total over any consecutive 12 months, the Licensee must enter into a separate agreement with Moonshot AI before using the Software or its derivative works for any commercial purpose.” 许可证将 MaaS 定义为:向第三方提供推理或微调访问,使其能够控制输入、参数或训练数据。不过,许可证也明确排除了两类不属于 MaaS 的情形:将模型能力嵌入特定功能的终端用户产品,以及仅代转发请求至他人托管模型的行为。
署名展示条款。如果基于 K3 构建的商业产品月活用户超过 1 亿,或月收入超过 2,000 万美元,产品 UI 中必须显著展示“Kimi K3”。
纯内部使用可豁免以上两项条款,即不向第三方暴露模型、模型输出或模型能力的任何用途;通过 Moonshot 官方产品或认证推理合作伙伴访问模型,同样可豁免。按条文直读,在内部数据上微调 K3 属于第 4(a) 节的内部使用豁免;将其作为产品功能嵌入,则被第 2 节明确列为非 MaaS 情形。将 K3 推理能力作为服务转售,才是这些附加条款主要针对的场景;当营收跨过 2,000 万美元门槛,问题就从许可证适用转为合同谈判。在据此确定产品路线前,请自行阅读LICENSE;以上是对文本的解读,不构成法律建议。
1.56 TB 权重背后的硬件门槛
Kimi K3 开放权重谁都能下载,但并不意味着谁都能部署服务。
vLLM 的官方 K3 部署指南写得很直接:至少需要 8× GB300,而要应对真正的生产流量,则需要多节点部署。AMD 路线则要求至少 8× MI355X 或 MI350X,并使用 ROCm 镜像。SGLang 也发布了面向 K3 的部署手册,目标硬件同属这一等级。
如果你真准备为它配机器,部署指南里的运维细节值得反复确认。服务需使用专用镜像 vllm/vllm-openai:kimi-k3,AMD 则使用 vllm/vllm-openai_rocm:kimi-k3,而不是原版 vLLM。跨节点通信建议在 RDMA 上使用 --all2all-backend deepep_v2,或在 NVLink 上使用 flashinfer_nvlink_one_sided;同时设置 UCX_TLS="rc,cuda_copy",让 KV cache 传输走 RDMA。MoE 后端选择还取决于拓扑:专家并行部署建议用 deep_gemm_mega_moe,TP>1 则建议 flashinfer_trtllm。指南还指出,K3 偶尔会输出连自身 parser 都无法接受的 tool-call 格式,因此从第一天起就在服务层加入 schema 校验与重试机制。
常见的解决思路是继续量化,但在这里基本行不通:MXFP4 本身已经约为每参数 4.25 bit。过去让万亿参数模型得以在工作站上运行的压缩空间,在下载之前就已经用掉了。最早出现的社区 2-bit GGUF 转换版仍有928 GB、共 94 个分片;虽然相较原版节省 40%,但这从来不是决定性瓶颈。
| 加载内容 | 大小 |
|---|---|
| 官方 MXFP4 safetensors | 1,561 GB |
| 社区 Q2_K GGUF | 929 GB |
| 每个 token 的激活参数 | 104B |
如果还要接近 1M-token 上下文,KV cache 会继续推高工作集规模。首日最引人注目的自托管报告来自一个团队的说法:他们用 80× RTX 5090、普通以太网运行官方 MXFP4 权重,没有 HBM,也没有重新量化;未经调优的单流速度约为 20 tokens/second。这只是单条帖文中未经审计的首日主张,不是 benchmark,一套配置也不能定义最低门槛。它值得引用的唯一原因,是它指向的现实:目前已披露的、在消费级硬件上运行 K3 的最便宜路径,仍需要 80 张旗舰 GPU,而速度在多数人看来依然偏慢。
Ollama 尤其值得单独说明,因为这往往是大家第一个尝试的工具。它的模型库条目确实存在,但实际指向 kimi-k3:cloud,也就是 Ollama 的托管路由,而不是本地拉取。现阶段没有笔记本或单台工作站运行该模型的路径;MXFP4 是原生格式,不是为了方便部署而做的量化版本,因此社区常见的激进再量化方案,可发挥的空间也小于 K2 系列。llama.cpp 支持仍在推进中,请以当前状态为准,不要预设它已经支持或必然不支持。
现在可以在哪里使用 Kimi K3
对几乎所有人而言,实际可行的答案都是托管端点。开放权重发布后,第三方服务商在一天内便陆续上线。以下价格均为 2026 年 7 月 28 日所列的每百万 token 输入/输出价格。
| 服务商 | 量化格式 | 上下文 | 价格 |
|---|---|---|---|
| Moonshot AI | MXFP4(原生) | 1M | $3 / $15 |
| Baseten | FP8 | 1M | $3 / $15 |
| Fireworks | 未说明 | 1M | $3 / $15(另有 $4.50 / $22.50 档位) |
| Nebius | FP4 | 8K | $3 / $15 |
选择前有两点需要重点确认。第一,上下文窗口差异极大。Nebius 虽然报价相同,但上下文窗口仅为 8K,这直接削弱了使用 K3 最重要的理由。第二,量化格式并不一致:Moonshot 提供原生 MXFP4,Baseten 使用 FP8,还有多家服务商没有说明精度。对于长周期的 agentic 工作流,是否匹配参考精度以及是否提供完整 1M 窗口,通常比价格差异更重要;而在高吞吐的短提示场景中,延迟和区域可用性可能反而更关键。
除直接端点外,OpenRouter 也通过一个 API key 聚合了这些服务;多模型网关则让 K3 与其他中国开放前沿模型并列提供。若你的工具链已支持该协议,AIReiter 可通过Anthropic-compatible API提供同类模型。Moonshot 自身的端点同时支持 OpenAI-compatible 和 Anthropic-compatible 接口。完整的费率和分层信息见 Kimi K3 pricing breakdown。
该自托管,还是直接用 API?
先把账算清楚。按每百万 token 输入 $3、输出 $15 计算,10 亿输出 token 的成本是 $15,000,10 亿输入 token 是 $3,000。再对照最低可行的自托管配置:一台 8× GB300 级别的节点。这意味着数据中心级资本采购,或者按加速器小时计费的租赁成本,外加互联、电力、散热,以及一位熟悉 --all2all-backend 的工程师。NVIDIA 和主要云厂商都未公开这一配置的标价,因此应基于实时报价计算,而不是套用经验法则;还要记住,硬件成本是固定的,API 成本则随实际使用量变化。
Kimi K3 开放权重的自托管,只有三类情况能算得过来,而且适用范围比听上去窄得多:
- 隔离网络或数据驻留要求。当任何第三方端点都无法满足要求时,这是最有力的理由,成本并不是决定因素。
- 在专有数据上微调。许可证明确允许这样做,而托管端点无法提供这一能力。需要注意,训练成本独立于推理成本,且更高。
- 持续满载的大规模用量。如果多节点集群能够全天候保持高利用率,自有硬件可能低于按 token 计费的价格。偶发的流量高峰不属于这种情况。
如果以上情况都不适用于你,直接使用端点,把权重视作一种选择,而不是既定计划。对大多数团队来说,开放权重前沿模型的价值不在于他们真的会去部署,而在于托管版本的定价现在必须面对一个可能性:用户理论上可以自己运行它。
FAQ
Kimi K3 是开源模型吗?
它是开放权重模型。完整的 2.8T checkpoint 可以下载,Kimi K3 License 也允许使用、修改、分发和微调。但训练数据和完整训练流程并未发布,许可证还针对 Model-as-a-Service 运营者增加了按营收触发的条款,因此它并非 OSI 风格的开源软件。
我能在本地用 Ollama 运行 Kimi K3 吗?
不能。Ollama 的 kimi-k3 条目实际是 kimi-k3:cloud,会路由至托管端点。原生 MXFP4 权重为 1.56 TB,社区 2-bit GGUF 版本仍有 928 GB,因此消费级硬件上不存在本地运行路径。
Kimi K3 权重使用什么许可证?
使用 Kimi K3 License:它基于 MIT 衍生而来,但如果你运营的 Model-as-a-Service 业务在任意连续 12 个月内营收超过 $20M,就必须先与 Moonshot 签订单独协议;产品月活超过 100M 或月收入超过 $20M 时,还需要在 UI 中展示归属信息。内部使用可豁免这两项要求。
不下载模型的话,能在哪里使用 Kimi K3?
可使用 Moonshot 自身的 API 和 Kimi app,也可通过 Baseten、Fireworks 与 Nebius 访问。截至 2026 年 7 月 28 日,四家服务商的基础价格均为每百万 token $3/$15,但实际比较仍需结合条件:Fireworks 另有 $4.50/$22.50 档位,而 Nebius 虽采用基础价格,上下文窗口却是 8K,而非 1M。想了解模型本身及其 benchmark 表现,可参阅 Kimi K3 overview。