AIREITER
API 文档价格
模板
  • AIReiter
  • 博客
  • Kimi K3 开放权重发布:1.56 TB 到底谁跑得动

Kimi K3 开放权重发布:1.56 TB 到底谁跑得动

最后更新: 2026-07-28 08:17:12

2026 年 7 月 27 日,Moonshot 正式放出 Kimi K3 开放权重,距离其通过 API 上线仅过去 11 天。权重确实公开可下载,但 96 个 safetensors 分片合计 1.56 TB,也让大多数人立刻意识到:模型“开放”不等于自己就“跑得起来”。下面拆解这次发布包含什么、许可证怎么规定,以及真正提供服务需要哪些条件。

Moonshot 这次到底发布了什么

完整 checkpoint 已上线 Hugging Face:moonshotai/Kimi-K3,中国用户可通过 ModelScope mirror 下载镜像。整个仓库大小为 1.56 TB,包括 96 个 safetensors 分片,以及 config.json、模型与 tokenizer 代码(modeling_kimi_k3.py、encoding_k3.py、一个 160K 词表的 tiktoken 模型)、视觉预处理文件和 LICENSE 文件。MoonshotAI GitHub 仓库也同步发布了技术报告。

Hugging Face 上 moonshotai/Kimi-K3 的文件列表,显示仓库大小为 1.56 TB、kimi-k3 许可证标签和 6.6k 点赞

比起 headline 上的参数量,模型卡中有三项信息更值得关注:

  • 每个 token 实际激活 104B 参数。总参数为 2.8T,每个 token 会路由至 896 个专家中的 16 个,另有 2 个共享专家,模型共 93 层。在权重发布前,这个激活参数规模尚未公开。
  • 权重原生采用 MXFP4。Moonshot 从 SFT 阶段开始就采用量化感知训练,激活值为 MXFP8。这并非把 BF16 checkpoint 后期量化得到的版本;本次发布的权重本身就是 4-bit。
  • 注意力层采用 69/24 的组合。在 1,048,576-token 上下文窗口内,Kimi Delta Attention 层与 Gated MLA 层的比例为 69/24。

社区跟进速度很快。根据其提交历史,初始 commit 落地一天后的 2026 年 7 月 28 日,仓库已获得 6.6k 点赞;社区转换版本也随即出现:unsloth/Kimi-K3-GGUF 当晚创建,到了次日早晨,GrEarl/Kimi-K3-GGUF 已上传完整的 Q2_K 转换版本。

Kimi K3 License 不是 MIT 许可证

此前的 Kimi 旗舰模型采用 Modified MIT license,K3 则不再如此。它使用名为 Kimi K3 License 的许可证。其主体沿用 MIT 风格,允许使用、复制、修改、合并、发布、分发、再授权、销售、微调和创建衍生作品,但在实际基于它开发前,有两项附加条件必须读清楚。

Model-as-a-Service 条款。核心原文是:“If the Licensee or any of its affiliates operates a Model as a Service business, and the aggregate revenue of the Licensee and its affiliates exceeds 20 million US dollars ... in total over any consecutive 12 months, the Licensee must enter into a separate agreement with Moonshot AI before using the Software or its derivative works for any commercial purpose.” 许可证将 MaaS 定义为:向第三方提供推理或微调访问,使其能够控制输入、参数或训练数据。不过,许可证也明确排除了两类不属于 MaaS 的情形:将模型能力嵌入特定功能的终端用户产品,以及仅代转发请求至他人托管模型的行为。

署名展示条款。如果基于 K3 构建的商业产品月活用户超过 1 亿,或月收入超过 2,000 万美元,产品 UI 中必须显著展示“Kimi K3”。

纯内部使用可豁免以上两项条款,即不向第三方暴露模型、模型输出或模型能力的任何用途;通过 Moonshot 官方产品或认证推理合作伙伴访问模型,同样可豁免。按条文直读,在内部数据上微调 K3 属于第 4(a) 节的内部使用豁免;将其作为产品功能嵌入,则被第 2 节明确列为非 MaaS 情形。将 K3 推理能力作为服务转售,才是这些附加条款主要针对的场景;当营收跨过 2,000 万美元门槛,问题就从许可证适用转为合同谈判。在据此确定产品路线前,请自行阅读LICENSE;以上是对文本的解读,不构成法律建议。

1.56 TB 权重背后的硬件门槛

Kimi K3 开放权重谁都能下载,但并不意味着谁都能部署服务。

vLLM 的官方 K3 部署指南写得很直接:至少需要 8× GB300,而要应对真正的生产流量,则需要多节点部署。AMD 路线则要求至少 8× MI355X 或 MI350X,并使用 ROCm 镜像。SGLang 也发布了面向 K3 的部署手册,目标硬件同属这一等级。

如果你真准备为它配机器,部署指南里的运维细节值得反复确认。服务需使用专用镜像 vllm/vllm-openai:kimi-k3,AMD 则使用 vllm/vllm-openai_rocm:kimi-k3,而不是原版 vLLM。跨节点通信建议在 RDMA 上使用 --all2all-backend deepep_v2,或在 NVLink 上使用 flashinfer_nvlink_one_sided;同时设置 UCX_TLS="rc,cuda_copy",让 KV cache 传输走 RDMA。MoE 后端选择还取决于拓扑:专家并行部署建议用 deep_gemm_mega_moe,TP>1 则建议 flashinfer_trtllm。指南还指出,K3 偶尔会输出连自身 parser 都无法接受的 tool-call 格式,因此从第一天起就在服务层加入 schema 校验与重试机制。

常见的解决思路是继续量化,但在这里基本行不通:MXFP4 本身已经约为每参数 4.25 bit。过去让万亿参数模型得以在工作站上运行的压缩空间,在下载之前就已经用掉了。最早出现的社区 2-bit GGUF 转换版仍有928 GB、共 94 个分片;虽然相较原版节省 40%,但这从来不是决定性瓶颈。

加载内容大小
官方 MXFP4 safetensors1,561 GB
社区 Q2_K GGUF929 GB
每个 token 的激活参数104B

如果还要接近 1M-token 上下文,KV cache 会继续推高工作集规模。首日最引人注目的自托管报告来自一个团队的说法:他们用 80× RTX 5090、普通以太网运行官方 MXFP4 权重,没有 HBM,也没有重新量化;未经调优的单流速度约为 20 tokens/second。这只是单条帖文中未经审计的首日主张,不是 benchmark,一套配置也不能定义最低门槛。它值得引用的唯一原因,是它指向的现实:目前已披露的、在消费级硬件上运行 K3 的最便宜路径,仍需要 80 张旗舰 GPU,而速度在多数人看来依然偏慢。

Ollama 尤其值得单独说明,因为这往往是大家第一个尝试的工具。它的模型库条目确实存在,但实际指向 kimi-k3:cloud,也就是 Ollama 的托管路由,而不是本地拉取。现阶段没有笔记本或单台工作站运行该模型的路径;MXFP4 是原生格式,不是为了方便部署而做的量化版本,因此社区常见的激进再量化方案,可发挥的空间也小于 K2 系列。llama.cpp 支持仍在推进中,请以当前状态为准,不要预设它已经支持或必然不支持。

现在可以在哪里使用 Kimi K3

对几乎所有人而言,实际可行的答案都是托管端点。开放权重发布后,第三方服务商在一天内便陆续上线。以下价格均为 2026 年 7 月 28 日所列的每百万 token 输入/输出价格。

服务商量化格式上下文价格
Moonshot AIMXFP4(原生)1M$3 / $15
BasetenFP81M$3 / $15
Fireworks未说明1M$3 / $15(另有 $4.50 / $22.50 档位)
NebiusFP48K$3 / $15

选择前有两点需要重点确认。第一,上下文窗口差异极大。Nebius 虽然报价相同,但上下文窗口仅为 8K,这直接削弱了使用 K3 最重要的理由。第二,量化格式并不一致:Moonshot 提供原生 MXFP4,Baseten 使用 FP8,还有多家服务商没有说明精度。对于长周期的 agentic 工作流,是否匹配参考精度以及是否提供完整 1M 窗口,通常比价格差异更重要;而在高吞吐的短提示场景中,延迟和区域可用性可能反而更关键。

除直接端点外,OpenRouter 也通过一个 API key 聚合了这些服务;多模型网关则让 K3 与其他中国开放前沿模型并列提供。若你的工具链已支持该协议,AIReiter 可通过Anthropic-compatible API提供同类模型。Moonshot 自身的端点同时支持 OpenAI-compatible 和 Anthropic-compatible 接口。完整的费率和分层信息见 Kimi K3 pricing breakdown。

该自托管,还是直接用 API?

先把账算清楚。按每百万 token 输入 $3、输出 $15 计算,10 亿输出 token 的成本是 $15,000,10 亿输入 token 是 $3,000。再对照最低可行的自托管配置:一台 8× GB300 级别的节点。这意味着数据中心级资本采购,或者按加速器小时计费的租赁成本,外加互联、电力、散热,以及一位熟悉 --all2all-backend 的工程师。NVIDIA 和主要云厂商都未公开这一配置的标价,因此应基于实时报价计算,而不是套用经验法则;还要记住,硬件成本是固定的,API 成本则随实际使用量变化。

Kimi K3 开放权重的自托管,只有三类情况能算得过来,而且适用范围比听上去窄得多:

  1. 隔离网络或数据驻留要求。当任何第三方端点都无法满足要求时,这是最有力的理由,成本并不是决定因素。
  2. 在专有数据上微调。许可证明确允许这样做,而托管端点无法提供这一能力。需要注意,训练成本独立于推理成本,且更高。
  3. 持续满载的大规模用量。如果多节点集群能够全天候保持高利用率,自有硬件可能低于按 token 计费的价格。偶发的流量高峰不属于这种情况。

如果以上情况都不适用于你,直接使用端点,把权重视作一种选择,而不是既定计划。对大多数团队来说,开放权重前沿模型的价值不在于他们真的会去部署,而在于托管版本的定价现在必须面对一个可能性:用户理论上可以自己运行它。

FAQ

Kimi K3 是开源模型吗?

它是开放权重模型。完整的 2.8T checkpoint 可以下载,Kimi K3 License 也允许使用、修改、分发和微调。但训练数据和完整训练流程并未发布,许可证还针对 Model-as-a-Service 运营者增加了按营收触发的条款,因此它并非 OSI 风格的开源软件。

我能在本地用 Ollama 运行 Kimi K3 吗?

不能。Ollama 的 kimi-k3 条目实际是 kimi-k3:cloud,会路由至托管端点。原生 MXFP4 权重为 1.56 TB,社区 2-bit GGUF 版本仍有 928 GB,因此消费级硬件上不存在本地运行路径。

Kimi K3 权重使用什么许可证?

使用 Kimi K3 License:它基于 MIT 衍生而来,但如果你运营的 Model-as-a-Service 业务在任意连续 12 个月内营收超过 $20M,就必须先与 Moonshot 签订单独协议;产品月活超过 100M 或月收入超过 $20M 时,还需要在 UI 中展示归属信息。内部使用可豁免这两项要求。

不下载模型的话,能在哪里使用 Kimi K3?

可使用 Moonshot 自身的 API 和 Kimi app,也可通过 Baseten、Fireworks 与 Nebius 访问。截至 2026 年 7 月 28 日,四家服务商的基础价格均为每百万 token $3/$15,但实际比较仍需结合条件:Fireworks 另有 $4.50/$22.50 档位,而 Nebius 虽采用基础价格,上下文窗口却是 8K,而非 1M。想了解模型本身及其 benchmark 表现,可参阅 Kimi K3 overview。

>_AIReiter 模型目录

快速访问与本指南相关的模型 API

Kimi K3

Chat

用于编码、写作、分析和智能体工作流的长上下文推理模型。

Moonshot获取 API Key >

GPT-6 Astra

Chat

OpenAI 面向复杂推理、编程和长上下文工作的前沿模型。

OpenAI获取 API Key >

Claude Fable 5

Chat

一款用于深度推理和复杂长篇任务的高级 Claude 模型。

Anthropic获取 API Key >

Claude Fable 5.1

Chat

面向长程编程、研究与知识工作的 Mythos 级模型。

Anthropic获取 API Key >

Claude Opus 4.8

Chat

一款高能力的 Claude 模型,适用于高要求的推理和专业工作。

Anthropic获取 API Key >

最新文章

如何在 Janitor AI 中使用 DeepSeek(2026 设置指南)

2026-09-08

免费 LLM API 配额横评:11 家服务商(2026)

2026-09-08

Muse Spark 1.3 API 定价:Standard 与 Contributor 怎么选

2026-09-08

GPT-6 Astra API 评测(2026):为智能体而生,不是即插即用

2026-09-07
AIREITER

有问题?请联系我们
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

AI 视频

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

AI 图片

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

博客

查看全部 →

公司

隐私政策服务条款退款政策

© 2026 AIReiter。保留所有权利。