模型 / Kimi K3

Kimi K3 API

Moonshot AI-文字生成-$3.00 / 1M 輸入 Token-可用
1.05M 上下文提示詞缓存串流 SSE相容 OpenAI
查看模型
100%線上

供應商

Moonshot AI

模型

Kimi K3

上下文視窗

1,048,576 Token

協定

Chat Completions

當上下文成為瓶頸時,選擇 Kimi K3

Kimi K3 是面向长上下文文本任务的模型,适合把大量证据放进提示詞里的工作流:代码仓库、法律或政策材料、研究笔记、日志、历史工具调用和 Agent 记忆。AIReiter 通过熟悉的 OpenAI 相容 Chat 接口提供这个模型。

適合場景

長上下文推理入口

如果你希望一次大型請求攜帶完整工作集,而不是先建立檢索或切片流程,就適合使用 Kimi K3。

把複雜上下文放進一次請求

适合大型程式碼庫、证据密集型文件包和长周期 Agent 任务,不需要过度拆分上下文。

保持接入輕量

AIReiter 透過 OpenAI Chat Completions 暴露 Kimi K3,既有應用通常只需要修改 baseURL 和 model。

让长提示詞具备缓存意识

当稳定的 system prompt、项目背景或文件前缀重复出现时,直接从 usage 字段验证缓存读取。

預算參考

按目前 Token 組合估算可呼叫次數。

儲值 Credits

$10

約 13 次範例請求

快速測試

$50

約 65 次範例請求

日常開發

$100

約 130 次範例請求

生產評估

價格

Kimi K3 Token 價格

價格按每 1M Token 展示。AIReiter 目前按 Kimi K3 公开模型價格展示,因此这个页面的价值在于快速接入、端点清晰和用量可见。

Token 类型價格說明
輸入$3.00 / 1M稳定前缀没有从缓存读取时产生的提示詞 Token。
缓存读取$0.30 / 1M在 usage 字段中上报的已缓存提示詞 Token。
輸出$15.00 / 1M生成回答的 Token,包括推理較重的回答。

生產接入層

Kimi K3 在生產模型堆疊中的位置

当上下文连续性会改变结果时,Kimi K3 最有价值:它不只是回答一个提示詞,而是携带足够的项目狀態、证据和工具輸出来让下一步更可靠。

大型程式碼庫開發

在进行高风险改动前,一次性审查架构說明、服务契約、旧测试、diff 和问题报告。

长文件分析

把合約、政策、研究筆記和證據材料放在同一個工作上下文中,而不是過早摘要導致細節遺失。

多步驟工具 Agent

保留工具呼叫 ID、中間觀察、參數和決策記錄,讓後續步驟保持一致。

原型到生產的審查

用 Kimi K3 檢查原型、遷移或 Agent 工作流是否有足夠上下文來應對生產邊界情況。

生產檢查清單

上線 Kimi K3 前先確認這四件事

长上下文模型的失败方式不同于短提示詞模型。上线前先确认模型 ID、上下文路径、会话狀態和用量记录。

01

使用生產模型 ID

API 請求中傳送 kimi-k3。page-chat key chat-kimi-k3 只用於 AIReiter 聊天頁。

模型 ID
02

不要把 256K 當成同一個入口

這裡的 Kimi K3 支援 1,048,576 Token。請確認你的用戶端、代理和逾時設定真的能承載大型請求。

上下文
03

保留 assistant 和工具狀態

长周期 Agent 运行需要历史 assistant 消息、工具輸出和参数。丢掉这些内容经常会制造假的连续性。

工具狀態
04

記錄快取和用量欄位

缓存读取、輸出 Token 和推理较重的回答都应该从 usage 字段计量,而不是通过请求次数猜测。

用量
request.ts
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.AIREITER_API_KEY,
  baseURL: "https://aireiter.com/api/v1",
});

const stream = await client.chat.completions.create({
  model: "kimi-k3",
  messages: [
    { role: "user", content: "分析這個程式碼倉庫,並找出三個風險最高的實作假設。" }
  ],
  stream: true,
});

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}
terminal
curl "https://aireiter.com/api/v1/chat/completions"   -H "Authorization: Bearer $AIREITER_API_KEY"   -H "Content-Type: application/json"   -d '{
    "model": "kimi-k3",
    "messages": [
      { "role": "user", "content": "分析這個程式碼倉庫,並找出三個風險最高的實作假設。" }
    ],
    "stream": true
  }'
cache-check.json
{
  "model": "kimi-k3",
  "messages": [
    { "role": "system", "content": "<稳定的代码仓库或文件上下文>" },
    { "role": "user", "content": "基於這段上下文,審查今天的 diff。" }
  ],
  "stream": true
}

// 從 usage 中確認快取讀取:
// usage.prompt_tokens_details.cached_tokens > 0

使用場景

Kimi K3 擅長什麼

这些场景里,1M Token 上下文視窗带来的工作流变化,比一点延迟或风格差异更重要。

长上下文推理

一次请求读取完整项目 brief、架构說明、日志和最近 diff。

程式碼助手

用於程式碼庫審查、高風險變更發現、遷移規劃和實作方案批判。

研究整合

在不先搭建检索流程的情况下,汇总并调和大量长文件。

Agent 規劃

把工具轨迹、任务历史和决策记录保留在对话視窗中。

成本品質評估

不要只按 Token 單價比較成本

生產任務裡,Kimi K3 應該按「可用結果成本」衡量:重試、人工修改、工具成功率、快取命中和取得可靠答案的時間。

首次通過率
人工改寫率
重試次數
輸出 Token
快取命中率
工具呼叫成功率
取得可用答案耗時
升級處理率

如果 Kimi K3 能减少重试并保留更多上下文,即使 Token 数更高,也可能带来更低的最终任务成本。如果任务短且无狀態,应选择更轻量的模型。

比較

Kimi K3 与 AIReiter 文本模型比較

維度Kimi K3GPT-5.6 SolGemini 3.1 ProClaude Sonnet 4.6
維度kimi-k3gpt-5.6-solchat-gemini-3.1-prochat-claude-sonnet-4-6
AIReiter 協定Chat CompletionsChat / Responses 系列页面Chat 模型路由Claude Messages 路由
適合場景1M 上下文程式碼庫、长文件、Agent 狀態OpenAI 相容的旗舰推理大上下文多模态和文件密集型任务代码审查和文件判断
什麼時候選擇當上下文連續性是瓶頸時當需要 GPT-5.6 品質或路由時当 Gemini 的文件或多模态表现更重要时當 Claude 風格的程式碼品質更重要時

準備測試

建立 Key、儲值 Credits,然后发送一次 Kimi K3 请求

对开发者来说,最快路径是:建立 API Key,保持 Chat Completions 端点不变,先用一个小的串流请求测试,再把大上下文放到生产流量里。

FAQ

Kimi K3 API 常見問題

Kimi K3 每 1M Token 多少錢?

公开页面通常列出 Kimi K3 的價格为:缓存未命中輸入 $3.00 / 1M Token,缓存读取輸入 $0.30 / 1M Token,輸出 $15.00 / 1M Token。

Kimi K3 的上下文視窗有多大?

Kimi K3 标注为 1,048,576 Token 上下文視窗,这也是团队用它评估程式碼庫、长文件和 Agent 记录的主要原因。

上下文快取真的能降低成本嗎?

能。缓存輸入通常显示为 $0.30 / 1M Token,而未缓存輸入为 $3.00 / 1M Token;当可复用上下文从缓存读取时,輸入價格低 90%。

API 调用應該使用哪個模型 ID?

在 model 欄位中使用「kimi-k3」,請求傳送到 https://aireiter.com/api/v1/chat/completions。不要把內部 page-chat key 當作公開 API 模型 ID 使用。

可以用 OpenAI 風格的 SDK 呼叫 Kimi K3 嗎?

可以。Kimi K3 API 指南通常會展示 OpenAI 風格用戶端。在 AIReiter 中,將 baseURL 設定為 https://aireiter.com/api/v1,保持 Chat Completions 格式,並傳送 model「kimi-k3」。

生產使用時應該關注哪些指標?

关注缓存读取 Token、輸出 Token、长请求延迟、重试率,以及推理较重的回答是否真正产出了工作流需要的可用答案。