把複雜上下文放進一次請求
适合大型程式碼庫、证据密集型文件包和长周期 Agent 任务,不需要过度拆分上下文。
模型 / Kimi K3
24 小時狀態
暫無流量
供應商
Moonshot AI
模型
Kimi K3
上下文視窗
1,048,576 Token
協定
Chat Completions
Kimi K3 是面向长上下文文本任务的模型,适合把大量证据放进提示詞里的工作流:代码仓库、法律或政策材料、研究笔记、日志、历史工具调用和 Agent 记忆。AIReiter 通过熟悉的 OpenAI 相容 Chat 接口提供这个模型。
適合場景
長上下文推理入口
如果你希望一次大型請求攜帶完整工作集,而不是先建立檢索或切片流程,就適合使用 Kimi K3。
适合大型程式碼庫、证据密集型文件包和长周期 Agent 任务,不需要过度拆分上下文。
AIReiter 透過 OpenAI Chat Completions 暴露 Kimi K3,既有應用通常只需要修改 baseURL 和 model。
当稳定的 system prompt、项目背景或文件前缀重复出现时,直接从 usage 字段验证缓存读取。
按目前 Token 組合估算可呼叫次數。
$10
約 13 次範例請求
快速測試
$50
約 65 次範例請求
日常開發
$100
約 130 次範例請求
生產評估
價格
價格按每 1M Token 展示。AIReiter 目前按 Kimi K3 公开模型價格展示,因此这个页面的价值在于快速接入、端点清晰和用量可见。
| Token 类型 | 價格 | 說明 |
|---|---|---|
| 輸入 | $3.00 / 1M | 稳定前缀没有从缓存读取时产生的提示詞 Token。 |
| 缓存读取 | $0.30 / 1M | 在 usage 字段中上报的已缓存提示詞 Token。 |
| 輸出 | $15.00 / 1M | 生成回答的 Token,包括推理較重的回答。 |
生產接入層
当上下文连续性会改变结果时,Kimi K3 最有价值:它不只是回答一个提示詞,而是携带足够的项目狀態、证据和工具輸出来让下一步更可靠。
在进行高风险改动前,一次性审查架构說明、服务契約、旧测试、diff 和问题报告。
把合約、政策、研究筆記和證據材料放在同一個工作上下文中,而不是過早摘要導致細節遺失。
保留工具呼叫 ID、中間觀察、參數和決策記錄,讓後續步驟保持一致。
用 Kimi K3 檢查原型、遷移或 Agent 工作流是否有足夠上下文來應對生產邊界情況。
生產檢查清單
长上下文模型的失败方式不同于短提示詞模型。上线前先确认模型 ID、上下文路径、会话狀態和用量记录。
API 請求中傳送 kimi-k3。page-chat key chat-kimi-k3 只用於 AIReiter 聊天頁。
這裡的 Kimi K3 支援 1,048,576 Token。請確認你的用戶端、代理和逾時設定真的能承載大型請求。
长周期 Agent 运行需要历史 assistant 消息、工具輸出和参数。丢掉这些内容经常会制造假的连续性。
缓存读取、輸出 Token 和推理较重的回答都应该从 usage 字段计量,而不是通过请求次数猜测。
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.AIREITER_API_KEY,
baseURL: "https://aireiter.com/api/v1",
});
const stream = await client.chat.completions.create({
model: "kimi-k3",
messages: [
{ role: "user", content: "分析這個程式碼倉庫,並找出三個風險最高的實作假設。" }
],
stream: true,
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}curl "https://aireiter.com/api/v1/chat/completions" -H "Authorization: Bearer $AIREITER_API_KEY" -H "Content-Type: application/json" -d '{
"model": "kimi-k3",
"messages": [
{ "role": "user", "content": "分析這個程式碼倉庫,並找出三個風險最高的實作假設。" }
],
"stream": true
}'{
"model": "kimi-k3",
"messages": [
{ "role": "system", "content": "<稳定的代码仓库或文件上下文>" },
{ "role": "user", "content": "基於這段上下文,審查今天的 diff。" }
],
"stream": true
}
// 從 usage 中確認快取讀取:
// usage.prompt_tokens_details.cached_tokens > 0使用場景
这些场景里,1M Token 上下文視窗带来的工作流变化,比一点延迟或风格差异更重要。
一次请求读取完整项目 brief、架构說明、日志和最近 diff。
用於程式碼庫審查、高風險變更發現、遷移規劃和實作方案批判。
在不先搭建检索流程的情况下,汇总并调和大量长文件。
把工具轨迹、任务历史和决策记录保留在对话視窗中。
成本品質評估
生產任務裡,Kimi K3 應該按「可用結果成本」衡量:重試、人工修改、工具成功率、快取命中和取得可靠答案的時間。
如果 Kimi K3 能减少重试并保留更多上下文,即使 Token 数更高,也可能带来更低的最终任务成本。如果任务短且无狀態,应选择更轻量的模型。
比較
| 維度 | Kimi K3 | GPT-5.6 Sol | Gemini 3.1 Pro | Claude Sonnet 4.6 |
|---|---|---|---|---|
| 維度 | kimi-k3 | gpt-5.6-sol | chat-gemini-3.1-pro | chat-claude-sonnet-4-6 |
| AIReiter 協定 | Chat Completions | Chat / Responses 系列页面 | Chat 模型路由 | Claude Messages 路由 |
| 適合場景 | 1M 上下文程式碼庫、长文件、Agent 狀態 | OpenAI 相容的旗舰推理 | 大上下文多模态和文件密集型任务 | 代码审查和文件判断 |
| 什麼時候選擇 | 當上下文連續性是瓶頸時 | 當需要 GPT-5.6 品質或路由時 | 当 Gemini 的文件或多模态表现更重要时 | 當 Claude 風格的程式碼品質更重要時 |
準備測試
对开发者来说,最快路径是:建立 API Key,保持 Chat Completions 端点不变,先用一个小的串流请求测试,再把大上下文放到生产流量里。
FAQ
公开页面通常列出 Kimi K3 的價格为:缓存未命中輸入 $3.00 / 1M Token,缓存读取輸入 $0.30 / 1M Token,輸出 $15.00 / 1M Token。
Kimi K3 标注为 1,048,576 Token 上下文視窗,这也是团队用它评估程式碼庫、长文件和 Agent 记录的主要原因。
能。缓存輸入通常显示为 $0.30 / 1M Token,而未缓存輸入为 $3.00 / 1M Token;当可复用上下文从缓存读取时,輸入價格低 90%。
在 model 欄位中使用「kimi-k3」,請求傳送到 https://aireiter.com/api/v1/chat/completions。不要把內部 page-chat key 當作公開 API 模型 ID 使用。
可以。Kimi K3 API 指南通常會展示 OpenAI 風格用戶端。在 AIReiter 中,將 baseURL 設定為 https://aireiter.com/api/v1,保持 Chat Completions 格式,並傳送 model「kimi-k3」。
关注缓存读取 Token、輸出 Token、长请求延迟、重试率,以及推理较重的回答是否真正产出了工作流需要的可用答案。