複雑なコンテキストを1回のリクエストへ
大規模コードベース、証拠量の多い文書群、長時間の Agent タスクを過度に分割せず扱えます。
モデル / Kimi K3
24時間ステータス
まだトラフィックはありません
プロバイダー
Moonshot AI
モデル
Kimi K3
コンテキストウィンドウ
1,048,576 Token
プロトコル
Chat Completions
Kimi K3 は、コードリポジトリ、法務・ポリシー文書、研究メモ、ログ、過去のツール呼び出し、Agent の記憶など、多くの根拠を prompt に保持したいワークフロー向けの長文コンテキストモデルです。AIReiter は OpenAI 互換の Chat エンドポイントで提供します。
最適な用途
長文コンテキスト推論ルート
retrieval や分割処理を先に組まず、1回の大きなリクエストで作業セットを扱いたいときに適しています。
大規模コードベース、証拠量の多い文書群、長時間の Agent タスクを過度に分割せず扱えます。
AIReiter は Kimi K3 を OpenAI Chat Completions で公開しているため、多くの場合 baseURL と model の変更だけで済みます。
安定した system prompt、プロジェクト背景、文書プレフィックスが繰り返される場合は、usage フィールドでキャッシュ読み取りを確認します。
現在の Token 構成から呼び出し可能回数を見積もります。
$10
約13回のサンプルリクエスト
クイックテスト
$50
約65回のサンプルリクエスト
日常開発
$100
約130回のサンプルリクエスト
本番評価
料金
料金は 1M Token あたりで表示されます。AIReiter では現在 Kimi K3 を公開モデル料金で表示しており、このページでは素早い接続、明確なエンドポイント、利用量の可視性を提供します。
| Token 種別 | 料金 | メモ |
|---|---|---|
| 入力 | $3.00 / 1M | 安定プレフィックスがキャッシュから提供されない場合の prompt Token。 |
| キャッシュ読み取り | $0.30 / 1M | usage フィールドに報告されるキャッシュ済み prompt Token。 |
| 出力 | $15.00 / 1M | 生成された応答 Token。推論が重い回答も含みます。 |
本番レイヤー
Kimi K3 は、コンテキストの連続性が結果を変える場面で特に有効です。単に回答するだけでなく、プロジェクト状態、根拠、ツール出力を保持し、次のステップを安定させます。
リスクの高い変更前に、設計メモ、サービス契約、既存テスト、diff、Issue をまとめて確認します。
契約、ポリシー、研究メモ、証拠資料を同じ作業コンテキストで読み、早すぎる要約による欠落を避けます。
ツール呼び出し ID、中間観察、パラメータ、判断を保持し、後続ステップの一貫性を保ちます。
プロトタイプ、移行、Agent ワークフローが本番の境界条件に耐えるだけのコンテキストを持つか確認します。
本番チェックリスト
長文コンテキストモデルは短い prompt モデルとは異なる失敗をします。model ID、コンテキスト経路、会話状態、usage 記録を確認してください。
API リクエストでは kimi-k3 を送信します。page-chat key の chat-kimi-k3 は AIReiter チャット UI 専用です。
ここでの Kimi K3 は 1,048,576 Token に対応します。クライアント、プロキシ、タイムアウト設定が大きなリクエストを扱えるか確認してください。
長い Agent 実行には過去の assistant messages、tool outputs、パラメータが必要です。削除すると見かけだけの連続性になります。
キャッシュ読み取り、出力 Token、推論が重い回答は、リクエスト数から推測せず usage フィールドで測定します。
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.AIREITER_API_KEY,
baseURL: "https://aireiter.com/api/v1",
});
const stream = await client.chat.completions.create({
model: "kimi-k3",
messages: [
{ role: "user", content: "このリポジトリを分析し、実装上もっともリスクの高い仮定を3つ特定してください。" }
],
stream: true,
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}curl "https://aireiter.com/api/v1/chat/completions" -H "Authorization: Bearer $AIREITER_API_KEY" -H "Content-Type: application/json" -d '{
"model": "kimi-k3",
"messages": [
{ "role": "user", "content": "このリポジトリを分析し、実装上もっともリスクの高い仮定を3つ特定してください。" }
],
"stream": true
}'{
"model": "kimi-k3",
"messages": [
{ "role": "system", "content": "<安定したリポジトリまたはドキュメントのコンテキスト>" },
{ "role": "user", "content": "そのコンテキストを基に今日の diff をレビューしてください。" }
],
"stream": true
}
// usage からキャッシュ読み取りを確認:
// usage.prompt_tokens_details.cached_tokens > 0ユースケース
これらの場面では、1M Token のコンテキストウィンドウが小さな遅延や文体差より大きくワークフローを変えます。
プロジェクト brief、設計メモ、ログ、最近の diff を1回のリクエストで読みます。
コードベースレビュー、リスク発見、移行計画、実装レビューに使えます。
先に retrieval を作らず、多数の長文ドキュメントを要約・照合します。
ツール履歴、タスク履歴、判断記録を会話ウィンドウに保持します。
コスト品質レビュー
本番では、再試行、人手修正、ツール成功率、キャッシュ命中、信頼できる回答までの時間を含めた有用結果コストで評価します。
Kimi K3 が再試行を減らし、より多くのコンテキストを保持できるなら、Token 数が多くても最終コストは下がる可能性があります。短く状態のないタスクには軽量モデルが適しています。
比較
| 軸 | Kimi K3 | GPT-5.6 Sol | Gemini 3.1 Pro | Claude Sonnet 4.6 |
|---|---|---|---|---|
| 軸 | kimi-k3 | gpt-5.6-sol | chat-gemini-3.1-pro | chat-claude-sonnet-4-6 |
| AIReiter プロトコル | Chat Completions | Chat / Responses ファミリーページ | Chat モデルルート | Claude Messages ルート |
| 最適用途 | 1M コンテキストのコードベース、長文ドキュメント、Agent 状態 | OpenAI 互換の flagship reasoning | 大規模コンテキスト、マルチモーダル、文書密集タスク | コードレビューと文書判断 |
| 選ぶタイミング | コンテキスト連続性がボトルネックのとき | GPT-5.6 の品質や routing が必要なとき | Gemini の文書・マルチモーダル挙動が重要なとき | Claude 風のコード品質が重要なとき |
テスト準備完了
最短ルートは API Key を作成し、Chat Completions エンドポイントを保ち、小さな streaming リクエストから始めることです。
FAQ
公開ページでは、Kimi K3 はキャッシュなし入力 $3.00 / 1M Token、キャッシュ読み取り $0.30 / 1M Token、出力 $15.00 / 1M Token と表示されることが多いです。
Kimi K3 は 1,048,576 Token のコンテキストウィンドウとして掲載され、コードベース、長文書、Agent ログ評価に使われます。
はい。キャッシュ入力は通常 $0.30 / 1M Token、未キャッシュ入力は $3.00 / 1M Token と表示されます。
model フィールドには "kimi-k3" を使い、https://aireiter.com/api/v1/chat/completions に送信します。内部 page-chat key を公開 API の model ID として使わないでください。
はい。baseURL を https://aireiter.com/api/v1 に設定し、Chat Completions 形式のまま model "kimi-k3" を送信します。
キャッシュ読み取り Token、出力 Token、長いリクエストの遅延、再試行率、推論回答が実際に使える結果を返しているかを監視します。