モデル / Kimi K3

Kimi K3 API

Moonshot AI-テキスト生成-$3.00 / 1M input Token-利用可能
1.05M コンテキストプロンプトキャッシュStreaming SSEOpenAI 互換
モデルを見る
100%稼働中

プロバイダー

Moonshot AI

モデル

Kimi K3

コンテキストウィンドウ

1,048,576 Token

プロトコル

Chat Completions

コンテキストがボトルネックなら Kimi K3 を選択

Kimi K3 は、コードリポジトリ、法務・ポリシー文書、研究メモ、ログ、過去のツール呼び出し、Agent の記憶など、多くの根拠を prompt に保持したいワークフロー向けの長文コンテキストモデルです。AIReiter は OpenAI 互換の Chat エンドポイントで提供します。

最適な用途

長文コンテキスト推論ルート

retrieval や分割処理を先に組まず、1回の大きなリクエストで作業セットを扱いたいときに適しています。

複雑なコンテキストを1回のリクエストへ

大規模コードベース、証拠量の多い文書群、長時間の Agent タスクを過度に分割せず扱えます。

接続を軽量に保つ

AIReiter は Kimi K3 を OpenAI Chat Completions で公開しているため、多くの場合 baseURL と model の変更だけで済みます。

長い prompt をキャッシュ前提にする

安定した system prompt、プロジェクト背景、文書プレフィックスが繰り返される場合は、usage フィールドでキャッシュ読み取りを確認します。

予算目安

現在の Token 構成から呼び出し可能回数を見積もります。

Credits をチャージ

$10

約13回のサンプルリクエスト

クイックテスト

$50

約65回のサンプルリクエスト

日常開発

$100

約130回のサンプルリクエスト

本番評価

料金

Kimi K3 Token 料金

料金は 1M Token あたりで表示されます。AIReiter では現在 Kimi K3 を公開モデル料金で表示しており、このページでは素早い接続、明確なエンドポイント、利用量の可視性を提供します。

Token 種別料金メモ
入力$3.00 / 1M安定プレフィックスがキャッシュから提供されない場合の prompt Token。
キャッシュ読み取り$0.30 / 1Musage フィールドに報告されるキャッシュ済み prompt Token。
出力$15.00 / 1M生成された応答 Token。推論が重い回答も含みます。

本番レイヤー

本番モデルスタックでの Kimi K3 の位置づけ

Kimi K3 は、コンテキストの連続性が結果を変える場面で特に有効です。単に回答するだけでなく、プロジェクト状態、根拠、ツール出力を保持し、次のステップを安定させます。

大規模コードベース開発

リスクの高い変更前に、設計メモ、サービス契約、既存テスト、diff、Issue をまとめて確認します。

長文ドキュメント分析

契約、ポリシー、研究メモ、証拠資料を同じ作業コンテキストで読み、早すぎる要約による欠落を避けます。

複数ステップのツール Agent

ツール呼び出し ID、中間観察、パラメータ、判断を保持し、後続ステップの一貫性を保ちます。

プロトタイプから本番へのレビュー

プロトタイプ、移行、Agent ワークフローが本番の境界条件に耐えるだけのコンテキストを持つか確認します。

本番チェックリスト

Kimi K3 を本番投入する前に確認する4項目

長文コンテキストモデルは短い prompt モデルとは異なる失敗をします。model ID、コンテキスト経路、会話状態、usage 記録を確認してください。

01

本番用 model ID を使う

API リクエストでは kimi-k3 を送信します。page-chat key の chat-kimi-k3 は AIReiter チャット UI 専用です。

Model ID
02

256K を同じ入口として扱わない

ここでの Kimi K3 は 1,048,576 Token に対応します。クライアント、プロキシ、タイムアウト設定が大きなリクエストを扱えるか確認してください。

コンテキスト
03

assistant とツール状態を保持

長い Agent 実行には過去の assistant messages、tool outputs、パラメータが必要です。削除すると見かけだけの連続性になります。

ツール状態
04

キャッシュと usage フィールドを記録

キャッシュ読み取り、出力 Token、推論が重い回答は、リクエスト数から推測せず usage フィールドで測定します。

Usage
request.ts
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.AIREITER_API_KEY,
  baseURL: "https://aireiter.com/api/v1",
});

const stream = await client.chat.completions.create({
  model: "kimi-k3",
  messages: [
    { role: "user", content: "このリポジトリを分析し、実装上もっともリスクの高い仮定を3つ特定してください。" }
  ],
  stream: true,
});

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}
terminal
curl "https://aireiter.com/api/v1/chat/completions"   -H "Authorization: Bearer $AIREITER_API_KEY"   -H "Content-Type: application/json"   -d '{
    "model": "kimi-k3",
    "messages": [
      { "role": "user", "content": "このリポジトリを分析し、実装上もっともリスクの高い仮定を3つ特定してください。" }
    ],
    "stream": true
  }'
cache-check.json
{
  "model": "kimi-k3",
  "messages": [
    { "role": "system", "content": "<安定したリポジトリまたはドキュメントのコンテキスト>" },
    { "role": "user", "content": "そのコンテキストを基に今日の diff をレビューしてください。" }
  ],
  "stream": true
}

// usage からキャッシュ読み取りを確認:
// usage.prompt_tokens_details.cached_tokens > 0

ユースケース

Kimi K3 が得意なこと

これらの場面では、1M Token のコンテキストウィンドウが小さな遅延や文体差より大きくワークフローを変えます。

長文コンテキスト推論

プロジェクト brief、設計メモ、ログ、最近の diff を1回のリクエストで読みます。

コーディング支援

コードベースレビュー、リスク発見、移行計画、実装レビューに使えます。

調査の統合

先に retrieval を作らず、多数の長文ドキュメントを要約・照合します。

Agent 計画

ツール履歴、タスク履歴、判断記録を会話ウィンドウに保持します。

コスト品質レビュー

Token 単価だけで比較しない

本番では、再試行、人手修正、ツール成功率、キャッシュ命中、信頼できる回答までの時間を含めた有用結果コストで評価します。

初回成功率
人手修正率
再試行回数
出力 Token
キャッシュ命中率
ツール呼び出し成功率
有用回答までの時間
エスカレーション率

Kimi K3 が再試行を減らし、より多くのコンテキストを保持できるなら、Token 数が多くても最終コストは下がる可能性があります。短く状態のないタスクには軽量モデルが適しています。

比較

Kimi K3 と AIReiter テキストモデルの比較

Kimi K3GPT-5.6 SolGemini 3.1 ProClaude Sonnet 4.6
kimi-k3gpt-5.6-solchat-gemini-3.1-prochat-claude-sonnet-4-6
AIReiter プロトコルChat CompletionsChat / Responses ファミリーページChat モデルルートClaude Messages ルート
最適用途1M コンテキストのコードベース、長文ドキュメント、Agent 状態OpenAI 互換の flagship reasoning大規模コンテキスト、マルチモーダル、文書密集タスクコードレビューと文書判断
選ぶタイミングコンテキスト連続性がボトルネックのときGPT-5.6 の品質や routing が必要なときGemini の文書・マルチモーダル挙動が重要なときClaude 風のコード品質が重要なとき

テスト準備完了

Key を作成し、Credits を追加して Kimi K3 リクエストを送信

最短ルートは API Key を作成し、Chat Completions エンドポイントを保ち、小さな streaming リクエストから始めることです。

FAQ

Kimi K3 API の質問

Kimi K3 は 1M Token あたりいくらですか?

公開ページでは、Kimi K3 はキャッシュなし入力 $3.00 / 1M Token、キャッシュ読み取り $0.30 / 1M Token、出力 $15.00 / 1M Token と表示されることが多いです。

Kimi K3 のコンテキストウィンドウはどれくらいですか?

Kimi K3 は 1,048,576 Token のコンテキストウィンドウとして掲載され、コードベース、長文書、Agent ログ評価に使われます。

コンテキストキャッシュは本当にコストを下げますか?

はい。キャッシュ入力は通常 $0.30 / 1M Token、未キャッシュ入力は $3.00 / 1M Token と表示されます。

API 呼び出しで使う model ID は?

model フィールドには "kimi-k3" を使い、https://aireiter.com/api/v1/chat/completions に送信します。内部 page-chat key を公開 API の model ID として使わないでください。

OpenAI 風の SDK で Kimi K3 を呼び出せますか?

はい。baseURL を https://aireiter.com/api/v1 に設定し、Chat Completions 形式のまま model "kimi-k3" を送信します。

本番で何を監視すべきですか?

キャッシュ読み取り Token、出力 Token、長いリクエストの遅延、再試行率、推論回答が実際に使える結果を返しているかを監視します。