Modèle / Kimi K3

Kimi K3 API

Moonshot AI-Génération de texte-$3.00 / 1M input Token-Disponible
Contexte 1,05MCache de promptStreaming SSECompatible OpenAI
Voir le modèle
100%En ligne

Fournisseur

Moonshot AI

Modèle

Kimi K3

Fenêtre de contexte

1,048,576 Token

Protocole

Chat Completions

Choisissez Kimi K3 quand le contexte devient le goulot d’étranglement

Kimi K3 est un modèle texte à long contexte pour les workflows où il faut conserver beaucoup d’éléments dans le prompt : dépôts de code, dossiers juridiques ou politiques, notes de recherche, logs, appels d’outils précédents et mémoire d’agent. AIReiter l’expose via un endpoint Chat compatible OpenAI.

Meilleur usage

Route de raisonnement à long contexte

Utilisez Kimi K3 lorsque vous voulez qu’une grande requête porte tout le contexte de travail, sans construire d’abord un flux de retrieval ou de découpage.

Mettre un contexte complexe dans une seule requête

Adapté aux grandes bases de code, aux dossiers documentaires riches en preuves et aux tâches d’agents longues, sans découpage agressif.

Garder une intégration légère

AIReiter expose Kimi K3 via OpenAI Chat Completions ; les applications existantes changent généralement seulement baseURL et model.

Rendre les longs prompts compatibles avec le cache

Quand des system prompts, contextes projet ou préfixes de documents se répètent, vérifiez les lectures de cache directement dans les champs usage.

Référence de budget

Estimez le nombre d’appels possibles selon le mélange actuel de Token.

Recharger des Credits

$10

environ 13 requêtes d’exemple

Test rapide

$50

environ 65 requêtes d’exemple

Développement quotidien

$100

environ 130 requêtes d’exemple

Évaluation production

Tarifs

Tarifs Token de Kimi K3

Les prix sont affichés par 1M Token. AIReiter liste actuellement Kimi K3 au tarif public du modèle ; la valeur de cette page est l’accès rapide, la clarté de l’endpoint et la visibilité d’usage.

Type de TokenTarifNotes
Entrée$3.00 / 1MToken de prompt lorsque le préfixe stable n’est pas servi depuis le cache.
Lecture cache$0.30 / 1MToken de prompt mis en cache et reportés dans les champs usage.
Sortie$15.00 / 1MToken de réponse générés, y compris les réponses avec raisonnement lourd.

Couche production

Où placer Kimi K3 dans une stack de modèles production

Le modèle est le plus utile lorsque la continuité du contexte change le résultat : il ne répond pas seulement à un prompt, il transporte aussi l’état projet, les preuves et les sorties d’outils nécessaires à l’étape suivante.

Développement de grandes bases de code

Examiner notes d’architecture, contrats de service, anciens tests, diffs et issues avant une modification risquée.

Analyse de longs documents

Lire contrats, politiques, notes de recherche et dossiers de preuve dans le même contexte de travail, sans résumer trop tôt.

Agents multi-étapes avec outils

Conserver IDs d’appels d’outils, observations, paramètres et décisions pour garder la cohérence des étapes suivantes.

Revue du prototype à la production

Utiliser Kimi K3 pour vérifier si un prototype, une migration ou un workflow agent a assez de contexte pour les cas limites de production.

Checklist production

Confirmez ces quatre points avant de livrer Kimi K3

Les modèles à long contexte échouent autrement que les petits prompts. Vérifiez model ID, chemin du contexte, état de conversation et enregistrements usage.

01

Utiliser le model ID de production

Envoyez kimi-k3 dans les requêtes API. La clé page-chat chat-kimi-k3 sert seulement à l’interface chat AIReiter.

Model ID
02

Ne pas traiter 256K comme la même entrée

Ici, Kimi K3 prend en charge 1,048,576 Token. Vérifiez que client, proxy et timeouts supportent de grandes requêtes.

Contexte
03

Préserver l’état assistant et outils

Les longues exécutions d’agents ont besoin des anciens assistant messages, tool outputs et paramètres. Les supprimer crée souvent une fausse continuité.

État outils
04

Enregistrer cache et champs usage

Lectures de cache, Token de sortie et réponses de raisonnement doivent être mesurés depuis usage, pas déduits du nombre de requêtes.

Usage
request.ts
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.AIREITER_API_KEY,
  baseURL: "https://aireiter.com/api/v1",
});

const stream = await client.chat.completions.create({
  model: "kimi-k3",
  messages: [
    { role: "user", content: "Analysez ce dépôt et identifiez les trois hypothèses d’implémentation les plus risquées." }
  ],
  stream: true,
});

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}
terminal
curl "https://aireiter.com/api/v1/chat/completions"   -H "Authorization: Bearer $AIREITER_API_KEY"   -H "Content-Type: application/json"   -d '{
    "model": "kimi-k3",
    "messages": [
      { "role": "user", "content": "Analysez ce dépôt et identifiez les trois hypothèses d’implémentation les plus risquées." }
    ],
    "stream": true
  }'
cache-check.json
{
  "model": "kimi-k3",
  "messages": [
    { "role": "system", "content": "<contexte stable du dépôt ou du document>" },
    { "role": "user", "content": "Vérifiez le diff du jour par rapport à ce contexte." }
  ],
  "stream": true
}

// Confirmez les lectures de cache depuis usage :
// usage.prompt_tokens_details.cached_tokens > 0

Cas d’usage

Ce que Kimi K3 fait bien

Dans ces cas, une fenêtre de contexte 1M Token change davantage le workflow qu’une petite différence de latence ou de style.

Raisonnement long contexte

Lire brief projet, notes d’architecture, logs et diffs récents dans une seule requête.

Assistant de code

Pour revue de codebase, détection de risques, planification de migration et critique d’implémentation.

Synthèse de recherche

Résumer et rapprocher de nombreux documents longs sans construire d’abord un système de retrieval.

Planification d’agents

Garder traces d’outils, historique des tâches et décisions dans la fenêtre de conversation.

Revue coût-qualité

Ne comparez pas le prix Token sans le coût de tâche

En production, mesurez le coût du résultat utile : retries, édition humaine, succès des outils, cache hits et temps jusqu’à une réponse fiable.

Taux de réussite au premier passage
Taux de réécriture humaine
Nombre de retries
Token de sortie
Taux de cache hit
Succès des appels d’outils
Temps jusqu’à réponse utile
Taux d’escalade

Si Kimi K3 réduit les retries et conserve plus de contexte, plus de Token peuvent malgré tout baisser le coût final. Pour une tâche courte et sans état, choisissez un modèle plus léger.

Comparer

Kimi K3 comparé aux modèles texte AIReiter

DimensionKimi K3GPT-5.6 SolGemini 3.1 ProClaude Sonnet 4.6
Dimensionkimi-k3gpt-5.6-solchat-gemini-3.1-prochat-claude-sonnet-4-6
Protocole AIReiterChat CompletionsPage famille Chat / ResponsesRoute modèle ChatRoute Claude Messages
Meilleur usageBases de code 1M contexte, longs documents, état agentRaisonnement flagship compatible OpenAIGrand contexte, multimodal et documents densesRevue de code et jugement documentaire
Quand le choisirQuand la continuité du contexte est le goulot d’étranglementQuand la qualité ou le routing GPT-5.6 est requisQuand le comportement document ou multimodal de Gemini compteQuand la qualité de code façon Claude compte

Prêt à tester

Créez une clé, rechargez des Credits, puis envoyez une requête Kimi K3

Chemin le plus rapide : créer une API Key, garder Chat Completions et commencer par une petite requête streaming.

FAQ

Questions sur Kimi K3 API

Combien coûte Kimi K3 par 1M Token ?

Les pages publiques listent généralement Kimi K3 à $3.00 par 1M Token d’entrée non cache, $0.30 par 1M Token lus depuis cache et $15.00 par 1M Token de sortie.

Quelle est la taille du contexte de Kimi K3 ?

Kimi K3 est listé avec une fenêtre de contexte de 1,048,576 Token, utile pour codebases, longs documents et traces d’agents.

Le cache de contexte réduit-il vraiment les coûts ?

Oui. L’entrée en cache est souvent à $0.30 par 1M Token contre $3.00 par 1M Token non cache.

Quel model ID utiliser ?

Utilisez "kimi-k3" dans model et envoyez vers https://aireiter.com/api/v1/chat/completions. N’utilisez pas la clé interne page-chat comme model ID public.

Puis-je appeler Kimi K3 avec un SDK style OpenAI ?

Oui. Définissez baseURL sur https://aireiter.com/api/v1, gardez Chat Completions et envoyez model "kimi-k3".

Que surveiller en production ?

Token lus depuis cache, Token de sortie, latence des longues requêtes, retries et qualité réellement utilisable des réponses de raisonnement.