Mettre un contexte complexe dans une seule requête
Adapté aux grandes bases de code, aux dossiers documentaires riches en preuves et aux tâches d’agents longues, sans découpage agressif.
Modèle / Kimi K3
Statut 24 h
Aucun trafic pour le moment
Fournisseur
Moonshot AI
Modèle
Kimi K3
Fenêtre de contexte
1,048,576 Token
Protocole
Chat Completions
Kimi K3 est un modèle texte à long contexte pour les workflows où il faut conserver beaucoup d’éléments dans le prompt : dépôts de code, dossiers juridiques ou politiques, notes de recherche, logs, appels d’outils précédents et mémoire d’agent. AIReiter l’expose via un endpoint Chat compatible OpenAI.
Meilleur usage
Route de raisonnement à long contexte
Utilisez Kimi K3 lorsque vous voulez qu’une grande requête porte tout le contexte de travail, sans construire d’abord un flux de retrieval ou de découpage.
Adapté aux grandes bases de code, aux dossiers documentaires riches en preuves et aux tâches d’agents longues, sans découpage agressif.
AIReiter expose Kimi K3 via OpenAI Chat Completions ; les applications existantes changent généralement seulement baseURL et model.
Quand des system prompts, contextes projet ou préfixes de documents se répètent, vérifiez les lectures de cache directement dans les champs usage.
Estimez le nombre d’appels possibles selon le mélange actuel de Token.
$10
environ 13 requêtes d’exemple
Test rapide
$50
environ 65 requêtes d’exemple
Développement quotidien
$100
environ 130 requêtes d’exemple
Évaluation production
Tarifs
Les prix sont affichés par 1M Token. AIReiter liste actuellement Kimi K3 au tarif public du modèle ; la valeur de cette page est l’accès rapide, la clarté de l’endpoint et la visibilité d’usage.
| Type de Token | Tarif | Notes |
|---|---|---|
| Entrée | $3.00 / 1M | Token de prompt lorsque le préfixe stable n’est pas servi depuis le cache. |
| Lecture cache | $0.30 / 1M | Token de prompt mis en cache et reportés dans les champs usage. |
| Sortie | $15.00 / 1M | Token de réponse générés, y compris les réponses avec raisonnement lourd. |
Couche production
Le modèle est le plus utile lorsque la continuité du contexte change le résultat : il ne répond pas seulement à un prompt, il transporte aussi l’état projet, les preuves et les sorties d’outils nécessaires à l’étape suivante.
Examiner notes d’architecture, contrats de service, anciens tests, diffs et issues avant une modification risquée.
Lire contrats, politiques, notes de recherche et dossiers de preuve dans le même contexte de travail, sans résumer trop tôt.
Conserver IDs d’appels d’outils, observations, paramètres et décisions pour garder la cohérence des étapes suivantes.
Utiliser Kimi K3 pour vérifier si un prototype, une migration ou un workflow agent a assez de contexte pour les cas limites de production.
Checklist production
Les modèles à long contexte échouent autrement que les petits prompts. Vérifiez model ID, chemin du contexte, état de conversation et enregistrements usage.
Envoyez kimi-k3 dans les requêtes API. La clé page-chat chat-kimi-k3 sert seulement à l’interface chat AIReiter.
Ici, Kimi K3 prend en charge 1,048,576 Token. Vérifiez que client, proxy et timeouts supportent de grandes requêtes.
Les longues exécutions d’agents ont besoin des anciens assistant messages, tool outputs et paramètres. Les supprimer crée souvent une fausse continuité.
Lectures de cache, Token de sortie et réponses de raisonnement doivent être mesurés depuis usage, pas déduits du nombre de requêtes.
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.AIREITER_API_KEY,
baseURL: "https://aireiter.com/api/v1",
});
const stream = await client.chat.completions.create({
model: "kimi-k3",
messages: [
{ role: "user", content: "Analysez ce dépôt et identifiez les trois hypothèses d’implémentation les plus risquées." }
],
stream: true,
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}curl "https://aireiter.com/api/v1/chat/completions" -H "Authorization: Bearer $AIREITER_API_KEY" -H "Content-Type: application/json" -d '{
"model": "kimi-k3",
"messages": [
{ "role": "user", "content": "Analysez ce dépôt et identifiez les trois hypothèses d’implémentation les plus risquées." }
],
"stream": true
}'{
"model": "kimi-k3",
"messages": [
{ "role": "system", "content": "<contexte stable du dépôt ou du document>" },
{ "role": "user", "content": "Vérifiez le diff du jour par rapport à ce contexte." }
],
"stream": true
}
// Confirmez les lectures de cache depuis usage :
// usage.prompt_tokens_details.cached_tokens > 0Cas d’usage
Dans ces cas, une fenêtre de contexte 1M Token change davantage le workflow qu’une petite différence de latence ou de style.
Lire brief projet, notes d’architecture, logs et diffs récents dans une seule requête.
Pour revue de codebase, détection de risques, planification de migration et critique d’implémentation.
Résumer et rapprocher de nombreux documents longs sans construire d’abord un système de retrieval.
Garder traces d’outils, historique des tâches et décisions dans la fenêtre de conversation.
Revue coût-qualité
En production, mesurez le coût du résultat utile : retries, édition humaine, succès des outils, cache hits et temps jusqu’à une réponse fiable.
Si Kimi K3 réduit les retries et conserve plus de contexte, plus de Token peuvent malgré tout baisser le coût final. Pour une tâche courte et sans état, choisissez un modèle plus léger.
Comparer
| Dimension | Kimi K3 | GPT-5.6 Sol | Gemini 3.1 Pro | Claude Sonnet 4.6 |
|---|---|---|---|---|
| Dimension | kimi-k3 | gpt-5.6-sol | chat-gemini-3.1-pro | chat-claude-sonnet-4-6 |
| Protocole AIReiter | Chat Completions | Page famille Chat / Responses | Route modèle Chat | Route Claude Messages |
| Meilleur usage | Bases de code 1M contexte, longs documents, état agent | Raisonnement flagship compatible OpenAI | Grand contexte, multimodal et documents denses | Revue de code et jugement documentaire |
| Quand le choisir | Quand la continuité du contexte est le goulot d’étranglement | Quand la qualité ou le routing GPT-5.6 est requis | Quand le comportement document ou multimodal de Gemini compte | Quand la qualité de code façon Claude compte |
Prêt à tester
Chemin le plus rapide : créer une API Key, garder Chat Completions et commencer par une petite requête streaming.
FAQ
Les pages publiques listent généralement Kimi K3 à $3.00 par 1M Token d’entrée non cache, $0.30 par 1M Token lus depuis cache et $15.00 par 1M Token de sortie.
Kimi K3 est listé avec une fenêtre de contexte de 1,048,576 Token, utile pour codebases, longs documents et traces d’agents.
Oui. L’entrée en cache est souvent à $0.30 par 1M Token contre $3.00 par 1M Token non cache.
Utilisez "kimi-k3" dans model et envoyez vers https://aireiter.com/api/v1/chat/completions. N’utilisez pas la clé interne page-chat comme model ID public.
Oui. Définissez baseURL sur https://aireiter.com/api/v1, gardez Chat Completions et envoyez model "kimi-k3".
Token lus depuis cache, Token de sortie, latence des longues requêtes, retries et qualité réellement utilisable des réponses de raisonnement.