Komplexen Kontext in eine Anfrage legen
Geeignet für große Codebasen, evidenzreiche Dokumentpakete und lang laufende Agent-Aufgaben ohne aggressives Aufteilen.
Modell / Kimi K3
24h-Status
Noch kein Traffic
Anbieter
Moonshot AI
Modell
Kimi K3
Kontextfenster
1,048,576 Token
Protokoll
Chat Completions
Kimi K3 ist ein Long-Context-Textmodell für Workflows, in denen genügend Evidenz im Prompt bleiben muss: Code-Repositories, Rechts- oder Policy-Pakete, Forschungsnotizen, Logs, frühere Tool-Aufrufe und Agent-Memory. AIReiter stellt das Modell über einen vertrauten OpenAI-kompatiblen Chat-Endpunkt bereit.
Am besten geeignet
Route für Long-Context-Reasoning
Nutze Kimi K3, wenn eine große Anfrage den Arbeitskontext tragen soll, statt zuerst Retrieval oder Chunking aufzubauen.
Geeignet für große Codebasen, evidenzreiche Dokumentpakete und lang laufende Agent-Aufgaben ohne aggressives Aufteilen.
AIReiter bietet Kimi K3 über OpenAI Chat Completions an; bestehende Apps ändern meist nur baseURL und model.
Wenn stabile system prompts, Projektkontext oder Dokumentpräfixe wiederkehren, prüfe Cache-Lesen direkt in den usage-Feldern.
Schätze mögliche Aufrufe anhand des aktuellen Token-Mixes.
$10
ca. 13 Beispielanfragen
Schneller Test
$50
ca. 65 Beispielanfragen
Tägliche Entwicklung
$100
ca. 130 Beispielanfragen
Produktionsbewertung
Preise
Preise werden pro 1M Token angezeigt. AIReiter listet Kimi K3 derzeit zum öffentlichen Modellpreis; der Wert dieser Seite liegt in schneller Nutzung, klaren Endpunkten und sichtbarer Nutzung.
| Token-Typ | Preis | Hinweise |
|---|---|---|
| Eingabe | $3.00 / 1M | Prompt-Token, wenn das stabile Präfix nicht aus dem Cache kommt. |
| Cache-Lesen | $0.30 / 1M | Gecachte Prompt-Token, die in usage-Feldern gemeldet werden. |
| Ausgabe | $15.00 / 1M | Generierte Antwort-Token, einschließlich reasoning-lastiger Antworten. |
Produktionsschicht
Das Modell ist am nützlichsten, wenn Kontextkontinuität das Ergebnis verändert: nicht nur eine Antwort, sondern genug Projektzustand, Evidenz und Tool-Ausgaben für den nächsten zuverlässigen Schritt.
Architekturnotizen, Service-Verträge, alte Tests, diffs und Issues gemeinsam prüfen, bevor riskante Änderungen entstehen.
Verträge, Policies, Forschungsnotizen und Evidenzpakete in einem Arbeitskontext lesen, statt wichtige Details früh wegzusammenzufassen.
Tool-call IDs, Beobachtungen, Parameter und Entscheidungen im Verlauf halten, damit spätere Schritte konsistent bleiben.
Mit Kimi K3 prüfen, ob Prototyp, Migration oder Agent-Workflow genug Kontext für Produktions-Edge-Cases hat.
Produktions-Checkliste
Long-Context-Modelle scheitern anders als kurze Prompt-Modelle. Prüfe model ID, Kontextpfad, Gesprächszustand und usage records.
Sende kimi-k3 in API-Anfragen. Der page-chat key chat-kimi-k3 ist nur für die AIReiter Chat UI.
Kimi K3 unterstützt hier 1,048,576 Token. Stelle sicher, dass Client, Proxy und Timeouts große Anfragen tragen können.
Lange Agent-Läufe brauchen frühere assistant messages, tool outputs und Parameter. Weglassen erzeugt oft falsche Kontinuität.
Cache-Lesen, Ausgabe-Token und reasoning-lastige Antworten sollten aus usage-Feldern gemessen werden, nicht aus der Anfragezahl geraten.
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.AIREITER_API_KEY,
baseURL: "https://aireiter.com/api/v1",
});
const stream = await client.chat.completions.create({
model: "kimi-k3",
messages: [
{ role: "user", content: "Analysiere dieses Repository und nenne die drei riskantesten Implementierungsannahmen." }
],
stream: true,
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}curl "https://aireiter.com/api/v1/chat/completions" -H "Authorization: Bearer $AIREITER_API_KEY" -H "Content-Type: application/json" -d '{
"model": "kimi-k3",
"messages": [
{ "role": "user", "content": "Analysiere dieses Repository und nenne die drei riskantesten Implementierungsannahmen." }
],
"stream": true
}'{
"model": "kimi-k3",
"messages": [
{ "role": "system", "content": "<stabiler Repository- oder Dokumentkontext>" },
{ "role": "user", "content": "Prüfe den heutigen diff gegen diesen Kontext." }
],
"stream": true
}
// Cache-Lesen aus usage bestätigen:
// usage.prompt_tokens_details.cached_tokens > 0Use Cases
In diesen Fällen verändert ein 1M-Token-Kontextfenster den Workflow stärker als kleine Latenz- oder Stilunterschiede.
Ein komplettes Briefing, Architekturnotizen, Logs und aktuelle diffs in einer Anfrage lesen.
Für Codebase-Review, Risikoanalyse, Migrationsplanung und Implementierungskritik.
Viele lange Dokumente zusammenfassen und abgleichen, ohne zuerst Retrieval zu bauen.
Tool-Spuren, Aufgabenhistorie und Entscheidungen im Gesprächsfenster behalten.
Kosten-Qualitätsprüfung
In Produktion sollte Kimi K3 nach Kosten für nutzbare Ergebnisse bewertet werden: Retries, manuelle Änderungen, Tool-Erfolg, Cache-Hits und Zeit bis zur verlässlichen Antwort.
Wenn Kimi K3 Retries reduziert und mehr Kontext hält, kann mehr Token-Verbrauch trotzdem niedrigere Endkosten bedeuten. Für kurze zustandslose Aufgaben ist ein leichteres Modell besser.
Vergleich
| Dimension | Kimi K3 | GPT-5.6 Sol | Gemini 3.1 Pro | Claude Sonnet 4.6 |
|---|---|---|---|---|
| Dimension | kimi-k3 | gpt-5.6-sol | chat-gemini-3.1-pro | chat-claude-sonnet-4-6 |
| AIReiter-Protokoll | Chat Completions | Chat / Responses Familienseite | Chat-Modellroute | Claude Messages Route |
| Beste Eignung | 1M-Kontext-Codebasen, lange Dokumente, Agent-Zustand | OpenAI-kompatibles Flagship-Reasoning | Großer Kontext, multimodale und dokumentlastige Aufgaben | Code-Review und Dokumentbeurteilung |
| Wann wählen | Wenn Kontextkontinuität der Engpass ist | Wenn GPT-5.6-Qualität oder Routing nötig ist | Wenn Gemini-Dokument- oder Multimodalverhalten zählt | Wenn Claude-artige Coding-Qualität zählt |
Bereit zum Testen
Der schnellste Weg: API Key erstellen, Chat Completions-Endpunkt behalten und mit einer kleinen Streaming-Anfrage starten.
FAQ
Öffentliche Seiten listen Kimi K3 meist mit $3.00 pro 1M Cache-Miss-Eingabe-Token, $0.30 pro 1M Cache-Read-Eingabe-Token und $15.00 pro 1M Ausgabe-Token.
Kimi K3 ist mit einem Kontextfenster von 1,048,576 Token gelistet, weshalb Teams es für Codebasen, lange Dokumente und Agent-Protokolle prüfen.
Ja. Gecachte Eingabe wird meist mit $0.30 pro 1M Token gezeigt, gegenüber $3.00 pro 1M ungecachten Eingabe-Token.
Verwende "kimi-k3" im model-Feld und sende an https://aireiter.com/api/v1/chat/completions. Nutze den internen page-chat key nicht als öffentliche API model ID.
Ja. Setze baseURL auf https://aireiter.com/api/v1, behalte das Chat Completions-Format und sende model "kimi-k3".
Beobachte Cache-Read-Token, Ausgabe-Token, Latenz langer Anfragen, Retry-Rate und ob reasoning-lastige Antworten wirklich nutzbare Ergebnisse liefern.