Modell / Kimi K3

Kimi K3 API

Moonshot AI-Textgenerierung-$3.00 / 1M input Token-Verfügbar
1,05M KontextPrompt-CacheStreaming SSEOpenAI-kompatibel
Modell ansehen
100%Live

Anbieter

Moonshot AI

Modell

Kimi K3

Kontextfenster

1,048,576 Token

Protokoll

Chat Completions

Wähle Kimi K3, wenn Kontext der Engpass ist

Kimi K3 ist ein Long-Context-Textmodell für Workflows, in denen genügend Evidenz im Prompt bleiben muss: Code-Repositories, Rechts- oder Policy-Pakete, Forschungsnotizen, Logs, frühere Tool-Aufrufe und Agent-Memory. AIReiter stellt das Modell über einen vertrauten OpenAI-kompatiblen Chat-Endpunkt bereit.

Am besten geeignet

Route für Long-Context-Reasoning

Nutze Kimi K3, wenn eine große Anfrage den Arbeitskontext tragen soll, statt zuerst Retrieval oder Chunking aufzubauen.

Komplexen Kontext in eine Anfrage legen

Geeignet für große Codebasen, evidenzreiche Dokumentpakete und lang laufende Agent-Aufgaben ohne aggressives Aufteilen.

Integration schlank halten

AIReiter bietet Kimi K3 über OpenAI Chat Completions an; bestehende Apps ändern meist nur baseURL und model.

Lange Prompts cache-bewusst machen

Wenn stabile system prompts, Projektkontext oder Dokumentpräfixe wiederkehren, prüfe Cache-Lesen direkt in den usage-Feldern.

Budgetreferenz

Schätze mögliche Aufrufe anhand des aktuellen Token-Mixes.

Credits aufladen

$10

ca. 13 Beispielanfragen

Schneller Test

$50

ca. 65 Beispielanfragen

Tägliche Entwicklung

$100

ca. 130 Beispielanfragen

Produktionsbewertung

Preise

Kimi K3 Token-Preise

Preise werden pro 1M Token angezeigt. AIReiter listet Kimi K3 derzeit zum öffentlichen Modellpreis; der Wert dieser Seite liegt in schneller Nutzung, klaren Endpunkten und sichtbarer Nutzung.

Token-TypPreisHinweise
Eingabe$3.00 / 1MPrompt-Token, wenn das stabile Präfix nicht aus dem Cache kommt.
Cache-Lesen$0.30 / 1MGecachte Prompt-Token, die in usage-Feldern gemeldet werden.
Ausgabe$15.00 / 1MGenerierte Antwort-Token, einschließlich reasoning-lastiger Antworten.

Produktionsschicht

Wo Kimi K3 in einen Produktions-Model-Stack passt

Das Modell ist am nützlichsten, wenn Kontextkontinuität das Ergebnis verändert: nicht nur eine Antwort, sondern genug Projektzustand, Evidenz und Tool-Ausgaben für den nächsten zuverlässigen Schritt.

Entwicklung großer Codebasen

Architekturnotizen, Service-Verträge, alte Tests, diffs und Issues gemeinsam prüfen, bevor riskante Änderungen entstehen.

Analyse langer Dokumente

Verträge, Policies, Forschungsnotizen und Evidenzpakete in einem Arbeitskontext lesen, statt wichtige Details früh wegzusammenzufassen.

Mehrstufige Tool-Agents

Tool-call IDs, Beobachtungen, Parameter und Entscheidungen im Verlauf halten, damit spätere Schritte konsistent bleiben.

Review von Prototyp zu Produktion

Mit Kimi K3 prüfen, ob Prototyp, Migration oder Agent-Workflow genug Kontext für Produktions-Edge-Cases hat.

Produktions-Checkliste

Diese vier Punkte vor Kimi K3 in Produktion prüfen

Long-Context-Modelle scheitern anders als kurze Prompt-Modelle. Prüfe model ID, Kontextpfad, Gesprächszustand und usage records.

01

Produktions-Model-ID verwenden

Sende kimi-k3 in API-Anfragen. Der page-chat key chat-kimi-k3 ist nur für die AIReiter Chat UI.

Model ID
02

256K nicht als denselben Einstieg behandeln

Kimi K3 unterstützt hier 1,048,576 Token. Stelle sicher, dass Client, Proxy und Timeouts große Anfragen tragen können.

Kontext
03

Assistant- und Tool-Zustand erhalten

Lange Agent-Läufe brauchen frühere assistant messages, tool outputs und Parameter. Weglassen erzeugt oft falsche Kontinuität.

Tool-Zustand
04

Cache- und usage-Felder aufzeichnen

Cache-Lesen, Ausgabe-Token und reasoning-lastige Antworten sollten aus usage-Feldern gemessen werden, nicht aus der Anfragezahl geraten.

Usage
request.ts
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.AIREITER_API_KEY,
  baseURL: "https://aireiter.com/api/v1",
});

const stream = await client.chat.completions.create({
  model: "kimi-k3",
  messages: [
    { role: "user", content: "Analysiere dieses Repository und nenne die drei riskantesten Implementierungsannahmen." }
  ],
  stream: true,
});

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? "");
}
terminal
curl "https://aireiter.com/api/v1/chat/completions"   -H "Authorization: Bearer $AIREITER_API_KEY"   -H "Content-Type: application/json"   -d '{
    "model": "kimi-k3",
    "messages": [
      { "role": "user", "content": "Analysiere dieses Repository und nenne die drei riskantesten Implementierungsannahmen." }
    ],
    "stream": true
  }'
cache-check.json
{
  "model": "kimi-k3",
  "messages": [
    { "role": "system", "content": "<stabiler Repository- oder Dokumentkontext>" },
    { "role": "user", "content": "Prüfe den heutigen diff gegen diesen Kontext." }
  ],
  "stream": true
}

// Cache-Lesen aus usage bestätigen:
// usage.prompt_tokens_details.cached_tokens > 0

Use Cases

Wofür Kimi K3 gut ist

In diesen Fällen verändert ein 1M-Token-Kontextfenster den Workflow stärker als kleine Latenz- oder Stilunterschiede.

Long-Context-Reasoning

Ein komplettes Briefing, Architekturnotizen, Logs und aktuelle diffs in einer Anfrage lesen.

Coding-Assistent

Für Codebase-Review, Risikoanalyse, Migrationsplanung und Implementierungskritik.

Research-Synthese

Viele lange Dokumente zusammenfassen und abgleichen, ohne zuerst Retrieval zu bauen.

Agent-Planung

Tool-Spuren, Aufgabenhistorie und Entscheidungen im Gesprächsfenster behalten.

Kosten-Qualitätsprüfung

Tokenpreis nicht ohne Aufgabenkosten vergleichen

In Produktion sollte Kimi K3 nach Kosten für nutzbare Ergebnisse bewertet werden: Retries, manuelle Änderungen, Tool-Erfolg, Cache-Hits und Zeit bis zur verlässlichen Antwort.

First-pass success rate
Manuelle Rewrite-Rate
Retry-Anzahl
Ausgabe-Token
Cache-Hit-Rate
Tool-call success rate
Zeit bis zur nutzbaren Antwort
Eskalationsrate

Wenn Kimi K3 Retries reduziert und mehr Kontext hält, kann mehr Token-Verbrauch trotzdem niedrigere Endkosten bedeuten. Für kurze zustandslose Aufgaben ist ein leichteres Modell besser.

Vergleich

Kimi K3 im Vergleich zu AIReiter-Textmodellen

DimensionKimi K3GPT-5.6 SolGemini 3.1 ProClaude Sonnet 4.6
Dimensionkimi-k3gpt-5.6-solchat-gemini-3.1-prochat-claude-sonnet-4-6
AIReiter-ProtokollChat CompletionsChat / Responses FamilienseiteChat-ModellrouteClaude Messages Route
Beste Eignung1M-Kontext-Codebasen, lange Dokumente, Agent-ZustandOpenAI-kompatibles Flagship-ReasoningGroßer Kontext, multimodale und dokumentlastige AufgabenCode-Review und Dokumentbeurteilung
Wann wählenWenn Kontextkontinuität der Engpass istWenn GPT-5.6-Qualität oder Routing nötig istWenn Gemini-Dokument- oder Multimodalverhalten zähltWenn Claude-artige Coding-Qualität zählt

Bereit zum Testen

Key erstellen, Credits laden, dann eine Kimi K3-Anfrage senden

Der schnellste Weg: API Key erstellen, Chat Completions-Endpunkt behalten und mit einer kleinen Streaming-Anfrage starten.

FAQ

Kimi K3 API Fragen

Was kostet Kimi K3 pro 1M Token?

Öffentliche Seiten listen Kimi K3 meist mit $3.00 pro 1M Cache-Miss-Eingabe-Token, $0.30 pro 1M Cache-Read-Eingabe-Token und $15.00 pro 1M Ausgabe-Token.

Wie groß ist das Kontextfenster von Kimi K3?

Kimi K3 ist mit einem Kontextfenster von 1,048,576 Token gelistet, weshalb Teams es für Codebasen, lange Dokumente und Agent-Protokolle prüfen.

Senkt Context-Caching wirklich die Kosten?

Ja. Gecachte Eingabe wird meist mit $0.30 pro 1M Token gezeigt, gegenüber $3.00 pro 1M ungecachten Eingabe-Token.

Welche model ID soll ich verwenden?

Verwende "kimi-k3" im model-Feld und sende an https://aireiter.com/api/v1/chat/completions. Nutze den internen page-chat key nicht als öffentliche API model ID.

Kann ich Kimi K3 mit einem OpenAI-ähnlichen SDK aufrufen?

Ja. Setze baseURL auf https://aireiter.com/api/v1, behalte das Chat Completions-Format und sende model "kimi-k3".

Was sollte ich in Produktion beobachten?

Beobachte Cache-Read-Token, Ausgabe-Token, Latenz langer Anfragen, Retry-Rate und ob reasoning-lastige Antworten wirklich nutzbare Ergebnisse liefern.