AIREITER

Kimi K3 in OpenCode: Einrichtung und reale Kosten pro Session

Zuletzt aktualisiert: 2026-07-29 11:29:42

Kimi K3 lässt sich mit nur drei Befehlen in OpenCode nutzen. Der Listenpreis liegt auf Sonnet-Niveau bei $3/$15 pro Million Tokens, doch dank eines hohen Prompt-Cache-Anteils kostet eine echte OpenCode-Session im Schnitt lediglich $1.79.

Kimi K3 in OpenCode einrichten: drei Schritte genügen

OpenCode ist ein quelloffener Coding-Agent für das Terminal. Die Verbindung zu Kimi erfolgt über die integrierte Anmeldung: Weder eine Base-URL noch eine Konfigurationsdatei müssen manuell hinterlegt werden. Die folgenden Schritte entsprechen OpenCode 1.18.3 und Kimis eigener Integrationsanleitung.

Offizielle Kimi-Dokumentation zur Nutzung von Kimi-Modellen in OpenCode mit den drei Einrichtungsschritten

1. API-Key hinterlegen

Führe opencode auth login aus, wähle Moonshot AI als Anbieter und füge den Key von der Kimi Open Platform ein. Dabei gibt es zwei häufige Stolperfallen: Auf dem Konto muss echtes Guthaben liegen, denn Gutscheine für Neukunden gelten nicht für K3. Außerdem gehört der Key weder in Konfigurationsdateien noch in Screenshots oder Git-Repositories. OpenCode speichert ihn aus gutem Grund im eigenen Credential-System.

2. Das Modell kimi-k3 auswählen

Gib in OpenCode /models ein und wähle kimi-k3. Damit wird das Modell mit seinem vollständigen Kontextfenster von 1M Tokens geladen; pro Antwort sind maximal 131K Output-Tokens möglich. In der Statusleiste sollten anschließend „Kimi K3“ und „Moonshot AI“ stehen.

3. Denkaufwand festlegen

Mit /variants steuerst du, wie intensiv K3 vor der Antwort nachdenkt. Standardmäßig steht die Variante auf max; alternativ gibt es high und low. Wie der Kostenabschnitt zeigt, ist das der wichtigste Hebel für die Rechnung.

So viel kostet eine Kimi-K3-Session wirklich

Auf dem Papier verlangt K3 $3 pro Million Input-Tokens und $15 pro Million Output-Tokens. Das liegt über dem Aktionspreis von Claude Sonnet 5 mit $2/$10.

In der Praxis fällt K3 deutlich günstiger aus, weil der Großteil der Tokens als preiswerte Cache-Lesezugriffe abgerechnet wird. Die öffentlichen Nutzungsdaten von OpenCode auf der unten gezeigten Modellseite beziffern eine durchschnittliche Kimi-K3-Session auf $1.79. Grundlage sind 66,379 abgeschlossene Sessions mit jeweils 2.9M Tokens. Das entspricht rund $0.62 pro tatsächlich genutzter Million Tokens und damit deutlich weniger als dem Listenpreis von $3. Der Grund: 93% der Input-Tokens stammen aus dem Cache. Ein Cache-Hit kostet $0.30 statt $3.00 pro Million Tokens, also 90% weniger. Artificial Analysis nennt einen Mischpreis von $2.31 pro Million, geht dabei aber nur von 70% Caching aus. Die realen 93% Cache-Quote bei OpenCode erklären die niedrigeren Session-Kosten.

Seite mit öffentlichen OpenCode-Nutzungsdaten für Kimi K3: Rang 9, 1M Kontext, 131K Output-Limit und Veröffentlichung im Juli 2026

Der Listenpreis bleibt auf Sonnet-Niveau. Die Veröffentlichung der offenen Gewichte, vollständig bis zum 27. Juli 2026, erweitert die Möglichkeiten zum Self-Hosting, verändert aber nicht die API-Kosten. Die Preise pro Million Tokens sehen im Vergleich so aus:

Gruppiertes Balkendiagramm zum Preis pro Million Input- und Output-Tokens für Kimi K3, Claude Sonnet 5 promo und Kimi K2.5

Nach Tokenvolumen belegt K3 bei OpenCode Go Rang 9. In den acht Wochen bis zum 20. Juli hat sich seine Nutzung laut den Momentum-Daten von OpenCode verdoppelt. Auf dem Papier teuer, für anspruchsvolle Aufgaben aber weiterhin stark gefragt.

Warum K3 so viele Tokens verbraucht – und was dagegen hilft

Die häufigste Kritik betrifft nicht den Preis je Token, sondern die Tokenmenge, die K3 verbraucht. Mit dem Standardmodus max denkt das Modell ausführlich nach, bevor es handelt. Bei einfachen Änderungen ist dieser Denkaufwand oft nur teurer Ballast. Ein OpenCode-Nutzer brachte es im Juli 2026 auf X direkt auf den Punkt: K3 könne viele Tokens verbrennen, „without accomplishing much“, bei Aufgaben, die ein leichteres Modell schneller erledigt.

Drei Maßnahmen halten den Verbrauch im Zaum:

  • Variante heruntersetzen. Stelle /variants für Routineaufgaben auf low oder high. max lohnt sich bei Architekturfragen und Refactorings über mehrere Dateien hinweg, nicht beim Umbenennen einer Funktion.
  • Den Cache ausnutzen. Die Cache-Hit-Rate von 93% sorgt dafür, dass Sessions günstig bleiben. Arbeite möglichst in einer langen Session, statt ständig neu zu starten. Jeder Neustart überträgt ungecachten Kontext erneut zum vollen Preis.
  • Den Agenten-Unterbau entschlacken. Ein überladener Agenten-Scaffold verleitet K3 zum Überdenken. Reduziere dauerhaft geladene Instruktionsdateien, nicht benötigte MCP-Server und ausführliche Tool-Beschreibungen. So braucht das Modell weniger Tool-Roundtrips und hat weniger Gelegenheit, sich festzudenken.

Ein Kompromiss bleibt: K3 wirkt in OpenCode langsamer als leichtere Modelle – der Preis seines Denkaufwands. Wenn Latenz wichtiger ist als Tiefe, solltest du das Modell wechseln.

Kimi K3 oder Kimi K2.7 Code: Wann das günstigere Modell reicht

K3 kostet ungefähr dreimal so viel wie Kimi K2.7 Code. Entscheidend ist daher, wann sich der Aufpreis tatsächlich lohnt.

Um die günstigere Option einzuordnen, habe ich K2.7 Code am 2026-07-20 per API mit einer kleinen Aufgabe getestet: eine Python-Funktion merge_intervals samt Komplexitätsanalyse schreiben. Das Modell lieferte in 10.7 Sekunden korrekten, idiomatischen Code – erst sortieren, dann linear zusammenführen, mit O(n log n) Laufzeit und O(n) Speicherbedarf. Verbraucht wurden 52 Prompt- und 341 Completion-Tokens. Für alltägliche Coding-Aufgaben wie Bugfixes, kleine Funktionen und Testgerüste ist das für die meisten ausreichend, während die Tokenrechnung nur einen Bruchteil von K3 ausmacht.

K3 solltest du für seine eigentlichen Stärken reservieren: Aufgaben, die das 1M-Kontextfenster ausreizen, kompliziertes Denken über mehrere Dateien und Fälle, an denen ein leichteres Modell wiederholt scheitert. Der direkte Vergleich zwischen K2.7 Code und GLM 5.2 ist eine hilfreiche Referenz, wenn du eher ein Modell für den Alltag als eines für schwere Aufgaben suchst.

Direkte API, OpenRouter oder Abo: So sinken die Kosten

Über welchen Weg du K3 ansprichst, beeinflusst sowohl Zuverlässigkeit als auch Kosten.

Direkte Kimi API. Die direkte Anbindung an die Kimi Open Platform ist der zuverlässigste Weg. K3 auf OpenRouter wird von einem einzelnen Anbieter bereitgestellt und kann unter Last häufige 429-Fehler wegen Rate Limits zurückgeben. Die direkte Verbindung umgeht diesen Engpass.

OpenCode Go subscription. Ein Monatsplan für etwa $10–19 macht K3 zu einem Pauschaltarif-„zweiten Pool“, auf den du zurückgreifst, wenn dein Hauptmodell nicht weiterkommt. Mehrere Nutzer verwenden ihn genau so: als Ausweichlösung, wenn eine Claude-Session mitten in der Aufgabe unterbrochen wird, nicht als Modell für den Dauereinsatz.

API gateway. Wenn du bereits mehrere Modelle über einen Key bündelst, kannst du K3 über ein mit Anthropic und OpenAI kompatibles Gateway wie AIReiter zusammen mit anderen Modellen per Pay-as-you-go nutzen. Dabei greifen dieselben Cache-Effekte, die die Kosten pro Session niedrig halten. Die Aufschlüsselung der Kimi-K3-Preise enthält die Token-Rechnung, um die verschiedenen Wege vor einer Entscheidung zu vergleichen.

Lohnt sich Kimi K3 in OpenCode?

Zwei Gruppen sollten vorab genauer rechnen. Wer günstige Agenten-Loops mit hohem Volumen betreibt, spart mit K2.7 Code oder einem leichteren Modell Geld, ohne viel Qualität einzubüßen. Und wer schnelle Antworten braucht, wird K3 mit Denkaufwand max als langsam empfinden, bis die Variante reduziert wird.

Für alle anderen lautet die Antwort: ja. Ein Modell an der Spitze der Bestenlisten, 1M Tokens Kontext, in drei Befehlen eingerichtet und bei echten Sessions für unter $2 – zudem eines, das du vollständig kontrollierst, falls du einem Assistenten den Rücken kehrst, der mitten in der Aufgabe hängen bleibt.

FAQ

Ist Kimi K3 in OpenCode kostenlos nutzbar?

Nein. K3 wird nach Verbrauch abgerechnet und erfordert auf der Kimi Open Platform ein aufgeladenes Guthaben; Gutscheine für Neukunden gelten nicht. OpenCode selbst ist kostenlos und quelloffen – bezahlt werden nur die K3-Tokens.

Was kostet Kimi K3 pro Million Tokens?

Der Listenpreis beträgt $3 pro Million Input-Tokens und $15 pro Million Output-Tokens. In der Praxis zahlst du deutlich weniger: Cache-Hits kosten $0.30 pro Million, und dank einer Cache-Hit-Rate von 93% kosten reale OpenCode-Sessions im Schnitt $1.79.

Ist Kimi K3 Open Source?

Es handelt sich um ein Open-Weight-Modell. Moonshot veröffentlicht die vollständigen Modellgewichte bis zum 27. Juli 2026 und macht es damit zum ersten offenen Modell in der Klasse mit 3 Billionen Parametern. Die gehostete API bleibt kostenpflichtig.

Kann Kimi K3 genauso gut programmieren wie Claude?

In Arenas Coding-Bestenliste liegt K3 derzeit an der Spitze und erreicht im Artificial Analysis Intelligence Index 57 Punkte, Rang 4 von 187 Modellen. Bei anspruchsvollen Coding-Aufgaben ist es in der Praxis mit proprietären Frontier-Modellen konkurrenzfähig – bei einem ähnlichen Listenpreis.

Warum erhalte ich mit Kimi K3 429-Fehler?

Häufige 429-Fehler entstehen meist beim Routing über OpenRouter, wo K3 von einem einzelnen Anbieter bereitgestellt wird. Die direkte Verbindung zur Kimi Open Platform über die integrierte OpenCode-Anmeldung vermeidet diese Begrenzung.