Ja, Kimi K3 läuft in OpenCode mit drei Befehlen. Es wird zu Sonnet-Klassenpreisen aufgeführt ($3/$15 pro Million Tokens), aber echte OpenCode-Sitzungen liegen im Durchschnitt nur bei $1.79, dank umfangreichem Prompt-Caching.
Richte Kimi K3 in OpenCode in drei Schritten ein
OpenCode ist ein Open-Source-Terminal-Coding-Agent. Es verbindet sich über die integrierte Authentifizierung mit Kimi, sodass Sie niemals eine Base URL einfügen oder eine Konfigurationsdatei bearbeiten müssen. Die folgenden Schritte entsprechen OpenCode 1.18.3 und dem Integrationsleitfaden von Kimi.
1. Konfigurieren Sie den API-Schlüssel
Führen Sie opencode auth login aus, wählen Sie Moonshot AI als Anbieter aus und fügen Sie Ihren Schlüssel aus der Kimi Open Platform ein. Hier stolpern viele über zwei Dinge. Erstens braucht das Konto ein echtes Guthaben — Gutscheine für neue Nutzer funktionieren bei K3 nicht. Zweitens sollten Sie den Schlüssel aus allen Konfigurationsdateien, Screenshots oder Git-Repositories heraushalten; OpenCode speichert ihn aus gutem Grund in seinem eigenen Anmeldedatensystem.
2. Wählen Sie das Modell kimi-k3 aus
In OpenCode führen Sie /models aus und wählen kimi-k3 aus. Dadurch wird das Modell mit seinem vollständigen 1M-Token-Kontextfenster geladen (die Ausgabe ist auf 131K Tokens pro Durchlauf begrenzt). In der Statusleiste sollte jetzt „Kimi K3“ und „Moonshot AI“ stehen.
3. Legen Sie den Denkaufwand fest
Führe /variants aus, um zu steuern, wie intensiv K3 vor dem Antworten nachdenkt. Standard ist max, und du kannst auf high oder low heruntergehen — der mit Abstand größte Hebel für deine Rechnung, wie der Kostenabschnitt zeigt.
Was eine Kimi-K3-Sitzung tatsächlich kostet
K3 kostet 3 $ pro Million Eingabetokens und 15 $ pro Million Ausgaben, mehr als der Promo-Tarif von Claude Sonnet 5 mit 2 $/10 $.
In der Praxis kostet K3 deutlich weniger, weil die meisten Tokens günstige Cache-Lesevorgänge sind. Die öffentlichen Nutzungsdaten von OpenCode (unten auf der modellbezogenen Seite angezeigt) setzen die durchschnittliche Kimi-K3-Sitzung auf $1.79, gemessen über 66,379 abgeschlossene Sitzungen mit jeweils 2.9M Tokens. Das entspricht etwa $0.62 pro tatsächlich verwendetem Million Tokens und liegt damit deutlich unter dem Listenpreis von $3. Der Grund: 93% der Eingabe-Tokens sind Cache-Treffer, und ein Cache-Treffer kostet $0.30 pro Million statt $3.00, also 90% Rabatt. (Artificial Analysis nennt einen gemischten Preis von $2.31 pro Million, geht dabei aber nur von 70% Caching aus; die tatsächliche Cache-Rate von 93% bei OpenCode ist der Grund, warum die Sitzungen günstiger ausfallen.)
Der Listenpreis bleibt Sonnet-Klasse; die Open-Weight-Veröffentlichung (vollständige Gewichte bis zum 27. Juli 2026) ändert, was Sie selbst hosten können, nicht, was Sie über die API zahlen. Die Raten pro Million vergleichen sich so:
K3 belegt Platz 9 beim Tokenvolumen auf OpenCode Go, und seine Nutzung hat sich in den acht Wochen bis zum 20. Juli verdoppelt (laut den Momentum-Daten von OpenCode) — auf dem Papier teuer, aber weiterhin stark nachgefragt für schwierige Aufgaben.
Warum K3 Tokens verbrennt und wie man es eindämmt
Die häufigste Beschwerde ist nicht der Preis pro Token; es geht darum, wie viele Tokens K3 verbraucht. Da es standardmäßig die max-Denkanstrengung verwendet, denkt K3 ausführlich nach, bevor es handelt, und bei einfachen Bearbeitungen ist dieser Denkaufwand vergeudeter Verbrauch. Ein OpenCode-Nutzer auf X brachte es im Juli 2026 auf den Punkt: Es kann auf Aufgaben, die ein leichteres Modell schneller erledigen würde, viele Tokens verbrennen, „ohne viel zu erreichen“.
Drei Hebel halten das in Schach:
- Die Variante weglassen. Schalten Sie
/variantsfür Routinearbeiten auflowoderhighum.maxlohnt sich für Architektur und Multi-Datei-Refactorings, nicht zum Umbenennen einer Funktion. - Setzen Sie auf den Cache. K3s Cache-Trefferquote von 93 % ist der Grund, warum Sitzungen günstig bleiben. Arbeiten Sie in einer langen Sitzung weiter, statt neu zu starten; jeder Neustart sendet zwischengespeicherten Kontext erneut zum vollen Preis.
- Reduzieren Sie das Gerüst. K3 denkt zu viel nach, wenn das Agenten-Scaffold laut ist. Entfernen Sie immer aktive Instruktionsdateien, ungenutzte MCP-Server und ausführliche Tool-Beschreibungen, damit es weniger Tool-Roundtrips macht und weniger Raum zum Abschweifen hat.
Erwarten Sie einen Kompromiss: K3 fühlt sich in OpenCode langsamer an als leichtere Modelle — die Reasoning-Steuer. Wenn Latenz wichtiger ist als Tiefe, wechseln Sie das Modell.
Kimi K3 vs Kimi K2.7 Code: wann das günstigere Modell gewinnt
K3 ist ungefähr dreimal so teuer wie Kimi K2.7 Code, daher ist die Frage, wann sich der Sprung lohnt.
Um die günstigere Option zu überprüfen, habe ich K2.7 Code am 2026-07-20 über seine API mit einer kleinen Aufgabe aufgerufen: eine Python-merge_intervals-Funktion mit Komplexitätsanalyse zu schreiben. Es lieferte korrekten, idiomatischen Code (sortieren, dann linear zusammenführen, O(n log n) Zeit und O(n) Speicher) in 10,7 Sekunden und verwendete 52 Prompt- und 341 Completion-Tokens. Für alltägliches Coden wie Bugfixes, kleine Funktionen und Testgerüste reicht das für die meisten Menschen völlig aus, und die Token-Kosten sind nur ein Bruchteil von K3.
Reservieren Sie K3 für das, worin es besser ist: Arbeiten mit langem Kontext, die sein 1M-Fenster ausreizen, kniffliges Denken über mehrere Dateien hinweg und Aufgaben, bei denen ein leichteres Modell immer wieder scheitert. Der Direktvergleich zwischen K2.7 Code und GLM 5.2 ist eine nützliche Referenz, wenn Sie eher einen Alltagsbegleiter als ein Schwerlastmodell auswählen.
Direkte API vs. OpenRouter vs. Abonnement: die Rechnung senken
Wie Sie zu K3 routen, verändert sowohl die Zuverlässigkeit als auch die Kosten.
Direkte Kimi API. Die direkte Verbindung zur Kimi Open Platform ist der zuverlässigste Weg. K3 auf OpenRouter wird von einem einzigen Anbieter bereitgestellt und kann unter Last häufig 429-Fehler (Rate-Limit) zurückgeben; der direkte Zugriff umgeht diesen Engpass.
OpenCode Go subscription. Ein monatlicher Plan (etwa 10–19 $) macht K3 zu einem Pauschaltarif-„zweiten Pool“, den Sie nutzen, wenn Ihr Hauptmodell ins Stocken gerät. Mehrere Nutzer verwenden es genau so — als Ausweichlösung, wenn eine Claude-Sitzung mitten im Task unterbrochen wird, nicht als dauerhaften Haupttreiber.
API-Gateway. Wenn Sie bereits mehrere Modelle über einen einzigen Schlüssel routen, ermöglicht Ihnen ein mit Anthropic und OpenAI kompatibles Gateway wie AIReiter, K3 zusammen mit anderen Modellen zu Pay-as-you-go-Preisen zu nutzen, mit derselben Caching-Ökonomie, die die Kosten pro Sitzung niedrig hält. Die Kimi-K3-Preisaufschlüsselung enthält die Per-Token-Berechnung, um Routen vor einer Festlegung zu vergleichen.
Lohnt sich Kimi K3 in OpenCode?
Zwei Gruppen sollten vor dem Commit zweimal nachdenken. Wenn Sie günstige Agentenschleifen mit hohem Volumen ausführen, spart K2.7 Code oder ein leichteres Modell Geld bei nur geringem Qualitätsverlust. Wenn Sie schnelle Antworten brauchen, wird das max-Effort-Reasoning von K3 sich langsam anfühlen, bis Sie die Variante herunterstufen.
Alle anderen: ja. Ein Modell, das die Bestenliste anführt, mit einem 1M-Token-Kontext, in drei Befehlen eingerichtet, für unter $2 eine echte Sitzung — und eine, die Sie vollständig kontrollieren, wenn Sie einen Assistenten verlassen, der mitten in der Aufgabe hängen bleibt.
FAQ
Ist Kimi K3 in OpenCode kostenlos nutzbar?
Nein. K3 ist nutzungsabhängig und benötigt ein aufgeladenes Kimi Open Platform-Guthaben; Gutscheine für neue Nutzer gelten dafür nicht. OpenCode selbst ist kostenlos und Open Source — Sie zahlen nur für K3-Token.
Wie viel kostet Kimi K3 pro Million Tokens?
Der Listpreis beträgt 3 $ pro Million Eingabetokens und 15 $ pro Million Ausgaben. Was Sie in der Praxis zahlen, ist deutlich niedriger: Cache-Treffer kosten 0,30 $ pro Million, und die tatsächlichen Sitzungen von OpenCode liegen dank einer Cache-Trefferquote von 93 % im Durchschnitt bei 1,79 $.
Ist Kimi K3 Open Source?
Es ist Open-Weight. Moonshot wird die vollständigen Modellgewichte bis zum 27. Juli 2026 veröffentlichen und damit das erste offene Modell in der Klasse mit 3 Billionen Parametern sein. Die gehostete API ist weiterhin kostenpflichtig.
Kann Kimi K3 genauso gut programmieren wie Claude?
Auf Arenas Coding-Leaderboard liegt K3 derzeit an der Spitze und erzielt 57 im Artificial Analysis Intelligence Index (#4 von 187 Modellen). In der Praxis ist es bei anspruchsvollen Coding-Aufgaben mit führenden proprietären Modellen konkurrenzfähig, und zwar zu einem ähnlichen Listenpreis.
Warum erhalte ich 429-Fehler mit Kimi K3?
Häufige 429er entstehen meist durch das Routing über OpenRouter, wo K3 von einem einzigen Anbieter bereitgestellt wird. Die direkte Verbindung zur Kimi Open Platform über die integrierte Authentifizierung von OpenCode umgeht dieses Limit.
