Sì, Kimi K3 funziona in OpenCode con tre comandi. È elencato a tariffe di classe Sonnet ($3/$15 per milione di token), ma le sessioni reali di OpenCode hanno una media di soli $1.79, grazie al pesante prompt caching.
Configura Kimi K3 in OpenCode in tre passaggi
OpenCode è un agente di coding da terminale open-source. Si connette a Kimi tramite autenticazione integrata, quindi non dovrai mai incollare un URL di base o modificare un file di configurazione. I passaggi qui sotto corrispondono a OpenCode 1.18.3 e alla guida di integrazione di Kimi.
1. Configura la chiave API
Esegui opencode auth login, seleziona Moonshot AI come provider e incolla la tua chiave dalla Kimi Open Platform. Due cose qui confondono spesso le persone. Primo, l'account deve avere un saldo reale — i voucher per nuovi utenti non funzionano su K3. Secondo, tieni la chiave lontana da qualsiasi file di configurazione, screenshot o repository git; OpenCode la memorizza nel proprio sistema di credenziali per un motivo.
2. Seleziona il modello kimi-k3
All'interno di OpenCode, esegui /models e seleziona kimi-k3. In questo modo viene caricato il modello con la sua finestra di contesto completa da 1M token (l'output è limitato a 131K token per turno). La barra di stato ora dovrebbe mostrare "Kimi K3" e "Moonshot AI".
3. Imposta il livello di sforzo di pensiero
Esegui /variants per controllare quanto a fondo K3 ragiona prima di rispondere. Il valore predefinito è max, e puoi passare a high o low — la leva più importante sulla tua fattura, come mostra la sezione sui costi.
Quanto costa davvero una sessione Kimi K3
K3 è disponibile a $3 per milione di token di input e $15 per milione di output, più della tariffa promozionale di Claude Sonnet 5 di $2/$10.
In pratica K3 costa molto meno, perché la maggior parte dei token sono letture cache economiche. I dati di utilizzo pubblici di OpenCode (mostrati nella sua pagina per modello qui sotto) indicano una sessione media di Kimi K3 pari a $1.79, calcolata su 66,379 sessioni completate che spendono 2.9M token ciascuna. Questo corrisponde a circa $0.62 per milione di token effettivamente utilizzati, ben al di sotto della tariffa di listino di $3. Il motivo: il 93% dei token di input sono hit della cache, e un hit della cache costa $0.30 per milione invece di $3.00, uno sconto del 90%. (Artificial Analysis cita un valore composito di $2.31 per milione, ma ciò presuppone solo il 70% di caching; il vero tasso di cache del 93% di OpenCode è il motivo per cui le sessioni risultano più basse.)
Il prezzo di listino rimane di classe Sonnet; il rilascio open-weight (pesi completi entro il 27 luglio 2026) cambia ciò che puoi ospitare autonomamente, non ciò che paghi tramite l'API. Le tariffe per milione si confrontano così:
K3 è al 9° posto per volume di token su OpenCode Go, e il suo utilizzo è raddoppiato nelle otto settimane fino al 20 luglio (secondo i dati di momentum di OpenCode) — costoso sulla carta, ma ancora molto richiesto per i compiti più difficili.
Perché K3 brucia token e come contenerlo
Il reclamo più comune non è il prezzo per token; è quanti token spende K3. Poiché per impostazione predefinita usa il livello di riflessione max, K3 ragiona a lungo prima di agire e, nelle semplici modifiche, quel ragionamento è una spesa sprecata. Un utente di OpenCode su X lo ha detto senza mezzi termini nel luglio 2026: può consumare molti token "without accomplishing much" in compiti che un modello più leggero finirebbe più rapidamente.
Tre leve lo tengono sotto controllo:
- Elimina la variante. Imposta
/variantssulowohighper il lavoro di routine.maxne vale la pena per l'architettura e i refactoring multi-file, non per rinominare una funzione. - Fai leva sulla cache. Il tasso di cache-hit del 93% di K3 è il motivo per cui le sessioni restano economiche. Continua a lavorare in un'unica lunga sessione invece di riavviare; ogni riavvio reinvia il contesto non memorizzato nella cache al prezzo pieno.
- Riduci l'harness. K3 pensa troppo quando lo scaffold dell'agente è rumoroso. Elimina i file di istruzioni sempre attivi, i server MCP non usati e le descrizioni verbose degli strumenti, così fa meno andirivieni con gli strumenti e ha meno spazio per andare in spirale.
Aspettati un compromesso: K3 sembra più lento rispetto ai modelli più leggeri in OpenCode — il costo del ragionamento. Quando la latenza conta più della profondità, cambia modello.
Kimi K3 vs Kimi K2.7 Code: quando il modello più economico vince
K3 costa all’incirca tre volte il prezzo di Kimi K2.7 Code, quindi la domanda è quando il salto vale la pena.
Per verificare l'opzione più economica, ho chiamato K2.7 Code tramite la sua API il 2026-07-20 con un piccolo compito: scrivere una funzione Python merge_intervals con analisi della complessità. Ha restituito codice corretto e idiomatico (ordinamento, poi merge lineare, tempo O(n log n) e spazio O(n)) in 10,7 secondi, usando 52 token di prompt e 341 token di completamento. Per la programmazione quotidiana, come correzioni di bug, piccole funzioni e scaffolding di test, questo è tutto ciò di cui la maggior parte delle persone ha bisogno, e il costo in token è una frazione di quello di K3.
Riserva K3 per ciò in cui eccelle: lavoro a contesto lungo che riempie la sua finestra da 1M, ragionamento complesso su più file e attività in cui un modello più leggero continua a fallire. Il confronto diretto tra K2.7 Code e GLM 5.2 è un riferimento utile se stai scegliendo un modello da usare ogni giorno invece di un modello per carichi pesanti.
API diretta vs OpenRouter vs un abbonamento: ridurre la bolletta
Il modo in cui instradi verso K3 modifica sia l'affidabilità sia il costo.
Direct Kimi API. Connettersi direttamente alla Kimi Open Platform è la soluzione più affidabile. K3 su OpenRouter è servito da un unico provider e può restituire frequenti errori 429 (rate-limit) sotto carico; andare direttamente evita quel collo di bottiglia.
Abbonamento OpenCode Go. Un piano mensile (circa $10–19) trasforma K3 in una "second pool" a tariffa fissa che usi quando il tuo modello principale si blocca. Diversi utenti lo usano esattamente così — come fallback quando una sessione Claude viene interrotta a metà attività, non come driver a tempo pieno.
Gateway API. Se hai già instradato diversi modelli tramite una chiave, un gateway compatibile con Anthropic e OpenAI come AIReiter ti consente di chiamare K3 insieme ad altri modelli con prezzi pay-as-you-go, con la stessa economia di caching che mantiene basso il costo per sessione. Il dettaglio dei prezzi di Kimi K3 contiene il calcolo per token per confrontare i percorsi prima di impegnarti.
Kimi K3 vale la pena in OpenCode?
Due gruppi dovrebbero pensarci due volte prima di procedere. Se esegui agent loops economici e ad alto volume, K2.7 Code o un modello più leggero fa risparmiare denaro con poca perdita di qualità. Se hai bisogno di risposte rapide, il reasoning max-effort di K3 sembrerà lento finché non riduci la variante.
Tutti gli altri: sì. Un modello da primo posto in classifica con un contesto da 1M token, configurato in tre comandi, a meno di 2 $ per una sessione reale — e uno che controlli بالكامل, se stai lasciando un assistente che si blocca a metà attività.
FAQ
Kimi K3 è gratuito da usare in OpenCode?
No. K3 è pay-as-you-go e richiede un saldo finanziato su Kimi Open Platform; i voucher per i nuovi utenti non si applicano ad esso. OpenCode in sé è gratuito e open-source — paghi solo per i token K3.
Quanto costa Kimi K3 per milione di token?
La tariffa di listino è di $3 per milione di token di input e $15 per milione di output. In pratica, ciò che paghi è molto inferiore: le occorrenze nella cache costano $0.30 per milione, e le sessioni reali di OpenCode hanno una media di $1.79 grazie a un tasso di hit della cache del 93%.
Kimi K3 è open-source?
È open-weight. Moonshot rilascerà i pesi completi del modello entro il 27 luglio 2026, rendendolo il primo modello aperto nella classe da 3 trilioni di parametri. L'API ospitata è ancora a pagamento.
Kimi K3 sa programmare bene quanto Claude?
Nella classifica di coding di Arena, K3 è attualmente al primo posto e ottiene 57 nell'Artificial Analysis Intelligence Index (#4 su 187 modelli). In pratica, è competitivo con i modelli proprietari di frontiera nelle attività di coding più difficili, a un prezzo di listino simile.
Perché ricevo errori 429 con Kimi K3?
I 429 frequenti di solito derivano dal routing tramite OpenRouter, dove K3 è servito da un singolo provider. Collegarsi direttamente alla Kimi Open Platform tramite l'autenticazione integrata di OpenCode evita quel limite.
