Per prompt enormi e ripetuti, K3 è la scelta più sensata quando si riesce a sfruttare la cache. Claude Opus 5 si rivolge invece agli agenti che richiedono controlli di thinking integrati. Il confronto si basa su limiti documentati e comportamento di integrazione, senza decretare un vincitore qualitativo in assenza di benchmark con gli stessi prompt.
In breve: la scelta dipende dal carico di lavoro
Kimi K3 è indicato per i team che necessitano di una finestra di contesto da un milione di token e di prezzi input sensibili alla cache. Claude Opus 5 è più adatto a chi privilegia thinking predefinito e controlli del livello di effort rispetto alla massima ampiezza del contesto.
| Criterio decisionale | Kimi K3 | Claude Opus 5 | Scelta consigliata |
|---|---|---|---|
| Finestra di contesto | 1.048.576 token | 200.000 token | K3 per input molto grandi |
| Prezzo input standard | ¥2/M con cache; ¥20/M senza cache | $5/M | K3 al cambio indicativo riportato sotto |
| Prezzo output standard | ¥100/M | $25/M | K3 al cambio indicativo riportato sotto |
| Uso degli strumenti | Sono documentati tool calling e controlli di tool choice | Il tool use è supportato; la disattivazione del thinking presenta casi limite documentati | Dipende dallo schema degli strumenti e dall'impostazione del thinking |
| Canale di accesso | Kimi API | Claude API e canali cloud elencati | Verifica il provider richiesto |
Prezzi e contesto cambiano il conto finale
La pagina ufficiale dei prezzi di Kimi K3, consultata il 7 agosto 2026, indica ¥2 per milione di token input in caso di cache hit, ¥20 in caso contrario e ¥100 per milione di token output. La stessa pagina riporta una finestra di contesto da 1.048.576 token. È una combinazione vantaggiosa per prompt lunghi e ripetuti, a condizione che l'applicazione ottenga effettivamente cache hit.
La documentazione ufficiale del modello Claude Opus 5, consultata il 7 agosto 2026, riporta per l'API standard $5 per milione di token input e $25 per milione di token output, oltre a una finestra di contesto di 200k.
In termini di calcolo token nelle rispettive valute, una richiesta con 180k token input e 8k token output costa ¥1,16 con K3 in caso di cache hit, ¥4,40 senza cache hit e $1,10 con Opus 5 alle tariffe standard. La richiesta rientra nella finestra di contesto di Opus 5; la fatturazione effettiva dipende dal cambio contrattuale, dall'idoneità della cache e dall'output fatturato.
Tool calling e thinking: il vero punto critico dell'integrazione
La documentazione API di Kimi per K3 tratta esplicitamente tool calling, tool choice, caricamento dinamico degli strumenti, modalità JSON e output strutturato. Sono controlli rilevanti per applicazioni vincolate da schemi e instradate attraverso strumenti.
In Claude Opus 5 il thinking è attivo per impostazione predefinita: il modello decide quanto ragionare a ogni turno e il parametro effort ne regola la profondità. Anthropic documenta un vincolo incompatibile con le versioni precedenti: non è possibile disattivare il thinking con effort elevato e, quando il thinking è disattivato, il modello può occasionalmente scrivere una chiamata strumento nel testo visibile invece di emettere un blocco tool_use.
Con Opus 5, lascia attivo il thinking se le chiamate agli strumenti devono mantenere una struttura affidabile; scegli K3 se la priorità è disporre di controlli espliciti sugli strumenti e di output orientato agli schemi.
Quale modello scegliere nei casi d'uso più comuni?
Documenti lunghi e knowledge work
K3 prevale quando l'insieme delle fonti supera il limite di contesto documentato di 200k di Opus 5.
Se il corpus rientra nei 200k, il comportamento di thinking predefinito di Opus 5 è un fattore più significativo della pura dimensione del contesto.
Coding e agenti a lungo orizzonte
Per un nuovo agente, scegli Opus 5 quando il thinking predefinito documentato e i controlli di effort contano più della possibilità di inserire l'intero repository in un solo prompt.
Scegli K3 per un contesto agente ampio e memorizzabile nella cache, ma verifica il suo protocollo degli strumenti su task simili a quelli di produzione.
Carichi API sensibili ai costi
Valuta K3 con test sui prezzi per carichi ricchi di input e memorizzabili nella cache, monitorando lo stato della cache: il divario fra prezzi input con e senza cache è netto.
Con Opus 5, misura l'output fatturato su carichi rappresentativi, perché il thinking è attivo per impostazione predefinita.
Prima di prendere una decisione, esegui prompt rappresentativi su entrambe le API e registra tasso di cache hit, validità delle tool call, latenza e output fatturato.