AIREITER

Qwen 3.8 Max vs Kimi K3: output più economico, Kimi programma meglio (2026)

Ultimo Aggiornamento: 2026-08-06 07:43:55

Stessa fascia, stessa finestra di contesto da un milione di token, lancio a distanza di appena tre settimane e ragionamento al massimo sforzo attivo di default. Eppure, Qwen 3.8 Max e Kimi K3 hanno costi molto diversi: Kimi K3 è più forte nel coding, ma fattura $15 per milione di token in output, ovvero 2,5× i $6 di Qwen 3.8 Max. Qwen 3.8 Max è quindi l'opzione più economica e più recente, entrata in GA il 3 agosto 2026, con vantaggi anche su grafici e computer-use. Il rovescio della medaglia è che entrambi ragionano al massimo per impostazione predefinita: la tariffa di output superiore di Kimi K3 si accumula a ogni richiesta, mentre i pesi aperti di Qwen non arriveranno prima dell'11 agosto circa.

Specifiche quasi sovrapponibili, ma la scelta divide davvero

Qwen 3.8 Max e Kimi K3 sono entrambi modelli mixture-of-experts da trilioni di parametri, con contesto da un milione di token e visione nativa, pubblicati a metà 2026 a tre settimane di distanza. Sulla carta appartengono alla stessa categoria, ed è per questo che molti confronti si riducono a una sequenza di benchmark. La decisione pratica è più circoscritta: quanto siete disposti a pagare in output per avere un vantaggio nel coding e se vi servono subito pesi aperti o solide capacità multimodali.

SpecificaQwen 3.8 MaxKimi K3
Parametri totali2.4T2.8T
Attivi per token~95B104B
ArchitetturaMoE (~4% attivo)MoE (16 di 896 esperti)
Finestra di contesto~1M (991K input massimo)1,048,576
VisioneSì (input testuale + immagini)Sì (nativa)
Ragionamento predefinitoxhigh, thinking attivomassimo sforzo, reasoning attivo
Pesi apertiNo (attesi ~11 agosto)Sì (HF, 27 luglio, 1.56TB MXFP4)
Stato APIGA, 3 agosto 2026GA

Fonti: confronto diretto di yottalabs, Alibaba QwenCloud via AIReiter e Moonshot platform.kimi.ai, verificate il 6 agosto 2026.

Prezzi, simulazione dei costi e modalità di accesso

Entrambi i fornitori pubblicano prezzi per token, ma la differenza non è dove suggerirebbe il numero complessivo di parametri. Si concentra sull'output, cioè la voce che assorbe la maggior parte del budget dei modelli di reasoning. Kimi K3 costa $15 per milione di token in output, contro i $6 di Qwen 3.8 Max; inoltre entrambi i modelli esplicitano il ragionamento di default, quindi questa tariffa copre sia le tracce di reasoning sia la risposta finale.

Prezzo per 1M tokenQwen 3.8 MaxKimi K3
Input (cache miss)$2.00$3.00
Input (cache hit)$0.25$0.30
Output (incluso thinking)$6.00$15.00
Contesto~1M1,048,576

Fonti: pagina del modello Alibaba QwenCloud, aggiornata il 2 agosto 2026, e Moonshot platform.kimi.ai/docs/pricing/chat-k3, verificate il 6 agosto 2026.

Prezzi API ufficiali di Kimi K3 sulla piattaforma Moonshot: $3.00 per milione di token input senza cache, $0.30 per lettura cache, $15.00 in output, contesto da 1,048,576 token

Prendendo un carico di coding tipico da 20M token in input, con cache hit al 60%, e 5M token in output, Kimi K3 arriva a circa $103 ($27.60 di input più $75 di output), contro circa $49 per Qwen 3.8 Max ($19 di input più $30 di output). Il divario di 2× dipende quasi interamente dall'output: la cache riduce la differenza sull'input, ma non su quella voce e, dato che entrambi i modelli usano il reasoning al massimo sforzo per impostazione predefinita, la quota di output è consistente.

L'accesso non è simmetrico. Qwen 3.8 Max è entrato in disponibilità generale nell'API Alibaba il 3 agosto 2026, ma i suoi pesi non sono pubblici: la pagina del modello indica ancora Open Source: No, con pubblicazione prevista su Hugging Face e ModelScope nella settimana dell'11 agosto (Alibaba, tramite la pagina prezzi di Qwen 3.8 Max). Kimi K3 è invece l'opzione aperta: Moonshot ha pubblicato il checkpoint MXFP4 da 1.56 TB il 27 luglio e l'API è attiva.

Kimi K3 è disponibile anche tramite l'endpoint API di Kimi K3 di AIReiter, alla tariffa ufficiale Moonshot e senza markup: utile per testare K3 accanto ad altri modelli con un'unica fattura. Qwen 3.8 Max non è ancora integrato.

Kimi K3 è avanti nel coding agentico

Kimi K3 è il modello da scegliere per il coding multi-step: loop agentici, refactoring di repository e task in stile SWE, dove deve invocare strumenti e riprendersi da vicoli ciechi. Nei benchmark agentici pubblici supera con regolarità Qwen 3.8 Max, con il margine più ampio proprio nelle attività più vicine al lavoro di sviluppo reale.

Benchmark testa a testa: Kimi K3 è in vantaggio su TerminalBench 2.1, FrontierSWE e CharXiv con strumenti; Qwen 3.8 Max guida su CharXiv senza strumenti e PerceptionBench
BenchmarkQwen 3.8 MaxKimi K3
FrontierSWE73.581.2
TerminalBench 2.186.688.3
CharXiv (con strumenti)88.491.3

Fonte: confronto diretto di yottalabs, verificato il 6 agosto 2026.

Il giudizio della community segue i numeri, con la riserva sui costi che definisce questo confronto:

"K3 è di un altro livello. Qwen 3.8 gli è molto simile. Tuttavia, né l'abbonamento né i costi API sono giustificati per nessuno dei due modelli così come sono…" — r/Qwen_AI

"In questo esercizio K3 surclassa Qwen 3.8 di gran lunga; Qwen ha generato questa landing page 3 volte più velocemente di Kimi." — @filicroval su X

Kimi K3 ottiene anche un punteggio di intelligenza grezza più alto, pari a 57 nell'Artificial Analysis Intelligence Index, ma non è veloce: circa 39 token in output al secondo e 3.1 secondi al primo token (Artificial Analysis). Il compromesso è chiaro: qualità e apertura in cambio di latenza e costi maggiori.

Qwen 3.8 Max punta su multimodalità e rapporto qualità-prezzo

Qwen 3.8 Max è la scelta migliore quando il carico di lavoro richiede di leggere grafici, screenshot o di controllare un browser, e quando il costo dell'output conta più di qualche punto in più nei benchmark di coding. Supera Kimi K3 nei test su documenti e percezione, mantiene un primato verificato in un benchmark di computer-use e applica il 40% della tariffa output di Kimi K3.

BenchmarkQwen 3.8 MaxKimi K3
CharXiv (senza strumenti)93.584.8
PerceptionBench63.558.5
OSWorld-Verified86.1% (SOTA)nessun punteggio pubblico

Fonte: confronto diretto di yottalabs, verificato il 6 agosto 2026.

Il punto debole di Qwen 3.8 Max coincide esattamente con il terreno su cui Kimi K3 eccelle e compete con i modelli closed di frontiera. Su SWE-bench Pro totalizza 67.7, molto sotto l'80 di Claude Fable 5 (tabella pubblicata da Alibaba, gestita dal fornitore), quindi non è il modello per le valutazioni di software engineering più difficili. Al momento della stesura, la sua API ha inoltre appena tre giorni di vita, essendo entrata in GA il 3 agosto 2026, e i pesi restano chiusi: chi deve fare self-hosting oggi dovrà aspettare oppure scegliere Kimi K3.

Quale scegliere in base al carico di lavoro

La scelta dipende meno da quale modello sia oggettivamente migliore e più da ciò per cui lo si chiama. La matrice seguente associa i casi d'uso più comuni a una scelta e alla relativa motivazione verificata.

Se il vostro carico di lavoro è…SceglietePerché
Loop agentici, refactoring di repository, task SWE (costo non prioritario)Kimi K3FrontierSWE 81.2 contro 73.5, TerminalBench 88.3 contro 86.6
Parsing di documenti/grafici, browser o computer-use, con attenzione ai costiQwen 3.8 MaxCharXiv 93.5, OSWorld 86.1% SOTA, output $6 contro $15
Self-hosting oggiKimi K3Pesi su HF dal 27 luglio; quelli di Qwen arrivano intorno all'11 agosto

FAQ

Qwen 3.8 Max è migliore di Kimi K3 per il coding?

No. Kimi K3 è in vantaggio nei benchmark di coding agentico più rilevanti, con 81.2 contro 73.5 in FrontierSWE e 88.3 contro 86.6 in TerminalBench 2.1. Per le attività di engineering multi-step, Kimi K3 è quindi la scelta più solida.

Quale costa meno tra Qwen 3.8 Max e Kimi K3?

Qwen 3.8 Max. Costa $6 per milione di token in output contro i $15 di Kimi K3, e $2 in input contro $3, con prezzi da cache hit simili: su un tipico carico di coding il divario è di circa 2×.

Quale costa meno per il coding agentico con reasoning al massimo?

Resta Qwen 3.8 Max: entrambi fatturano i token di reasoning come output al massimo sforzo, perciò la tariffa di $15/M di Kimi K3 amplia il divario proprio nel carico di coding in cui è superiore.

Entrambi supportano un contesto da un milione di token?

Sì. Qwen 3.8 Max accetta circa 991K token in input, meno quando il thinking è attivo, mentre Kimi K3 arriva a 1,048,576; entrambi dispongono nominalmente di finestre da un milione di token.

I pesi sono aperti?

Quelli di Kimi K3 sì. Moonshot ha rilasciato il checkpoint MXFP4 da 1.56 TB il 27 luglio 2026. Quelli di Qwen 3.8 Max non ancora: Alibaba li indica come chiusi, con rilascio su Hugging Face e ModelScope previsto nella settimana dell'11 agosto.

Approfondimenti correlati