Il miglior LLM open source per il coding: 48x di divario nei costi nel nostro test

Ultimo Aggiornamento: 2026-07-17 10:09:16

Risposta breve: GLM-5.2 è l'LLM open source più potente per il coding al momento — nell'uso prolungato la qualità del suo output si avvicina al livello di Claude Sonnet, ed è il modello che affideremmo ai problemi più difficili. È anche lento e assetato di token, quindi per agenti di coding API veloci scegli Kimi K2.7 Code, per il costo più basso DeepSeek V4 Flash, e per la tua GPU da 24GB Qwen3.6-27B.

Questa è la conclusione emersa sottoponendo gli stessi due compiti di coding a cinque modelli di punta open source, con Claude Opus 4.8 come riferimento closed-source. Tutti hanno prodotto codice corretto. Ciò che li distingueva era quanti token hanno consumato per arrivarci, e quella differenza arrivava fino a 48x in termini di costo.

Una nota sulla terminologia: quasi tutti questi sono tecnicamente modelli open-weight: i pesi sono liberi, i dati di addestramento no. Diciamo "open source" perché è il termine che le persone cercano. La distinzione conta solo per una risposta FAQ qui sotto.

Come abbiamo testato

Due attività, stesso prompt per ogni modello, inviato il 17 luglio 2026 con le impostazioni predefinite:

  • Task 1: scrivi una funzione per l’analisi di una durata con casi limite insidiosi (12 casi di test)
  • Task 2: correggi una funzione difettosa per l’unione di intervalli (6 casi di test)

Abbiamo valutato il codice localmente e registrato tre numeri per ogni esecuzione: tasso di superamento, token di output e tempo di esecuzione reale. Il costo è dato dai token moltiplicati per il prezzo di listino di ciascun fornitore, che abbiamo verificato lo stesso giorno. Due attività è una prova, non un benchmark, ma è il tipo di richiesta di routine che invierai centinaia di volte.

I risultati

Ogni modello ha superato ogni caso di test. Quindi la tabella qui sotto riguarda una sola cosa: l'efficienza:

ModelloToken di output (entrambi i task)Tempo del Task 1Costo
Kimi K2.7 Code2,18345.2s$0.0090
DeepSeek V4 Flash2,23116.7s$0.00066
DeepSeek V4 Pro2,52737.3s$0.0023
MiniMax M35,40936.7s$0.0067
GLM-5.27,13099.3s$0.0318
Claude Opus 4.8 (baseline)5398.1s
Output tokens used by each model to solve the same two coding tasks

La colonna dei token racconta la storia. GLM-5.2 e MiniMax M3 sono modelli “thinking”: per impostazione predefinita ragionano a lungo prima di rispondere. Questo ragionamento viene addebitato come output. Per la stessa funzione corretta, GLM-5.2 ha scritto 3 volte più token di Kimi K2.7 Code.

La situazione peggiora con un limite di token. Quando abbiamo limitato le risposte a 2.048 token, entrambi i modelli di ragionamento hanno consumato l’intero budget nel ragionamento e hanno restituito nessun codice. Paghi e non ottieni nulla. GLM-5.2 ha avuto bisogno di un limite di 16.384 token prima di terminare, e i suoi due tentativi falliti sono costati da soli circa $0.045. Se usi un modello di ragionamento all’interno di un agente di coding, aumenta max_tokens oppure disattiva il ragionamento per le modifiche di routine.

Cost to complete both test tasks at official API prices

Per confronto, Claude Opus 4.8 ha risolto entrambi i compiti in 539 token. I modelli open hanno raggiunto il livello di correttezza; in termini di brevità, il baseline closed è ancora 4x avanti.

I migliori modelli di programmazione open source per livello di distribuzione

Scegli in base a dove verrà eseguito il modello. I prezzi sono per 1M token, verificati il 2026-07-17.

Il modello più potente, se puoi aspettare: GLM-5.2

Nel lavoro di programmazione duro e articolato in più passaggi, la qualità dell’output di GLM-5.2 è la più vicina che un modello open riesca attualmente a raggiungere al livello di Claude — guida le classifiche dei benchmark agentici (SWE-Bench Pro, Terminal-Bench 2.1) e, nel nostro uso prolungato, è quello a cui affidiamo i problemi in cui gli altri inciampano. Maggiori dettagli nella nostra guida API di GLM-5.2.

Il prezzo di quella qualità è la pazienza. È stato il modello più lento e più affamato nel nostro test (99,3 s e 5.695 token nel Task 1), e la bassa velocità di serving riflette una capacità GPU limitata dal lato del fornitore più che il modello stesso. 1,40 $ in / 4,40 $ out, contesto da 1M, semplice MIT. Assegna ad esso i problemi difficili e un ampio budget di token; indirizza altrove le modifiche rapide.

Ideale per agenti di codifica API veloci: Kimi K2.7 Code

Il modello aperto più efficiente in termini di token che abbiamo testato: la sua correzione del bug ha richiesto 259 token, con una sinteticità simile a quella di Claude. È anche in testa nel benchmark di completamento delle attività di Kilo con il 60,7%.

Prezzi: $0.95 in / $4.00 out, $0.19 sugli accessi alla cache. L’unica vera limitazione è il contesto: 262K token, mentre il resto di questo elenco offre 1M. Per un confronto con il suo rivale più diretto, vedi Kimi K2.7 Code vs GLM-5.2.

Kimi K2.7 Code official pricing page showing $0.95 input and $4.00 output per million tokens

Miglior rapporto qualità-prezzo: DeepSeek V4 Flash

$0.14 in / $0.28 out, il modello nettamente più economico qui, e ha comunque superato tutto ciò che gli abbiamo lanciato contro, il più veloce tra i modelli open. I suoi punteggi pubblicati (79.0% SWE-Bench Verified, 91.6% LiveCodeBench) si collocano entro due punti del suo fratello maggiore. Il contesto è di 1M token, la licenza è la semplice MIT.

Inizia qui. Passa a V4 Pro solo quando il lavoro multi-file inizia a mettere in evidenza il divario.

DeepSeek official pricing docs showing V4 Flash and V4 Pro with OpenAI and Anthropic format endpoints

Il migliore su una GPU consumer da 24GB: Qwen3.6-27B

Un denso 27B che ottiene il 77,2% su SWE-Bench Verified, punteggi quasi da modello di punta da un modello che entra su una singola scheda consumer, ed è per questo che è la risposta ricorrente nei thread di r/LocalLLaMA che iniziano con "I have 24GB of VRAM."

Il suo fratello più veloce, Qwen3-Coder-Next (80B totali, solo 3B attivi per token, Apache 2.0), è la scelta della community per la velocità: un utente lo ha eseguito a ~20 token/s su una singola RX 9070 XT con contesto completo da 262K. Se preferisci richiamarlo come API, parte da $0.30/$1.50 tramite Alibaba Cloud.

Miglior self-host con una singola GPU: Gemma 4 31B

Secondo la model card di Google, il modello da 31B entra in una sola H100 da 80GB con un contesto da 256K, sotto licenza Apache 2.0. La variante da 12B funziona con 16GB di VRAM.

Un tranello di dimensionamento: i modelli MoE pubblicizzano piccoli conteggi di parametri “attivi”, ma devi comunque memorizzare l’intero insieme di pesi. DeepSeek V4 Flash attiva 13B per token ma pesa 284B in totale, circa 142GB anche a 4 bit. Si tratta di un progetto multi-GPU, non di una singola scheda.

Miglior scelta economica per lunghe sessioni autonome: MiniMax M3

Contesto da 1M a $0.30/$1.20, progettato per sessioni agentiche di più ore — MiniMax ha dimostrato un’esecuzione di ricerca non supervisionata di 12 ore. Condivide la verbosità del modello di ragionamento che hai visto nella tabella dei risultati, quindi calcola i token di conseguenza. Quando la qualità conta più del costo in un’esecuzione lunga, GLM-5.2 sopra è l’upgrade.

Ciò che le classifiche non ti dicono

I numeri dei benchmark sono ormai vicini: l'AI Index di Stanford ha rilevato che il divario tra il modello #1 e il #10 si è ridotto dal 11,9% al 5,4% in un anno. Tre cose che le tabelle dei punteggi nascondono ancora:

Il costo per attività batte il costo per token. Il prezzo di output di $4.40 di GLM-5.2 sembra vicino ai $4.00 di Kimi. Dopo il conteggio reale dei token, lo stesso lavoro costa 3,5 volte di più. Le statistiche live di Kilo mostrano il caso estremo: DeepSeek V4 Pro ha una media di $15.91 per ogni tentativo di benchmark completato, a fronte di un prezzo dichiarato di $0.87.

Stesso modello, contesto diverso, risultato diverso. Un modello all’interno di un ciclo agente ben costruito (strumenti strutturati, tentativi di nuovo, limiti di token sensati) si comporta in modo del tutto diverso dallo stesso modello in una semplice chiamata chat grezza. I nostri fallimenti zero-code con GLM erano una questione di interazione di configurazione, non una lacuna di capacità.

Ogni benchmark misura un lavoro diverso. LiveCodeBench riguarda la generazione algoritmica; DeepSeek V4 Pro lo vince con il 93,5%, superando i punteggi pubblicati dei modelli closed. SWE-Bench Verified riguarda la correzione di bug a livello di repository; Claude Mythos 5 è ancora in testa con il 95,5%, mentre i modelli open si aggirano intorno all'80%. Abbina il benchmark al tuo lavoro reale prima di fidarti di una classifica.

Sostituire un abbonamento Claude

Un fattore scatenante comune per passare all'open source: raggiungere i limiti di abbonamento di Claude nel bel mezzo della giornata lavorativa. I conti tornano. La nostra prova in due task è costata $0.00066 su DeepSeek V4 Flash; alcune centinaia di chiamate del genere al giorno restano comunque sotto un dollaro.

Il passaggio richiede anche meno configurazione di un tempo. DeepSeek pubblica un endpoint compatibile con Anthropic (api.deepseek.com/anthropic), quindi Claude Code può usarlo con una modifica della variabile d'ambiente; la stessa configurazione funziona per GLM-5.2. E se vuoi riservare Claude ai problemi più कठिन while routing routine work to open models, piattaforme come AIReiter offrono Claude al 20% del prezzo di listino tramite la stessa interfaccia compatibile con Anthropic.

Kimi K3: quello da tenere d'occhio

Moonshot ha lanciato Kimi K3 il 16 luglio 2026 e, per il lavoro frontend, ha già superato il modello chiuso più forte: #1 nella classifica Frontend Code con 1.679 contro i 1.631 di Claude Fable 5, e i primi resoconti pratici indicano la stessa direzione.

Non è classificato qui per un motivo: i weights si aprono il 27 luglio. Fino ad allora è una closed API a $3/$15. Una volta disponibili, K3 diventa il più grande modello open-weight rilasciato finora, e i numeri del frontend sopra suggeriscono che contenderà il primo posto in questa lista. Stiamo seguendo separatamente il rilascio dei K3 open-weights.

Come scegliere

1. Dove verrà eseguito? Sotto i 16GB di VRAM: usa un’API (Gemma 4 12B entra in locale, ma aspettati un vero calo di qualità). 24GB: Qwen3.6-27B. Un H100: Gemma 4 31B. API: DeepSeek V4 Flash finché non si dimostrerà insufficiente. 2. Che tipo di lavoro? Le modifiche rapide favoriscono modelli concisi: Kimi K2.7 Code o DeepSeek. I problemi difficili e le esecuzioni agentiche lunghe favoriscono GLM-5.2 (o MiniMax M3 se il budget è limitato), con budget di token generosi. 3. Vincoli di licenza? MIT (GLM, DeepSeek) e Apache 2.0 (Qwen, Gemma) non hanno vincoli. La MIT modificata di Kimi aggiunge una regola di attribuzione che entra in gioco solo su scala commerciale molto grande.

FAQ

Qual è il miglior LLM open source per la programmazione nel 2026?

GLM-5.2 ha il massimo potenziale — output quasi a livello di Claude Sonnet sui problemi difficili, a costo della velocità. Kimi K2.7 Code vince in efficienza dei token per gli agenti API, Qwen3.6-27B per l’hardware locale, DeepSeek V4 Flash sul costo.

Posso eseguire questi modelli localmente gratuitamente?

I pesi sono gratuiti; l'hardware no. Un modello da 27B richiede una GPU da 24GB, Gemma 4 31B ne vuole 80GB, e i modelli di punta da un trilione di parametri sono disponibili solo via API o cluster.

Qual è la differenza tra open source e open weight?

Open-weight significa pesi liberi ma dati di addestramento e codice privati, il che descrive quasi ogni modello qui. I modelli completamente open source (OpenCoder, StarCoder2, IBM Granite Code) pubblicano tutto ma sono indietro nelle capacità.

Esiste un LLM open source buono quanto Claude per la programmazione?

Sui benchmark algoritmici, sì: il 93,5% di DeepSeek V4 Pro su LiveCodeBench supera i punteggi pubblicati dei modelli closed. Sulle correzioni a livello di repository, Claude è ancora in testa (95,5% contro ~80% di SWE-Bench Verified). Nel nostro test i modelli open hanno eguagliato Claude in correttezza, ma hanno usato 4–13 volte più token.

Quale LLM open source è il migliore per C++ o per linguaggi di nicchia?

La serie K2 di Kimi ha la reputazione più forte nelle lingue di nicchia (Moonshot cita esplicitamente Zig). Per C++, il consenso della community indica DeepSeek V4 Pro e Qwen3 Coder Next. Qualunque cosa tu scelga, prova sul tuo codebase; la qualità nelle lingue di nicchia varia molto più di quanto suggeriscano i benchmark di Python.