Ling 3.0 Flash: modello da 124B, 5,1B attivi e API gratis

Ultimo Aggiornamento: 2026-07-24 03:41:08

I modelli da 124 miliardi di parametri tendono a essere lenti e costosi da servire. Ling 3.0 Flash segue una strada diversa: per ogni token ne attiva circa 5,1 miliardi e, al momento, si può usare gratuitamente.

inclusionAI lo ha rilasciato il 23 luglio 2026. È un modello Mixture-of-Experts (MoE) a ragionamento ibrido pensato per gli agenti: programmazione, chiamate a strumenti, ricerca e attività di lunga durata.

Cos'è Ling 3.0 Flash

Ling 3.0 Flash nasce da inclusionAI, il gruppo di ricerca responsabile delle famiglie di modelli Ling e Ring di Ant Group. Ant Group è la società fintech che gestisce Alipay. La sigla "Flash" identifica la fascia veloce ed efficiente nei costi, collocata sotto i modelli di punta molto più grandi del gruppo.

È un modello Mixture-of-Experts: sui suoi 124B di parametri complessivi, solo ~5,1B entrano in funzione per ciascun token. In termini di velocità e costi, il comportamento è quindi più vicino a quello di un modello piccolo.

Il modello usa inoltre un ragionamento ibrido: risponde direttamente alle richieste semplici e passa a una modalità di ragionamento più estesa quando il compito è difficile. inclusionAI lo indirizza agli "agenti su scala produttiva", cioè carichi di lavoro che usano strumenti, navigano sul web, scrivono ed eseguono codice e mantengono lo stato attraverso numerosi passaggi.

Più capacità, meno calcolo per token

Il confronto con Ling 2.6 Flash chiarisce la scelta progettuale. I parametri totali sono aumentati da 104B a 124B, mentre quelli attivi sono scesi da 7,4B a 5,1B.

Grafico a barre che confronta Ling 2.6 Flash e Ling 3.0 Flash: i parametri totali salgono da 104B a 124B, mentre i parametri attivi per token scendono da 7,4B a 5,1B

Più parametri complessivi significano maggiore spazio per memorizzare conoscenza; meno parametri attivi riducono il costo di generazione di ogni token. In pratica, si sostiene un costo di inferenza vicino a quello di un modello da ~5B, pur attingendo a una capacità da 124B.

Per gli agenti è un aspetto particolarmente rilevante. Se un'attività genera migliaia di token distribuiti su molte chiamate a strumenti, è il costo per token a incidere maggiormente: ridurre i parametri attivi conta più di una dimensione nominale più grande.

Alla base c'è uno stack di attenzione lineare ibrida. inclusionAI descrive un blocco ricorrente composto da cinque layer KDA, basati su attenzione lineare, per ogni layer di attenzione completa MLA. L'attenzione lineare mantiene contenuto il costo degli input lunghi, mentre lo strato periodico di attenzione completa conserva il richiamo preciso che i modelli puramente lineari tendono a perdere. È questo a consentire a Flash un contesto nativo di 256K, con margine verso 1M. I router lo indicano come 262K, ovvero l'esatto conteggio di 262.144 token.

Per quali attività è pensato

Flash è ottimizzato per il lavoro agentico, non per la chat generica e senza vincoli. L'annuncio di inclusionAI cita una maggiore precisione nelle chiamate a strumenti, prestazioni più stabili nei task a lungo orizzonte e una migliore compatibilità con i comuni framework "harness" per agenti. Le demo di lancio sono coerenti: una città 3D in Blender, ricerca multi-agente, attività Office via MCP e app browser.

Sul fronte del coding, inclusionAI lo posiziona per il ragionamento spaziale e strutturale, come griglie di scena e posizioni relative, oltre alla normale generazione di codice.

Una nota sui benchmark: il modello ha solo pochi giorni di vita, quindi i dati disponibili consistono nelle dichiarazioni di inclusionAI e nei primi test della community, non in valutazioni indipendenti. inclusionAI afferma che Flash eguaglia o supera il proprio modello di punta da ~1 trilione di parametri in molte attività, usando una frazione dei parametri attivi; la sua tabella dei risultati riporta inoltre 56,63 su SWE-Bench Pro in modalità di ragionamento. Finché non arriveranno conferme di terze parti, è opportuno considerarli dati del fornitore.

Come provare Ling 3.0 Flash gratis

La via più rapida è OpenRouter. Il modello è disponibile come inclusionai/ling-3.0-flash e, al lancio, costa $0 in input e $0 in output: resta gratuito fino al 3 agosto 2026 (prezzi verificati il 24 luglio 2026). È gratuito anche su ZenMux. Entrambi espongono un'API compatibile con OpenAI.

Ecco una chiamata minimale:

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "inclusionai/ling-3.0-flash",
    "messages": [{"role": "user", "content": "Write a Python function to parse a CSV."}]
  }'
Pagina del modello Ling-3.0-flash su OpenRouter, con MoE da 124B e 5,1B di parametri attivi, contesto da 262K e data di rilascio 23 luglio 2026

Qualsiasi client che usa già chat/completions funziona dopo aver sostituito URL di base, chiave e stringa del modello. Un model router permette inoltre di confrontare Ling 3.0 Flash in A/B con il modello attuale sugli stessi prompt, senza riscrivere nulla.

Ci sono però due aspetti da mettere in conto. La gratuità è promozionale, quindi dopo i primi giorni di agosto è prevedibile una tariffazione a consumo. Come riferimento, Ling 2.6 Flash costa circa $0.01 in input / $0.03 in output per milione di token. Inoltre, al lancio il modello era servito da un unico provider: throughput e disponibilità dipendono quindi da quel solo backend.

Si possono scaricare i pesi?

È qui che le ricerche "Ling 3.0 flash download" e "Ling 3.0 flash github" si fermano. Al lancio i pesi non sono stati pubblicati: per ora Flash è disponibile solo via API.

Rispetto al passato è un cambiamento importante. Ling 2.6 Flash è stato rilasciato con pesi aperti su Hugging Face e può quindi essere eseguito localmente già oggi. Flash 3.0, invece, no.

Chi vuole ospitarlo in proprio o quantizzarlo sul proprio hardware può monitorare la pagina Hugging Face di inclusionAI: i pesi della versione 2.6 sono pubblicati lì e, se il gruppo ripeterà lo stesso schema, anche un eventuale rilascio di 3.0 approderà lì. Fino ad allora, gli unici punti di accesso sono i router API indicati sopra.

Ling 3.0 Flash e Ling 2.6 Flash a confronto

Ling 3.0 FlashLing 2.6 Flash
Rilascio23 lug 202621 apr 2026
Parametri totali124B104B
Attivi per token~5,1B~7,4B
Finestra di contesto256K nativi (262K sui router)256K (262K sui router)
Pesi apertiNon al lancioSì (Hugging Face)
Prezzo di lancioGratuito fino al 3 agosto 2026~$0.01 in input / $0.03 in output per 1M
FocusAgenti a ragionamento ibrido, uso di strumenti, codingModello instruct veloce per agenti

In breve, 3.0 Flash riduce una parte del calcolo attivo per offrire più capacità e una modalità di ragionamento ibrido, passando a una distribuzione API-first. Se servono nello specifico pesi locali e offline, Ling 2.6 Flash resta la versione scaricabile.

Domande frequenti

Ling 3.0 Flash è gratis?

Sì, per ora. È gratuito su OpenRouter fino al 3 agosto 2026 e anche su ZenMux. Al termine della promozione è prevista una tariffazione a consumo.

Ling 3.0 Flash è open source? Posso scaricarlo o trovarlo su GitHub?

Non al lancio. I pesi non sono stati pubblicati, quindi il modello è accessibile solo via API, senza download né repository. Si può usare OpenRouter (inclusionai/ling-3.0-flash) oppure ZenMux. Il precedente Ling 2.6 Flash è aperto su Hugging Face, perciò eventuali pesi di 3.0 comparirebbero probabilmente lì.

Ling 3.0 Flash è un modello cinese?

Sì. È sviluppato da inclusionAI, il gruppo di ricerca AI legato ad Ant Group, la fintech cinese che gestisce Alipay.

Quanto è grande Ling 3.0 Flash?

Ha 124B di parametri totali e ~5,1B attivi per token grazie al design MoE, con un contesto nativo di 256K che inclusionAI dichiara scalabile verso 1M.

Ling 3.0 Flash o Ling 2.6 Flash: quale usare?

Scegli 3.0 Flash per agenti con ragionamento ibrido e un costo per token più basso via API. Scegli 2.6 Flash se hai bisogno di scaricare i pesi ed eseguirlo localmente, dato che 3.0 non è ancora aperto.

Approfondimenti correlati