Thinking Machines Inkling è un modello open-weight da 975 miliardi di parametri rilasciato il 15 luglio 2026, կառուցito come una miscela sparsa di esperti che attiva solo 41B parametri per token e accetta input di testo, immagine e audio. Viene distribuito sotto Apache-2.0, quindi puoi scaricare i pesi completi e fare fine-tuning commercialmente. Il problema: anche una quantizzazione a 4 bit richiede circa 600GB di VRAM, quindi questo è un modello che i team valutano su un cluster, non qualcosa che esegui su una GPU da gaming.
Le specifiche e ciò che i titoli hanno sbagliato
Ecco cosa riportano la model card di Hugging Face e la pagina ufficiale di Inkling (consultate il 16 luglio 2026).
| Specifica | Inkling |
|---|---|
| Parametri totali | 975B |
| Parametri attivi | 41B per token |
| Architettura | 66 livelli, solo decoder, sparse MoE (256 esperti, 6 instradati + 2 condivisi) |
| Modalità | Testo, immagine, audio in input; testo in output (UTF-8) |
| Dati di addestramento | 45 trilioni di token |
| Licenza | Apache-2.0 |
| Download | Hugging Face (thinkingmachines/inkling) |
Tre cose che circolano nella copertura del lancio devono essere corrette:
- Finestra di contesto. Diversi articoli citavano una finestra da 1M token. La pagina ufficiale di Inkling indica 64K standard e 256K quando viene eseguito tramite la piattaforma Tinker; la scheda di Hugging Face non specifica alcun numero. Considera 64K/256K come i valori verificabili e 1M come non confermato.
- Licenza. È confermata Apache-2.0, una delle licenze più permissive disponibili, e consente l'uso commerciale. Thinking Machines ti affida la responsabilità della sicurezza del fine-tuning.
- "Inkling-Small." In alcuni report è comparsa una variante più piccola con circa 12B parametri attivi, ma non è elencata nella scheda del modello su Hugging Face. Finché non comparirà lì, non contarci.
Cosa significa davvero "975B parameters" qui
Inkling instrada ogni token a 6 dei 256 esperti più 2 esperti condivisi, quindi solo circa 41B parametri entrano in azione alla volta anche se il pool completo è di 975B. Ecco perché Thinking Machines sostiene che sia all’altezza di Nemotron 3 Ultra di Nvidia nella programmazione, pur spendendo circa un terzo di token in meno per arrivarci: ottieni l’ampiezza di un modello grande al costo di inferenza di un modello di dimensioni intermedie.
Inkling espone anche una manopola di "thinking effort". Aumentala per i problemi più difficili e accetta risposte più lente e più ponderate, oppure abbassala per la velocità. È addestrato a segnalare l'incertezza invece di indovinare, e questo conta di più per una base di fine-tuning che per un chatbot consumer.
Puoi davvero eseguire Inkling?
È qui che l'etichetta "open weights" si complica, perché open non significa leggero. Ecco, in linea di massima, cosa serve per servire il modello completo da 975B, sulla base della scheda del modello e delle prime stime della community (si tratta di valori approssimativi, non di garanzie):
- BF16 (precisione completa): ~2TB di VRAM solo per i pesi, quindi oltre 16 GPU di classe H200, oppure un nodo B300 a 8 GPU, prima di aggiungere l’overhead di serving.
- NVFP4 / 4-bit: ~600GB, ancora comunque nel territorio dei server multi-GPU (circa 4× H200 o 8× schede da 80GB).
- GGUF a 1-2 bit (llama.cpp / quantizzazioni Unsloth): ~280-350GB di RAM+VRAM combinati, raggiungibili su una workstation di fascia alta o su un Mac Studio Ultra al massimo, e più lento quando ci si spinge verso contesti lunghi perché la KV cache cresce.
La realtà onesta: un team ben finanziato può valutare e perfezionare Inkling, ma oggi non esiste un percorso su GPU consumer per eseguirlo in locale. Se sei uno sviluppatore solitario che spera di caricarlo su una singola scheda da 24 GB, questo non è il modello che fa per te. Lo scarichi da Hugging Face a thinkingmachines/inkling, oppure lo perfezioni tramite la piattaforma Tinker di Thinking Machines, che sblocca anche il contesto da 256K.
Dove si colloca Inkling rispetto agli altri modelli
Thinking Machines afferma apertamente che Inkling non è il modello più potente disponibile, e i benchmark della scheda del modello lo confermano: Inkling ottiene buoni risultati, ma resta indietro rispetto al fronte chiuso nel ragionamento e nella programmazione.
| Benchmark | Inkling | Miglior rivale citato |
|---|---|---|
| AIME 2026 | 97.1% | GPT 5.6 Sol, 99.9% |
| SWE-bench Verified | 77.6% | Claude Fable 5, 95.0% |
| MMMU Pro | 73.3% | Claude Fable 5, 84.2% |
| VoiceBench | 91.4% | Gemini 3.1 Pro, 94.3% |
*Fonte: model card di Inkling e pagina ufficiale dei benchmark, consultati il 16 luglio 2026.*
Il grafico radar ufficiale racconta visivamente la stessa storia. Inkling si difende bene nei task di ragionamento e multimodali, ma si colloca al di sotto di GPT 5.6 Sol e Claude Fable 5 nel coding agentico (SWE-bench Pro, Terminal Bench).
Dove eccelle è nell’ampiezza: comprensione nativa di audio e immagini in un unico modello open, con un divario nella programmazione che puoi ridurre tramite fine-tuning. Se ti serve il miglior agentic coding della categoria subito, un modello frontier closed vince ancora. Se ti serve una base open e multimodale di tua proprietà, Inkling è l’opzione più interessante.
A chi è davvero destinato Inkling
Inkling è una base su cui costruire, non un assistente finito. Thinking Machines guadagna da Tinker, la sua piattaforma di fine-tuning, non dalle chiamate API a consumo, quindi il modello stesso è gratuito e il messaggio è: "prendi questo e specializzalo."
La prova più evidente è Bridgewater Associates: secondo Thinking Machines, una versione del modello ottimizzata per la finanza ha ottenuto l’84,7% nel test di ragionamento dell’azienda a circa un quattordicesimo del costo di un modello proprietario. Questo è l’uso previsto, un generalista capace che un team adatta a un dominio specifico.
Quindi è una scelta adatta se hai l’infrastruttura e l’esperienza di fine-tuning per specializzare un modello open e possederne il risultato, e puoi assumerti la responsabilità del safety tuning. Saltalo se vuoi un chatbot pronto all’uso o se stai lavorando con hardware consumer, perché i modelli closed di uso generale sono più economici da raggiungere e più forti fin dal primo giorno. Una precisazione da conoscere: il post-training di Inkling ha utilizzato dati generati da altri modelli open, incluso Kimi K2.5 di Moonshot, e Thinking Machines afferma che la sua prossima generazione sarà completamente self-trained.
FAQ di Inkling
Inkling è gratuito per uso commerciale?
Sì. È rilasciato con licenza Apache-2.0, che consente l'uso commerciale e la modifica. Sei responsabile di qualsiasi fine-tuning sulla sicurezza prima di distribuirlo.
Dove posso scaricare Inkling?
I pesi completi sono su Hugging Face all’indirizzo thinkingmachines/inkling. Anche le versioni GGUF quantizzate della community compaiono lì.
Inkling ha davvero una finestra di contesto da 1M token?
La pagina ufficiale indica 64K per impostazione predefinita e 256K tramite la piattaforma Tinker. La cifra di 1M in alcune coperture non è confermata nella model card, quindi pianifica in base a 64K/256K.
Inkling vs DeepSeek o Qwen, quale è migliore?
Dipende dal lavoro, non da un singolo punteggio. Il vantaggio di Inkling è l’input multimodale nativo (testo, immagine, audio) in un unico modello Apache-2.0, più il percorso di fine-tuning Tinker; i principali modelli open cinesi restano ottime scelte generali e per il coding. Confrontali sul tuo compito prima di prendere una decisione.
Che cos’è Tinker e ne ho bisogno?
Tinker è la piattaforma di fine-tuning ospitata di Thinking Machines. Non ti serve per eseguire gli open weights, ma è il canale ufficiale per personalizzare Inkling e aumenta la finestra di contesto a 256K.
---
Letture correlate
