AIREITER

Recensione di MAI-Thinking-1: il primo modello di ragionamento Microsoft (2026)

Ultimo Aggiornamento: 2026-08-13 07:39:55

Dal 12 agosto 2026 MAI-Thinking-1 è disponibile in public preview su Microsoft Foundry. È il primo modello di ragionamento sviluppato interamente da Microsoft: uno sparse MoE con 35B di parametri attivi su circa 1T complessivi e una finestra di contesto da 256K token. L'idea è offrire risultati competitivi in matematica e programmazione con un'impronta di inferenza molto più contenuta, ma i dati delineano un quadro meno netto: su SWE-Bench Pro è quasi alla pari con Claude Opus 4.6 (52,8% contro 53,4%), mentre su Terminal-Bench 2.0 resta molto indietro rispetto al 75,1% di GPT-5.4, fermandosi al 46,0%. E nonostante i ripetuti riferimenti a un «prezzo da modello mid-weight», Microsoft non ha ancora comunicato alcun costo per token.

Cos'è MAI-Thinking-1 e come funziona

MAI-Thinking-1 è un modello di ragionamento sparse Mixture-of-Experts sviluppato internamente da Microsoft AI. Attiva 35 miliardi di parametri su circa 1 trilione complessivo. Nel report tecnico, i valori precisi del modello base sono 34,7B di parametri attivi e 962B totali, distribuiti su 78 layer; per ogni token instradato vengono selezionati 8 esperti su 512. La finestra di contesto raggiunge 256.000 token, approssimativamente 600 pagine di testo: un ordine di grandezza analogo a Claude Sonnet 4.6 e GPT-5.4.

Sul fronte API, MAI-Thinking-1 adotta il diffuso formato Chat Completions API e supporta function calling, developer instructions e output strutturato. Il codice pensato per gli endpoint chat di OpenAI può quindi essere adattato con modifiche minime. È però un modello solo testuale: non accetta né genera immagini, audio o video. Per queste modalità Microsoft indica modelli distinti, ossia MAI-Image 2.5 e MAI-Voice 2.

Il principale elemento distintivo, secondo Microsoft, è il processo di addestramento. Il paper tecnico parla di 30T di token di pre-training provenienti da dati generati da esseri umani, pubblici o concessi in licenza commerciale, oltre a 3,55T token per il mid-training. L'addestramento ha impiegato 8.000 GPU GB200, mentre la fase RL ha usato 4.600 GB300. Microsoft afferma inoltre che il modello è stato addestrato senza distillazione da modelli di terze parti, escludendo quindi dati sintetici generati dai modelli di altri laboratori.

Il modello è stato annunciato per la prima volta al Microsoft Build del 2 giugno 2026, all'interno di una famiglia MAI composta da sette modelli. È rimasto in private preview fino al 12 agosto 2026.

Benchmark: il suo livello reale

Il quadro più completo dei benchmark arriva dal paper tecnico di Microsoft. Tutti i risultati di MAI-Thinking-1 sono medie di quattro esecuzioni con temperatura 1 e top-p 0,97; per i test di coding agentico è stata usata una lunghezza di contesto totale di 256K. I valori dei concorrenti provengono dalle rispettive model card ufficiali, non da riproduzioni indipendenti.

BenchmarkMAI-Thinking-1Sonnet 4.6Opus 4.6GPT-5.4Kimi K2.6DeepSeek V4GLM-5.1
AIME 202597,095,699,8————
AIME 202694,5———96,4—95,3
GPQA Diamond84,289,991,392,890,590,185,2
LiveCodeBench v687,7———89,693,5—
SWE-Bench Verified73,579,680,8—80,280,6—
SWE-Bench Pro52,8—53,457,758,655,458,4
Terminal-Bench 2.046,059,165,475,166,767,969,0

Il pattern è piuttosto chiaro. Nella matematica pura, MAI-Thinking-1 si comporta bene: il 97,0% in AIME 2025 supera il 95,6% di Sonnet 4.6, pur restando sotto al 99,8% di Opus 4.6. In AIME 2026, con il 94,5%, è invece dietro sia a Kimi K2.6, al 96,4%, sia a GLM-5.1, al 95,3%.

Nel coding agentico il distacco aumenta. Il 52,8% di SWE-Bench Pro è vicino al 53,4% di Opus 4.6, confronto su cui Microsoft punta l'attenzione. Tuttavia, GPT-5.4 (57,7%), Kimi K2.6 (58,6%), DeepSeek V4 (55,4%) e GLM-5.1 (58,4%) ottengono tutti risultati superiori. In Terminal-Bench 2.0, che misura le prestazioni di agenti terminali su attività in più passaggi, il 46,0% di MAI-Thinking-1 è distante 13 punti dal 59,1% di Sonnet 4.6 e 29 punti dal 75,1% di GPT-5.4.

Lo stesso paper tecnico riconosce che il modello «non guida il settore». MAI-Thinking-1 è competitivo rispetto alla propria impronta di 35B di parametri attivi, non ai vertici assoluti della classifica.

Altri dati dal report tecnico, nel confronto con Sonnet 4.6:

AreaMAI-Thinking-1Sonnet 4.6
MMLU-Pro8587
SimpleQA Verified3129
BFCL v3 (tool calling)7276
CyberSecEval Instruct6362
GraphWalks (≤128K)9096

Il vantaggio dichiarato su Sonnet 4.6

Il risultato più promosso da Microsoft deriva da una valutazione umana in cieco, testa a testa, svolta con valutatori professionisti di Surge su 1.276 attività, di cui il 30% multi-turn. Il paper tecnico riporta i numeri esatti, assenti dal blog di lancio:

Contro Claude Sonnet 4.6:

  • Vittorie di MAI-Thinking-1: 49%; pareggi: 6%; sconfitte: 45%
  • Delta di preferenza complessivo: +0,07 ± 0,06
  • Vantaggio più marcato: sintesi/pertinenza (+0,11 ± 0,02) e stile/tono (+0,08 ± 0,02)
  • Risultato statisticamente alla pari per aderenza alle istruzioni, accuratezza fattuale e completezza

Contro Claude Opus 4.6:

  • Vittorie di MAI-Thinking-1: 43%; pareggi: 5%; sconfitte: 52%
  • Delta di preferenza complessivo: -0,07 ± 0,06

Nel confronto con Sonnet, il modello supera complessivamente la soglia della «preferenza», ma il margine di +0,07 con un intervallo di confidenza di ±0,06 indica un vantaggio reale ma ridotto. Contro Opus, invece, la sconfitta è netta. Le attività erano soprattutto Q&A aperto, scrittura di contenuti e sintesi, non gli scenari impegnativi di coding e ragionamento multi-step in cui MAI-Thinking-1 registra i risultati di benchmark più deboli.

Su Reddit, gli utenti di r/LocalLLaMA discutono se MAI-Thinking-1 rappresenti di fatto il successore della linea Phi di Microsoft, osservando che la famiglia non ha pesi aperti. Conta anche il contesto strategico: secondo quanto riportato da Bloomberg, Microsoft ha iniziato a sostituire i modelli OpenAI e Anthropic con MAI in Excel e Outlook. Questo suggerisce che il valore principale di MAI-Thinking-1 possa essere il controllo dei costi nei prodotti Microsoft stessi.

Prezzi e accesso: cosa manca davvero

Non esiste un listino pubblico per token di MAI-Thinking-1. Microsoft usa formule qualitative come «prezzo da modello mid-weight», «conveniente» e «impronta di inferenza più piccola», ma non fornisce una sola cifra in dollari nell'annuncio di lancio, nella pagina del modello o nel report tecnico. Per chi vuole valutarlo in produzione, questa è la principale incognita.

Per riferimento, questi sono i prezzi dei modelli di ragionamento comparabili (prezzi OpenAI, prezzi Google AI):

ModelloInput ($/1M token)Output ($/1M token)
OpenAI o3~$10~$40
Gemini 2.5 Pro~$1,25~$10
Claude Sonnet 4.6*~$3~$15

\*Il prezzo di Claude varia in base al tier; stima di fascia media dai prezzi Anthropic.

Il posizionamento «mid-weight» di Microsoft lascia pensare che il costo di MAI-Thinking-1 si collocherà probabilmente tra Gemini 2.5 Pro e Claude Sonnet, ma finché non verrà pubblicata una tariffa, ogni budget sarà solo una stima.

Quanto all'accesso, MAI-Thinking-1 è in public preview tramite Microsoft Foundry e nella pagina del modello è disponibile un link al playground. L'annuncio di giugno indicava OpenRouter, Fireworks AI e Baseten come partner di distribuzione previsti, ma al momento di questa recensione nessuno dei tre è operativo. Il modello ha pesi chiusi: non esistono release su Hugging Face, file GGUF o opzioni di self-hosting.

Pagina del modello MAI-Thinking-1 su Microsoft AI

Per usare MAI-Thinking-1 oggi:

  1. Accedi a Microsoft Foundry con un account Azure
  2. Apri la pagina del modello MAI-Thinking-1 all'interno di Foundry
  3. Usa il playground per i test oppure effettua il deployment tramite l'endpoint compatibile con Chat Completions
  4. La fatturazione passa dall'abbonamento Azure; in preview le tariffe non sono ancora divulgate

Per chi ha senso usare MAI-Thinking-1 oggi

È una scelta sensata per:

  • Team già standardizzati su Azure o Microsoft Foundry che cercano un modello di ragionamento first-party con controlli di governance enterprise
  • Carichi di lavoro dominati da matematica, ragionamento formale o problemi in stile competizione: il 97% su AIME 2025 è un risultato concreto
  • Organizzazioni che richiedono una provenienza dei dati chiara per ragioni di conformità: l'affermazione di Microsoft su assenza di distillazione e dati con licenza può essere rilevante nei settori regolamentati
  • Team impegnati in code review e analisi, dove il vantaggio in termini di sintesi emerso dalla valutazione umana è utile

Meglio aspettare se servono:

  • Input o output multimodali: il modello è solo testuale
  • Task agentici di lunga durata: il 46% in Terminal-Bench 2.0 è un limite decisivo per l'automazione da terminale
  • Self-hosting o pesi aperti: il modello è proprietario e vincolato a Foundry
  • Costi di produzione prevedibili: senza prezzi non è possibile pianificare un budget
  • Prestazioni da vertice per coding agent: Kimi K2.6, GPT-5.4 e DeepSeek V4 ottengono tutti punteggi più alti in SWE-Bench Pro e Verified

FAQ

MAI-Thinking-1 è open source?

No. Il modello è proprietario e a pesi chiusi. Non ci sono pesi scaricabili, release su Hugging Face né un percorso di self-hosting. L'accesso è possibile esclusivamente tramite Microsoft Foundry.

MAI-Thinking-1 alimenta Copilot?

Secondo quanto riportato da Bloomberg, Microsoft ha iniziato a sostituire i modelli OpenAI e Anthropic con modelli MAI in Excel e Outlook. Tuttavia, non è confermato che MAI-Thinking-1 sia il modello alla base di GitHub Copilot o Microsoft 365 Copilot per gli utenti finali.

MAI-Thinking-1 è il successore di Microsoft Phi?

Microsoft non lo presenta in questi termini, ma la community lo interpreta come un cambio di direzione. Phi era la famiglia di piccoli modelli Microsoft a pesi aperti; MAI è la nuova famiglia proprietaria. La differenza centrale è che MAI-Thinking-1 è chiuso e più grande, con 35B di parametri attivi contro i 3-14B di Phi, e punta al deployment enterprise anziché all'esecuzione locale.

MAI-Thinking-1 supporta immagini, audio o video?

No. È un modello esclusivamente testuale, sia in input sia in output. Per le altre modalità Microsoft offre separatamente MAI-Image 2.5 (text-to-image), MAI-Transcribe-1.5 (speech-to-text) e MAI-Voice-2 (generazione vocale).

Qual è il cutoff dei dati di addestramento di MAI-Thinking-1?

La model card indica luglio 2025 come cutoff dell'addestramento, ma il report tecnico segnala che la raccolta delle fonti è proseguita fino all'inizio del 2026: HTML dal web fino a settembre 2025, PDF dal web fino a dicembre 2025, libri e riviste fino a marzo 2026. La discrepanza suggerisce che il cutoff si riferisca allo stop della raccolta dati per il post-training, non alla data in cui sono state raccolte tutte le fonti.

Posso usare MAI-Thinking-1 tramite OpenRouter?

Non ancora. Al lancio del 2 giugno Microsoft aveva indicato OpenRouter, Fireworks AI e Baseten come partner di distribuzione previsti, ma ad agosto 2026 nessuno è operativo. L'unica via di accesso attuale è la public preview di Microsoft Foundry.

Il tuo carico di lavoroScelta migliore oggi
Matematica da competizione, dimostrazioni formaliMAI-Thinking-1 (97% AIME) o Claude Opus 4.6 (99,8%)
Coding agentico, automazione da terminaleGPT-5.4 (75,1% Terminal-Bench) o Kimi K2.6 (66,7%)
Code review, rilevamento bugClaude Sonnet 4.6 (79,6% SWE-Verified) o Opus 4.6 (80,8%)
Ragionamento enterprise nativo AzureMAI-Thinking-1 (first-party, governance Foundry)
Produzione con budget limitatoGemini 2.5 Pro ($1,25/$10)
Self-hosting o pesi apertiNon disponibile con MAI; valuta i pesi aperti di DeepSeek V4 o Qwen3.8