MiMo-V2.6-Pro è un modello reale, pubblico e sorprendentemente economico rispetto ai risultati ottenuti nei primi benchmark. Non è però un sostituto universale dei modelli frontier. Xiaomi ha pubblicato il modello open-weight il 21 settembre 2026: il suo scenario ideale è l'automazione con agenti e l'uso via API a costi contenuti, mentre il deployment locale e l'affidabilità nelle esecuzioni prolungate richiedono ancora qualche cautela.
Recensione di MiMo-V2.6-Pro: il verdetto in una tabella
| Se ti serve... | Consiglio | Perché |
|---|---|---|
| Esperimenti con agenti via API a basso costo | Vale la pena provarlo | Artificial Analysis indica $0.435 per 1 milione di token in input e $0.87 per 1 milione di token in output, con un punteggio di 46 nell'Intelligence Index. |
| Pesi aperti e input multimodale | Inseriscilo nella shortlist | Xiaomi e le pagine indipendenti dedicate al modello indicano il supporto per input testuali, immagini, audio/voce e video, oltre a una finestra di contesto da 1 milione di token. |
| Un'installazione locale semplice | Non partire da qui | L'esempio di serving di OpenLM utilizza tensor parallelism a 16 vie, expert parallelism e due nodi per SGLang. |
| Le attività più complesse su terminale o sicurezza | Prova il tuo carico di lavoro | I risultati pubblicati mostrano MiMo in vantaggio in alcuni test per agenti, ma indietro su Terminal Bench 4.0 ed ExploitBench. |
| Agenti autonomi in esecuzione prolungata già oggi | Usalo in un pilota monitorato | I primi utenti hanno segnalato blocchi, risposte prolisse e azioni ritardate; le evidenze pubbliche risalgono ancora soltanto a poche ore dopo il lancio. |
La pagina del modello su Artificial Analysis indipendente registra un punteggio di 46, una velocità in output di circa 129.7 token al secondo e un costo stimato di $0.13 per attività nell'Intelligence Index. Sono parametri utili per un confronto, non una garanzia per i tuoi prompt o per il provider che sceglierai.
Cosa ha pubblicato Xiaomi il 21 settembre 2026
Il comunicato ufficiale di Xiaomi su MiMo-V2.6 descrive una famiglia di modelli, non un singolo checkpoint. MiMo-V2.6-Pro è il modello di punta; MiMo-V2.6-Flash è il fratello minore orientato all'efficienza; la release comprende inoltre un modello di distillazione da 9B basato su Qwen, destinato alla ricerca sul reinforcement learning.
Il checkpoint Pro è un modello sparse mixture-of-experts con pesi aperti. Le specifiche pubblicate parlano di circa 1.02 trilioni di parametri complessivi e 42 miliardi di parametri attivi. La lunghezza dichiarata del contesto è di 1 milione di token e il modello supporta nativamente testo, immagini, video e audio.
Artificial Analysis indica per Pro una licenza MIT e segnala che i pesi possono essere utilizzati per il self-hosting. Questo non significa però che tutte le API ospitate o le configurazioni di serving siano equivalenti: limiti del provider, dettagli implementativi e costi operativi restano questioni distinte.
La release è interessante anche per il modo in cui Xiaomi descrive l'addestramento. L'azienda afferma di aver utilizzato un processo di reinforcement learning misto per coding, agenti generalisti, attività visive e cybersecurity. Il riepilogo tecnico di OpenLM riporta le dichiarazioni di Xiaomi su 1.568 prompt per step e 16 rollout per prompt, insieme alla valutazione per gruppi e alla distillazione post-RL.
I punti di forza reali di MiMo-V2.6-Pro
MiMo-V2.6-Pro sembra dare il meglio quando il compito è agentico, più che nella programmazione puramente accademica. Nella tabella di valutazione ripresa da OpenLM, Pro ottiene 53.1 in AutomationBench, contro 50.3 per Claude Opus 5 e 45.8 per GPT-5.6 Sol. Raggiunge inoltre 89.9 in Terminal Bench 2.1, superando di poco il punteggio indicato per Claude Opus 5, pari a 89.1, e quello di GPT-5.6 Sol, pari a 88.8.
Il vantaggio, però, non è uniforme in tutti i test. Pro totalizza 71.9 in DeepSWE v1.1, meno di Claude Opus 5, a 74.0, e GPT-5.6 Sol, a 73.0. In MiMo VisualCoding arriva a 72.3: resta dietro a GPT-5.6 Sol, a 73.4, ma supera Claude Opus 5, a 70.0.
Il quadro porta a una conclusione precisa: MiMo-V2.6-Pro è un candidato interessante per l'uso di strumenti, l'automazione dei workflow, il visual coding e gli agenti software attenti ai costi. Non è corretto definirlo il modello migliore per qualsiasi attività di coding, soprattutto considerando il punteggio di 26.5 in ProgramBench, contro il 37.0 di Claude Opus 5.
Artificial Analysis aggiunge un'indicazione pratica ai benchmark più noti. La sua pagina riporta 129.7 token in output al secondo, un time to first token di 2.17 secondi e una finestra di contesto da 1 milione di token. La schermata Model Picker indica invece 134 token al secondo e un valore end-to-end di 20.8 secondi, specificando però che la versione dell'indice utilizzato non è stata registrata. Sono misurazioni legate a una determinata rilevazione, non specifiche permanenti.
I compromessi che cambiano il verdetto
Il principale campanello d'allarme riguarda la discontinuità delle prestazioni. Nella tabella di OpenLM, MiMo-V2.6-Pro ottiene 34.9 in Terminal Bench 4.0, meno di Claude Opus 5, a 49.0, GPT-5.6 Sol, a 39.9, e Claude Fable 5, a 42.4. In ExploitBench, Pro si ferma a 47.9, molto distante da Claude Opus 5, a 70.0, e GPT-5.6 Sol, a 78.5.
I risultati di cybersecurity sono particolarmente facili da interpretare troppo ottimisticamente. Pro raggiunge 94.0 in CyberGym, ma il punteggio in ExploitBench è molto più basso. Un risultato elevato in una singola suite di sicurezza non dimostra una competenza ampia nella security offensiva.
Le prime opinioni della community aggiungono aspetti operativi che le tabelle dei benchmark non riescono a mostrare. La discussione iniziale su X è ancora limitata perché il modello era stato lanciato soltanto poche ore prima. Un utente, @nilansaha, ha scritto:
“La mia unica lamentela è che è un po' troppo prolisso e impiega parecchio tempo prima di eseguire le azioni.”
Un altro utente, @benjitusk, ha riferito che “mimo-v2.6-pro si è bloccato per ben 5 minuti”. Si tratta di segnalazioni individuali e iniziali, non di un tasso di errore misurato, ma sono rilevanti se il tuo agente deve agire rapidamente senza supervisione.
Un altro utente ancora, @luislucatero21, ha riferito che un test con un SVG di un pellicano è costato $0.05 e ha richiesto 6 minuti e 9 secondi con MiMo-V2.6-Pro, contro $1.20 e 14 minuti per Grok 4.7 nella configurazione utilizzata dall'utente. È un'indicazione interessante su costi e tempi, non un benchmark controllato.
Prezzi e deployment: prima l'API, poi il locale
| Voce API di MiMo-V2.6-Pro | Prezzo indicato |
|---|---|
| Input con cache hit | $0.0036 per 1 milione di token |
| Input con cache miss | $0.435 per 1 milione di token |
| Output | $0.87 per 1 milione di token |
| Stima per attività di Artificial Analysis | $0.13 per attività |
I prezzi per token provengono dal confronto tecnico sui prezzi pubblicato nell'analisi della release di Brocker, mentre Artificial Analysis indica gli stessi valori standard, circa $0.435/$0.87, e uno sconto del 99% per gli input serviti dalla cache. La policy della cache, il conteggio dei token di ragionamento e il provider effettivamente utilizzato possono modificare il conto finale.
Lo scenario locale è più impegnativo. Le note di deployment di OpenLM mostrano un esempio SGLang con --tp 16, --dp 2, --ep 16, una configurazione su due nodi e un massimo di 128 richieste in esecuzione. L'esempio per vLLM utilizza un tensor parallelism pari a 8 e un'occupazione della memoria GPU del 95%. Sono comandi che dimostrano la fattibilità del self-hosting, ma non descrivono certo una configurazione leggera per utenti consumer.
Per la maggior parte dei team, l'ordine più sensato è: prima un pilota via API, poi la decisione sull'infrastruttura. Prima di acquistare hardware per un modello sparse da 1.02T di parametri, misura il completamento corretto delle attività, il ritardo nelle chiamate agli strumenti, la lunghezza delle risposte, i retry e il costo totale dei token.
Chi dovrebbe usare MiMo-V2.6-Pro oggi
Scegli MiMo-V2.6-Pro per un pilota via API se il tuo carico di lavoro beneficia di pesi aperti, input multimodale, contesto esteso o prezzi ridotti per l'output. È particolarmente interessante nelle applicazioni ricche di automazioni, dove il modello può essere valutato sulla capacità di completare workflow reali anziché su singoli esercizi di coding.
Punta sul self-hosting solo se gestisci già un'infrastruttura distribuita per il serving su GPU e hai bisogno di controllare pesi o deployment. La licenza MIT e i checkpoint pubblici sono un vantaggio, ma non eliminano il lavoro necessario per memoria, networking, serving e osservabilità, come dimostrano le ricette di deployment pubblicate.
Scegli un altro modello, oppure tieni pronto un fallback, quando il lavoro dipende soprattutto dagli ambienti terminali più difficili, dalle valutazioni di sicurezza offensiva o da azioni non supervisionate in cui un blocco di cinque minuti è inaccettabile. Il principale compromesso ancora irrisolto di MiMo-V2.6-Pro è evidente: l'economia sui token è molto interessante, ma il costo operativo per rendere affidabili quei risparmi potrebbe essere molto più alto di quanto lasci pensare il prezzo dell'API.
Domande frequenti su MiMo-V2.6-Pro
MiMo-V2.6-Pro è stato rilasciato ufficialmente?
Sì. L'account MiMo di Xiaomi e la documentazione ufficiale di MiMo hanno annunciato Pro e Flash il 21 settembre 2026, insieme ai pesi aperti e ai materiali di ricerca correlati.
MiMo-V2.6-Pro è open source?
È distribuito come modello open-weight e Artificial Analysis indica una licenza MIT. Prima di utilizzarlo in produzione, verifica il checkpoint specifico e i termini del provider.
Quanto è grande la finestra di contesto di MiMo-V2.6-Pro?
La specifica pubblicata indica fino a 1 milione di token. Il contesto effettivamente utilizzabile dipende dall'endpoint di serving, dalla struttura del prompt e dalla qualità del modello con contesti lunghi nel tuo caso d'uso.
MiMo-V2.6-Pro è adatto al coding?
È forte in diverse valutazioni di coding agentico e automazione, tra cui 71.9 in DeepSWE v1.1 e 53.1 in AutomationBench nella tabella pubblicata. Risulta però più debole di alcuni concorrenti proprietari in ProgramBench e Terminal Bench 4.0.
Quanto costa l'API di MiMo-V2.6-Pro?
Le tariffe standard indicate sono $0.435 per 1 milione di token in input con cache miss e $0.87 per 1 milione di token in output; l'input con cache hit è indicato a $0.0036 per 1 milione di token. Prima del lancio, verifica sempre la fatturazione aggiornata del provider.
Devo usare Pro o Flash?
Nel confronto pubblicato, Pro è la scelta con capacità superiori. Flash è presentato come il fratello più orientato all'efficienza e costa meno nella tabella prezzi di Brocker, ma per scegliere la soluzione migliore in produzione è preferibile testare latenza e riuscita delle attività sul proprio carico di lavoro, senza basarsi soltanto sui nomi dei modelli.