AIREITER

Test de MiMo-V2.6-Pro : un excellent modèle agentique, mais un déploiement coûteux

Dernière mise à jour: 2026-09-22 00:26:21

MiMo-V2.6-Pro est bien réel, public et étonnamment peu coûteux au vu de ses premiers résultats dans les benchmarks. Mais il ne remplace pas tous les modèles de pointe. Xiaomi a publié ce modèle à poids ouverts le 21 septembre 2026 ; son meilleur terrain de jeu se situe du côté de l’automatisation agentique et des usages API attentifs aux coûts. En revanche, le déploiement local et la fiabilité sur les tâches longues appellent encore une certaine prudence.

Page officielle de lancement de Xiaomi MiMo-V2.6

Test de MiMo-V2.6-Pro : le verdict en un tableau

Si vous cherchez...Notre recommandationPourquoi
Des expérimentations API agentiques à faible coûtTestez MiMo-V2.6-ProArtificial Analysis indique $0.435 par million de tokens en entrée et $0.87 par million de tokens en sortie, avec un score de 46 sur son Intelligence Index.
Des poids ouverts et des entrées multimodalesGardez-le dans votre sélectionXiaomi et les pages indépendantes consacrées au modèle mentionnent les entrées texte, image, audio/parole et vidéo, ainsi qu’un contexte de 1 million de tokens.
Une installation locale simpleNe commencez pas par làL’exemple de déploiement d’OpenLM utilise un parallélisme tensoriel sur 16 voies, du parallélisme entre experts et deux nœuds avec SGLang.
Les tâches terminal ou sécurité les plus exigeantesÉvaluez-le sur vos propres chargesLes résultats publiés montrent que MiMo devance certains concurrents sur des tests agentiques, mais reste derrière sur Terminal Bench 4.0 et ExploitBench.
Des agents autonomes actifs pendant de longues périodesLancez un pilote sous surveillanceLes premiers utilisateurs signalent des blocages, des réponses trop longues et des actions tardives ; les données publiques ne portent encore que sur les premières heures.

La fiche indépendante du modèle sur Artificial Analysis lui attribue un score de 46, une vitesse de sortie d’environ 129.7 tokens par seconde et un coût estimé de $0.13 par tâche de l’Intelligence Index. Ce sont de bons repères pour comparer les modèles, pas une garantie de résultat pour vos prompts ou votre fournisseur.

Ce que Xiaomi a lancé le 21 septembre 2026

L’annonce officielle de MiMo-V2.6 par Xiaomi présente une famille de modèles, et non un checkpoint unique. MiMo-V2.6-Pro en est le modèle phare ; MiMo-V2.6-Flash est son petit frère axé sur l’efficacité ; la gamme comprend également un modèle de distillation 9B basé sur Qwen, destiné à la recherche sur l’apprentissage par renforcement.

Le checkpoint Pro est un modèle sparse de type mixture-of-experts, distribué avec ses poids ouverts. Les spécifications publiées font état d’environ 1.02 trillion de paramètres au total, dont 42 milliards actifs. Sa fenêtre de contexte annoncée atteint 1 million de tokens, et le modèle prend nativement en charge le texte, les images, la vidéo et l’audio.

Artificial Analysis indique une licence MIT pour Pro et précise que les poids peuvent être auto-hébergés. Cela ne signifie pas pour autant que toutes les API hébergées ou configurations de serving se valent : les limites imposées par les fournisseurs, les détails d’implémentation et les coûts d’exploitation restent des sujets distincts.

La méthode d’entraînement mérite également l’attention. Xiaomi affirme avoir utilisé un processus d’apprentissage par renforcement mixte couvrant le code, les agents généralistes, les tâches visuelles et la cybersécurité. Le résumé technique d’OpenLM reprend les chiffres communiqués par Xiaomi : 1,568 prompts par étape et 16 rollouts par prompt, avec une évaluation par groupes et une distillation après l’apprentissage par renforcement.

Les domaines où MiMo-V2.6-Pro se démarque vraiment

MiMo-V2.6-Pro semble surtout à son avantage lorsque la tâche est agentique, plutôt que lorsqu’il s’agit simplement de résoudre des exercices de programmation. Dans le tableau d’évaluation repris par OpenLM, Pro obtient 53.1 sur AutomationBench, contre 50.3 pour Claude Opus 5 et 45.8 pour GPT-5.6 Sol. Il atteint également 89.9 sur Terminal Bench 2.1, juste devant Claude Opus 5 à 89.1 et GPT-5.6 Sol à 88.8.

Cette avance ne se retrouve toutefois pas dans tous les tests. Pro obtient 71.9 sur DeepSWE v1.1, contre 74.0 pour Claude Opus 5 et 73.0 pour GPT-5.6 Sol. Sur MiMo VisualCoding, il atteint 72.3, derrière GPT-5.6 Sol à 73.4, mais devant Claude Opus 5 à 70.0.

Le constat invite à une recommandation ciblée : MiMo-V2.6-Pro mérite d’être évalué pour l’utilisation d’outils, l’automatisation de workflows, le coding visuel et les agents logiciels attentifs aux coûts. En revanche, il serait abusif d’en faire le meilleur modèle pour toutes les tâches de programmation, puisque son score publié sur ProgramBench est de 26.5, contre 37.0 pour Claude Opus 5.

Artificial Analysis apporte aussi des éléments pratiques qui dépassent les scores de benchmark. Sa fiche indique une vitesse de sortie de 129.7 tokens par seconde, un délai avant le premier token de 2.17 secondes et une fenêtre de contexte de 1 million de tokens. L’instantané de son Model Picker affiche 134 tokens par seconde et une durée de bout en bout de 20.8 secondes, tout en précisant que la version de l’index utilisée n’a pas été enregistrée. Considérez donc ces chiffres comme des mesures datées, et non comme des caractéristiques immuables.

Les compromis qui peuvent changer le verdict

Le principal avertissement concerne la régularité des performances. Dans le tableau d’OpenLM, MiMo-V2.6-Pro obtient 34.9 sur Terminal Bench 4.0, derrière Claude Opus 5 à 49.0, GPT-5.6 Sol à 39.9 et Claude Fable 5 à 42.4. Sur ExploitBench, Pro atteint 47.9, très loin derrière Claude Opus 5 à 70.0 et GPT-5.6 Sol à 78.5.

Les résultats en cybersécurité sont particulièrement faciles à surinterpréter. Pro obtient 94.0 sur CyberGym, mais son score sur ExploitBench est nettement inférieur. Un excellent résultat sur une suite de sécurité ne suffit pas à démontrer une capacité générale en sécurité offensive.

Les premiers retours de la communauté ajoutent des réserves opérationnelles que les tableaux de benchmarks ne permettent pas de voir. La discussion initiale sur X reste limitée, puisque le modèle venait tout juste d’être lancé. Un utilisateur, @nilansaha, a écrit :

« My only complain is its a bit too chatty and takes a good while to take actions. »

Un autre utilisateur, @benjitusk, a signalé que « mimo-v2.6-pro froze for a good 5 mins. » Il s’agit de témoignages individuels recueillis très tôt, pas d’un taux d’échec mesuré. Ils restent néanmoins importants si votre agent doit agir rapidement sans supervision.

De son côté, @luislucatero21 rapporte qu’un test de SVG Pelican lui a coûté $0.05 et a duré 6 minutes 9 secondes avec MiMo-V2.6-Pro, contre $1.20 et 14 minutes pour Grok 4.7 dans sa configuration. C’est une anecdote intéressante sur le coût et la durée, mais pas un benchmark contrôlé.

Tarifs et déploiement : commencez par l’API, pas par le serveur

Élément de l’API MiMo-V2.6-ProTarif indiqué
Entrée avec cache$0.0036 par million de tokens
Entrée sans cache$0.435 par million de tokens
Sortie$0.87 par million de tokens
Estimation Artificial Analysis par tâche$0.13 par tâche

Les tarifs au token proviennent de la comparaison technique publiée dans l’analyse du lancement par Brocker. Artificial Analysis indique de son côté les mêmes tarifs standards, environ $0.435/$0.87, ainsi qu’une remise de 99 % sur les tokens lus depuis le cache. La politique de cache, le calcul des tokens de raisonnement et le fournisseur retenu peuvent modifier la facture finale.

En local, la situation est bien plus exigeante. Les notes de déploiement d’OpenLM montrent un exemple SGLang avec --tp 16, --dp 2, --ep 16, une configuration sur deux nœuds et un maximum de 128 requêtes simultanées. L’exemple vLLM utilise un parallélisme tensoriel de 8 et une utilisation de la mémoire GPU fixée à 95 %. Ces commandes prouvent que l’auto-hébergement est possible, mais certainement pas qu’il s’agit d’une installation légère pour le grand public.

Pour la plupart des équipes, l’ordre le plus raisonnable est simple : pilote API d’abord, décision d’infrastructure ensuite. Mesurez le taux de réussite des tâches, le délai des appels d’outils, la longueur des réponses, les nouvelles tentatives et le coût total en tokens avant d’acheter du matériel pour un modèle sparse de 1.02T paramètres.

À qui recommander MiMo-V2.6-Pro aujourd’hui ?

Lancez un pilote API avec MiMo-V2.6-Pro si votre charge de travail tire parti de poids ouverts, d’entrées multimodales, d’un contexte long ou de tarifs de sortie réduits. Le modèle est particulièrement séduisant pour les applications fortement automatisées, où l’on juge un modèle sur des workflows menés à bien plutôt que sur des énigmes de code isolées.

L’auto-hébergement ne se justifie que si vous exploitez déjà une infrastructure de serving GPU distribuée et avez besoin de contrôler les poids ou le déploiement. La licence MIT et les checkpoints publics facilitent le projet, mais ils ne suppriment ni les contraintes de mémoire et de réseau, ni le travail de serving et d’observabilité illustré par les recettes de déploiement publiées.

Préférez un autre modèle — ou prévoyez un modèle de secours — si vos tâches reposent sur les environnements terminal les plus difficiles, l’évaluation de la sécurité offensive ou des actions sans supervision pour lesquelles un blocage de cinq minutes est rédhibitoire. Le principal compromis encore à résoudre est limpide : les économies sur les tokens sont très intéressantes, mais le coût opérationnel nécessaire pour les rendre fiables peut largement dépasser ce que laisse penser le prix de l’API.

FAQ sur MiMo-V2.6-Pro

MiMo-V2.6-Pro est-il officiellement disponible ?

Oui. Le compte MiMo de Xiaomi et la documentation officielle de MiMo ont annoncé Pro et Flash le 21 septembre 2026, avec des poids ouverts et des documents de recherche associés.

MiMo-V2.6-Pro est-il open source ?

Il est distribué comme un modèle à poids ouverts, et Artificial Analysis indique une licence MIT. Vérifiez néanmoins les conditions du checkpoint et du fournisseur retenus avant tout déploiement commercial.

Quelle est la fenêtre de contexte de MiMo-V2.6-Pro ?

La spécification publiée annonce jusqu’à 1 million de tokens. Le contexte réellement exploitable dépend de l’endpoint de serving, de la structure du prompt et de la qualité du modèle sur les tâches utilisant un contexte long.

MiMo-V2.6-Pro est-il bon en programmation ?

Il se montre performant dans plusieurs évaluations de programmation et d’automatisation agentiques, notamment avec 71.9 sur DeepSWE v1.1 et 53.1 sur AutomationBench dans le tableau publié. Il est moins à l’aise que certains concurrents fermés sur ProgramBench et Terminal Bench 4.0.

Quel est le prix de l’API MiMo-V2.6-Pro ?

Les tarifs standards indiqués sont de $0.435 par million de tokens d’entrée sans cache et de $0.87 par million de tokens en sortie. L’entrée avec cache est affichée à $0.0036 par million de tokens. Vérifiez les tarifs actuels de votre fournisseur avant le lancement.

Faut-il choisir Pro ou Flash ?

Pro est le modèle le plus capable dans la comparaison publiée. Flash est présenté comme son équivalent davantage axé sur l’efficacité et coûte moins cher dans le tableau tarifaire de Brocker. Testez toutefois la latence et le taux de réussite sur vos propres tâches : les noms des modèles ne suffisent pas à déterminer lequel sera le meilleur en production.