AIREITER

Test de MAI-Thinking-1 : le premier modèle de raisonnement de Microsoft (2026)

Dernière mise à jour: 2026-08-13 07:39:55

Microsoft a mis MAI-Thinking-1 en préversion publique dans Microsoft Foundry le 12 août 2026. C'est son premier modèle de raisonnement développé intégralement en interne : un MoE sparse de 35B de paramètres actifs pour environ 1T au total, avec une fenêtre de contexte de 256K. La promesse est séduisante — des performances compétitives en mathématiques et en code pour une empreinte d'inférence nettement plus réduite — mais les résultats demandent à être nuancés. Le modèle talonne Claude Opus 4.6 sur SWE-Bench Pro (52,8 % contre 53,4 %), tout en restant loin derrière sur Terminal-Bench 2.0 (46,0 % contre 75,1 % pour GPT-5.4). Et malgré des promesses répétées de « mid-weight price », Microsoft n'a toujours publié aucun tarif au token.

MAI-Thinking-1 : ce qu'il faut savoir

MAI-Thinking-1 est un modèle de raisonnement Mixture-of-Experts sparse, conçu entièrement en interne par Microsoft AI. Il compte 35 milliards de paramètres actifs sur environ 1 000 milliards au total. Plus précisément, le rapport technique indique 34,7B de paramètres actifs et 962B au total pour le modèle de base, répartis sur 78 couches ; 8 experts parmi 512 sont sélectionnés pour chaque token routé. Sa fenêtre de contexte atteint 256 000 tokens, soit environ 600 pages de texte, un ordre de grandeur comparable à Claude Sonnet 4.6 et GPT-5.4.

Côté API, MAI-Thinking-1 prend en charge le très répandu format Chat Completions API, ainsi que le function calling, les instructions développeur et les sorties structurées. Un code existant ciblant les endpoints de chat d'OpenAI peut donc être adapté avec peu de modifications. Il s'agit d'un modèle uniquement textuel : ni entrée ni sortie image, audio ou vidéo. Microsoft réserve MAI-Image 2.5 et MAI-Voice 2 à ces autres modalités.

La principale différence mise en avant par Microsoft tient à l'entraînement. Le rapport technique décrit 30T de tokens de pré-entraînement, issus de données humaines publiques et sous licence commerciale, puis 3,55T de tokens de mid-training. L'entraînement a mobilisé 8 000 GPU GB200, puis 4 600 GB300 lors de la phase RL. Microsoft affirme avoir entraîné le modèle sans distillation depuis des modèles tiers, en excluant notamment les données synthétiques générées par les modèles d'autres laboratoires.

Le modèle a été annoncé pour la première fois lors de Microsoft Build, le 2 juin 2026, au sein d'une famille MAI de sept modèles. Il est resté en préversion privée jusqu'au 12 août 2026.

Benchmarks : son vrai niveau face à la concurrence

Le rapport technique de Microsoft fournit l'image la plus complète de ses performances. Tous les résultats de MAI-Thinking-1 correspondent à la moyenne de quatre exécutions avec une température de 1, un top-p de 0,97 et une longueur de contexte totale de 256K pour les tests de code agentique. Les chiffres des concurrents proviennent de leurs fiches modèles officielles respectives, et non de reproductions indépendantes.

BenchmarkMAI-Thinking-1Sonnet 4.6Opus 4.6GPT-5.4Kimi K2.6DeepSeek V4GLM-5.1
AIME 202597,095,699,8————
AIME 202694,5———96,4—95,3
GPQA Diamond84,289,991,392,890,590,185,2
LiveCodeBench v687,7———89,693,5—
SWE-Bench Verified73,579,680,8—80,280,6—
SWE-Bench Pro52,8—53,457,758,655,458,4
Terminal-Bench 2.046,059,165,475,166,767,969,0

La tendance est nette. En mathématiques pures, MAI-Thinking-1 est solide : ses 97,0 % sur AIME 2025 dépassent les 95,6 % de Sonnet 4.6, même s'ils restent sous les 99,8 % d'Opus 4.6. Sur AIME 2026, avec 94,5 %, il se place derrière Kimi K2.6 (96,4 %) comme GLM-5.1 (95,3 %).

L'écart se creuse en code agentique. Le score de 52,8 % sur SWE-Bench Pro est proche des 53,4 % d'Opus 4.6, la comparaison spécifiquement soulignée par Microsoft. Mais GPT-5.4 (57,7 %), Kimi K2.6 (58,6 %), DeepSeek V4 (55,4 %) et GLM-5.1 (58,4 %) font tous mieux. Sur Terminal-Bench 2.0, qui mesure les performances d'agents en terminal sur des tâches à étapes multiples, les 46,0 % de MAI-Thinking-1 le placent à 13 points de Sonnet 4.6 (59,1 %) et à 29 points de GPT-5.4 (75,1 %).

Le rapport technique reconnaît lui-même que le modèle « does not lead the field ». MAI-Thinking-1 est compétitif au regard de son empreinte de 35B de paramètres actifs, pas au sommet du classement général.

Le rapport technique apporte aussi les résultats suivants, comparés à Sonnet 4.6 :

DomaineMAI-Thinking-1Sonnet 4.6
MMLU-Pro8587
SimpleQA Verified3129
BFCL v3 (appel d'outils)7276
CyberSecEval Instruct6362
GraphWalks (≤128K)9096

Le test de préférence face à Sonnet 4.6

Le résultat le plus mis en avant par Microsoft provient d'une évaluation humaine comparative à l'aveugle, menée avec les évaluateurs professionnels de Surge sur 1 276 tâches, dont 30 % en multi-tour. Le rapport technique donne les chiffres précis absents du billet de lancement :

Face à Claude Sonnet 4.6 :

  • Victoires de MAI-Thinking-1 : 49 %, égalités : 6 %, défaites : 45 %
  • Écart de préférence global : +0,07 ± 0,06
  • Avantages les plus marqués : concision/pertinence (+0,11 ± 0,02) et style/ton (+0,08 ± 0,02)
  • Égalité statistique sur le suivi des instructions, l'exactitude factuelle et l'exhaustivité

Face à Claude Opus 4.6 :

  • Victoires de MAI-Thinking-1 : 43 %, égalités : 5 %, défaites : 52 %
  • Écart de préférence global : -0,07 ± 0,06

Dans l'ensemble, la comparaison avec Sonnet franchit le seuil du modèle « préféré », mais une marge de +0,07 avec un intervalle de confiance de ±0,06 indique un avantage réel, quoique mince. Face à Opus, le résultat est clairement défavorable. Les tâches évaluées sont surtout orientées vers les questions-réponses ouvertes, la rédaction de contenu et la synthèse ; elles ne reflètent donc pas les charges lourdes de code ou de raisonnement multi-étapes, précisément là où les benchmarks de MAI-Thinking-1 sont les moins flatteurs.

Sur Reddit, les utilisateurs de r/LocalLLaMA s'interrogent sur le fait que MAI-Thinking-1 puisse prendre la relève de la gamme Phi de Microsoft, tout en soulignant que cette famille n'est pas proposée en poids ouverts. Le contexte stratégique compte : selon des informations rapportées par Bloomberg, Microsoft a commencé à remplacer des modèles d'OpenAI et d'Anthropic par des modèles MAI dans Excel et Outlook. La valeur principale de MAI-Thinking-1 pourrait donc être la maîtrise des coûts dans les propres produits de Microsoft.

Tarifs et accès : ce qui manque encore

MAI-Thinking-1 n'a pas de tarif public au token. Microsoft emploie des formules qualitatives — « mid-weight price », « cost-efficient », « smaller inference footprint » — sans donner le moindre montant en dollars, que ce soit dans l'annonce, la page du modèle ou le rapport technique. C'est aujourd'hui le principal frein à son évaluation pour un usage en production.

Pour situer le marché, voici les tarifs de modèles de raisonnement comparables (tarifs OpenAI, tarifs Google AI) :

ModèleEntrée ($/1M tokens)Sortie ($/1M tokens)
OpenAI o3~$10~$40
Gemini 2.5 Pro~$1.25~$10
Claude Sonnet 4.6*~$3~$15

\*Le tarif de Claude varie selon l'offre ; estimation intermédiaire issue des tarifs Anthropic.

Le positionnement « mid-weight » de Microsoft laisse penser que MAI-Thinking-1 pourrait se situer entre Gemini 2.5 Pro et Claude Sonnet en coût. Sans grille tarifaire publiée, établir un budget reste toutefois purement spéculatif.

Pour l'accès, MAI-Thinking-1 est disponible en préversion publique via Microsoft Foundry ; un lien vers le playground figure sur la page du modèle. L'annonce de juin citait OpenRouter, Fireworks AI et Baseten parmi les futurs partenaires de distribution, mais aucun n'est opérationnel à la date de ce test. Le modèle reste propriétaire : aucune publication sur Hugging Face, aucun GGUF et aucune solution d'auto-hébergement ne sont proposés.

MAI-Thinking-1 model page on Microsoft AI

Pour utiliser MAI-Thinking-1 dès aujourd'hui :

  1. Connectez-vous à Microsoft Foundry avec un compte Azure
  2. Ouvrez la page du modèle MAI-Thinking-1 dans Foundry
  3. Utilisez le playground pour vos essais, ou déployez le modèle via l'endpoint compatible Chat Completions
  4. La facturation passe par l'abonnement Azure ; les tarifs restent non divulgués pendant la préversion

À qui MAI-Thinking-1 convient dès maintenant

MAI-Thinking-1 a du sens pour :

  • Les équipes déjà standardisées sur Azure ou Microsoft Foundry, qui recherchent un modèle de raisonnement first-party avec des contrôles de gouvernance d'entreprise
  • Les usages dominés par les mathématiques, le raisonnement formel ou les problèmes de type compétition : le score de 97 % sur AIME 2025 est bien réel
  • Les organisations ayant besoin d'une traçabilité claire des données pour des raisons de conformité : l'affirmation de Microsoft sur l'absence de distillation et l'usage de données sous licence compte dans les secteurs régulés
  • Les équipes effectuant de la revue de code et de l'analyse, pour lesquelles l'avantage de concision relevé dans l'évaluation humaine est utile

Mieux vaut attendre si vous avez besoin de :

  • Fonctions multimodales en entrée ou en sortie : le modèle est uniquement textuel
  • Tâches agentiques de longue durée : 46 % sur Terminal-Bench 2.0 est rédhibitoire pour l'automatisation en terminal
  • Auto-hébergement ou poids ouverts : le modèle est propriétaire et verrouillé dans Foundry
  • Coûts de production prévisibles : sans prix, impossible de budgéter
  • Performances de tout premier plan pour les agents de code : Kimi K2.6, GPT-5.4 et DeepSeek V4 font tous mieux sur SWE-Bench Pro et Verified

FAQ

MAI-Thinking-1 est-il open source ?

Non. Le modèle est propriétaire et ses poids sont fermés. Il n'existe ni poids téléchargeables, ni version Hugging Face, ni possibilité d'auto-hébergement. L'accès passe exclusivement par Microsoft Foundry.

MAI-Thinking-1 alimente-t-il Copilot ?

Selon des informations rapportées par Bloomberg, Microsoft a commencé à remplacer des modèles d'OpenAI et d'Anthropic par des modèles MAI dans Excel et Outlook. En revanche, rien ne confirme que MAI-Thinking-1 soit le modèle utilisé par GitHub Copilot ou Microsoft 365 Copilot pour les utilisateurs finaux.

MAI-Thinking-1 succède-t-il à Microsoft Phi ?

Microsoft ne le présente pas ainsi, mais la communauté y voit un changement de cap. Phi était la famille de petits modèles à poids ouverts de Microsoft. MAI est sa nouvelle famille propriétaire. La différence essentielle est que MAI-Thinking-1 est fermé et plus grand — 35B de paramètres actifs contre 3-14B pour Phi — et vise le déploiement en entreprise plutôt qu'une exécution locale.

MAI-Thinking-1 prend-il en charge les images, l'audio ou la vidéo ?

Non. Les entrées comme les sorties sont exclusivement textuelles. Microsoft propose séparément MAI-Image 2.5 (texte vers image), MAI-Transcribe-1.5 (parole vers texte) et MAI-Voice-2 (génération vocale) pour les autres modalités.

Quelle est la date limite des données d'entraînement de MAI-Thinking-1 ?

La fiche du modèle indique une date limite d'entraînement en juillet 2025, mais le rapport technique précise que la collecte des sources s'est poursuivie jusqu'au début de 2026 : HTML web jusqu'en septembre 2025, PDF web jusqu'en décembre 2025, livres et revues jusqu'en mars 2026. Cette divergence suggère que la date limite désigne l'arrêt de la collecte de données de post-entraînement, et non la date de collecte de l'ensemble des sources.

Puis-je utiliser MAI-Thinking-1 via OpenRouter ?

Pas encore. Microsoft a cité OpenRouter, Fireworks AI et Baseten comme futurs partenaires de distribution lors du lancement du 2 juin, mais aucun n'était opérationnel en août 2026. Le seul accès actuellement disponible est la préversion publique de Microsoft Foundry.

Votre usageMeilleur choix aujourd'hui
Mathématiques de compétition, preuves formellesMAI-Thinking-1 (97 % AIME) ou Claude Opus 4.6 (99,8 %)
Code agentique, automatisation en terminalGPT-5.4 (75,1 % Terminal-Bench) ou Kimi K2.6 (66,7 %)
Revue de code, détection de bugsClaude Sonnet 4.6 (79,6 % SWE-Verified) ou Opus 4.6 (80,8 %)
Raisonnement d'entreprise natif AzureMAI-Thinking-1 (first-party, gouvernance Foundry)
Production avec budget serréGemini 2.5 Pro ($1.25/$10)
Auto-hébergement ou poids ouvertsIndisponible avec MAI ; envisagez les poids ouverts de DeepSeek V4 ou de Qwen3.8