Mit MAI-Thinking-1 bringt Microsoft sein erstes vollständig intern entwickeltes Reasoning-Modell in die öffentliche Vorschau. Seit dem 12. August 2026 ist das 35B-aktive / ~1T-Parameter starke Sparse-MoE mit 256K Kontextfenster über Microsoft Foundry verfügbar. Microsoft wirbt mit konkurrenzfähiger Mathe- und Coding-Leistung bei deutlich geringerem Inference-Footprint. Die Benchmark-Werte zeichnen allerdings ein differenzierteres Bild: Bei SWE-Bench Pro liegt es mit 52.8 % fast gleichauf mit Claude Opus 4.6 (53.4 %), bei Terminal-Bench 2.0 fällt es mit 46.0 % jedoch weit hinter GPT-5.4 mit 75.1 % zurück. Dazu kommt: Trotz wiederholter Versprechen eines „mid-weight price“ hat Microsoft noch keine Tokenpreise veröffentlicht.
Was hinter MAI-Thinking-1 steckt
MAI-Thinking-1 ist ein Sparse-Mixture-of-Experts-Reasoning-Modell von Microsoft AI. Von insgesamt rund 1 Billion Parametern sind 35 Milliarden Parameter aktiv. Der technische Bericht nennt für das Basismodell präzise 34.7B aktive bei 962B Gesamtparametern, 78 Layer sowie 8 ausgewählte Experten aus 512 pro geroutetem Token. Das Kontextfenster liegt bei 256.000 Tokens, was ungefähr 600 Textseiten entspricht. Damit bewegt sich das Modell in derselben Größenordnung wie Claude Sonnet 4.6 und GPT-5.4.
Für die API setzt MAI-Thinking-1 auf das verbreitete Chat Completions API format und unterstützt Function Calling, Developer Instructions sowie strukturierte Ausgaben. Anwendungen, die bereits auf OpenAIs Chat-Endpunkte zugeschnitten sind, lassen sich daher mit überschaubaren Anpassungen umstellen. Das Modell verarbeitet und erzeugt ausschließlich Text; Bild-, Audio- und Video-Ein- oder -Ausgaben gibt es nicht. Für diese Modalitäten verweist Microsoft auf separate Modelle wie MAI-Image 2.5 und MAI-Voice 2.
Als wichtigstes Alleinstellungsmerkmal stellt Microsoft den Trainingsprozess heraus. Laut technischem Bericht erhielt das Modell 30T Pre-Training-Tokens aus kommerziell lizenzierten und öffentlichen, von Menschen erzeugten Daten sowie 3.55T Mid-Training-Tokens. Trainiert wurde auf 8.000 GB200-GPUs, für die RL-Phase auf 4.600 GB300s. Nach eigenen Angaben entstand das Modell ohne Distillation durch Drittmodelle; synthetische Daten aus den Modellen anderer Labs wurden ausgeschlossen.
Vorgestellt wurde das Modell erstmals am 2. Juni 2026 auf der Microsoft Build als Teil einer MAI-Familie mit sieben Modellen. Bis zum 12. August 2026 blieb es in der Private Preview.
Benchmarks: So ordnet sich das Modell ein
Das vollständigste Benchmark-Bild liefert Microsofts eigener technischer Bericht. Alle Werte für MAI-Thinking-1 sind Mittelwerte aus vier Durchläufen mit Temperatur 1 und top-p 0.97; für die agentischen Coding-Tests kam eine Gesamtkontextlänge von 256K zum Einsatz. Die Vergleichswerte stammen aus den jeweiligen offiziellen Model Cards der Anbieter und nicht aus unabhängigen Reproduktionen.
| Benchmark | MAI-Thinking-1 | Sonnet 4.6 | Opus 4.6 | GPT-5.4 | Kimi K2.6 | DeepSeek V4 | GLM-5.1 |
|---|---|---|---|---|---|---|---|
| AIME 2025 | 97.0 | 95.6 | 99.8 | — | — | — | — |
| AIME 2026 | 94.5 | — | — | — | 96.4 | — | 95.3 |
| GPQA Diamond | 84.2 | 89.9 | 91.3 | 92.8 | 90.5 | 90.1 | 85.2 |
| LiveCodeBench v6 | 87.7 | — | — | — | 89.6 | 93.5 | — |
| SWE-Bench Verified | 73.5 | 79.6 | 80.8 | — | 80.2 | 80.6 | — |
| SWE-Bench Pro | 52.8 | — | 53.4 | 57.7 | 58.6 | 55.4 | 58.4 |
| Terminal-Bench 2.0 | 46.0 | 59.1 | 65.4 | 75.1 | 66.7 | 67.9 | 69.0 |
Das Muster ist eindeutig: Bei reiner Mathematik schneidet MAI-Thinking-1 stark ab. Die 97.0 % bei AIME 2025 übertreffen Sonnet 4.6 mit 95.6 %, bleiben aber unter den 99.8 % von Opus 4.6. Bei AIME 2026 erreicht das Modell 94.5 % und liegt damit sowohl hinter Kimi K2.6 mit 96.4 % als auch hinter GLM-5.1 mit 95.3 %.
Bei agentischem Coding wird der Abstand größer. Die 52.8 % bei SWE-Bench Pro liegen nahe an Opus 4.6 mit 53.4 % – genau diesen Vergleich hebt Microsoft hervor. GPT-5.4 (57.7 %), Kimi K2.6 (58.6 %), DeepSeek V4 (55.4 %) und GLM-5.1 (58.4 %) erzielen jedoch allesamt höhere Werte. Noch deutlicher ist Terminal-Bench 2.0, das die Leistung von Terminal-Agenten bei mehrstufigen Aufgaben misst: MAI-Thinking-1 liegt mit 46.0 % 13 Punkte hinter Sonnet 4.6 (59.1 %) und 29 Punkte hinter GPT-5.4 (75.1 %).
Der technische Bericht räumt selbst ein, dass das Modell „does not lead the field“. Für seinen Footprint von 35B aktiven Parametern ist MAI-Thinking-1 konkurrenzfähig, an der Spitze der Ranglisten spielt es aber nicht mit.
Weitere Benchmark-Daten aus dem technischen Bericht im Vergleich mit Sonnet 4.6:
| Bereich | MAI-Thinking-1 | Sonnet 4.6 |
|---|---|---|
| MMLU-Pro | 85 | 87 |
| SimpleQA Verified | 31 | 29 |
| BFCL v3 (Tool Calling) | 72 | 76 |
| CyberSecEval Instruct | 63 | 62 |
| GraphWalks (≤128K) | 90 | 96 |
Was an Microsofts Sonnet-4.6-Vergleich dran ist
Am offensivsten vermarktet Microsoft eine verblindete menschliche Side-by-Side-Evaluierung mit professionellen Bewertern von Surge. Sie umfasste 1.276 Aufgaben, davon 30 % mit mehreren Gesprächsrunden. Der technische Bericht nennt die exakten Werte, die im Launch-Blog fehlen:
Gegen Claude Sonnet 4.6:
- MAI-Thinking-1 gewinnt: 49 %, Unentschieden: 6 %, Niederlagen: 45 %
- Gesamter Präferenzabstand: +0.07 ± 0.06
- Größter Vorteil: Prägnanz/Relevanz (+0.11 ± 0.02) und Stil/Ton (+0.08 ± 0.02)
- Bei Befolgen von Anweisungen, Faktentreue und Vollständigkeit statistisch gleichauf
Gegen Claude Opus 4.6:
- MAI-Thinking-1 gewinnt: 43 %, Unentschieden: 5 %, Niederlagen: 52 %
- Gesamter Präferenzabstand: -0.07 ± 0.06
Im aggregierten Sonnet-Vergleich erreicht MAI-Thinking-1 zwar den Status „preferred“, doch der Vorsprung von +0.07 bei einem Konfidenzintervall von ±0.06 ist real, aber knapp. Gegen Opus fällt das Ergebnis eindeutig aus. Zudem konzentrieren sich die Aufgaben auf offene Fragen, Content-Erstellung und Zusammenfassungen – nicht auf schweres Coding oder mehrstufige Reasoning-Workloads, bei denen MAI-Thinking-1 in den Benchmarks am schwächsten ist.
Auf Reddit diskutieren Nutzer in r/LocalLLaMA darüber, ob MAI-Thinking-1 die Phi-Reihe von Microsoft faktisch ablöst. Dabei verweisen sie darauf, dass die Familie keine offenen Gewichte bietet. Der strategische Kontext ist relevant: Laut Berichten von Bloomberg hat Microsoft begonnen, OpenAI- und Anthropic-Modelle in Excel und Outlook durch MAI-Modelle zu ersetzen. Der eigentliche Wert von MAI-Thinking-1 könnte für Microsoft also vor allem in der Kostenkontrolle für die eigenen Produkte liegen.
Preise und Zugang: Der aktuelle Stand
Öffentliche Tokenpreise für MAI-Thinking-1 gibt es nicht. Microsoft bleibt bei qualitativen Aussagen wie „mid-weight price“, „cost-efficient“ und „smaller inference footprint“. Weder in der Ankündigung, auf der Modellseite noch im technischen Bericht findet sich ein einziger Dollarbetrag. Für Teams, die einen Produktionseinsatz bewerten wollen, ist das derzeit das größte Hindernis.
Zum Vergleich: Diese Preise verlangen ähnliche Reasoning-Modelle (OpenAI pricing, Google AI pricing):
| Modell | Input ($/1M Tokens) | Output ($/1M Tokens) |
|---|---|---|
| OpenAI o3 | ~$10 | ~$40 |
| Gemini 2.5 Pro | ~$1.25 | ~$10 |
| Claude Sonnet 4.6* | ~$3 | ~$15 |
\*Die Claude-Preise variieren je nach Tarif; ungefährer Mittelwert laut Anthropic pricing.
Die Positionierung als „mid-weight“ deutet darauf hin, dass MAI-Thinking-1 preislich wahrscheinlich zwischen Gemini 2.5 Pro und Claude Sonnet liegen wird. Solange Microsoft keinen Tarif veröffentlicht, bleibt jede Kostenplanung jedoch Spekulation.
Beim Zugang gilt: MAI-Thinking-1 ist als Public Preview über Microsoft Foundry verfügbar; auf der Modellseite ist ein Link zum Playground hinterlegt. In der Juni-Ankündigung nannte Microsoft OpenRouter, Fireworks AI und Baseten als geplante Distributionspartner, doch zum Zeitpunkt dieses Tests ist keiner davon live. Das Modell ist Closed-Weight: Es gibt keinen Release auf Hugging Face, kein GGUF und keine Möglichkeit zum Self-Hosting.
So lässt sich MAI-Thinking-1 derzeit nutzen:
- Mit einem Azure-Konto bei Microsoft Foundry anmelden
- Innerhalb von Foundry die Modellseite von MAI-Thinking-1 öffnen
- Den Playground zum Testen nutzen oder über den Chat-Completions-kompatiblen Endpunkt bereitstellen
- Die Abrechnung läuft über das Azure-Abonnement; die Tarife bleiben während der Preview unveröffentlicht
Für wen sich MAI-Thinking-1 jetzt lohnt
Sinnvoll ist es für:
- Teams, die bereits auf Azure oder Microsoft Foundry standardisiert sind und ein First-Party-Reasoning-Modell mit Enterprise-Governance benötigen
- Workloads mit Schwerpunkt auf Mathematik, formalem Reasoning oder Aufgaben im Wettbewerbsstil – die 97 % bei AIME 2025 sind ein belastbarer Wert
- Organisationen, für die eine saubere Datenherkunft aus Compliance-Gründen wichtig ist – Microsofts Aussage „keine Distillation, lizenzierte Daten“ kann in regulierten Branchen relevant sein
- Teams für Code Reviews und Analysen, bei denen die in der menschlichen Evaluierung festgestellte Prägnanz des Modells ein Vorteil ist
Vorläufig keine gute Wahl, wenn benötigt werden:
- Multimodale Ein- und Ausgaben – das Modell arbeitet nur mit Text
- Agentische Langläufer-Aufgaben – 46 % bei Terminal-Bench 2.0 sind für Terminal-Automatisierung ein Ausschlusskriterium
- Self-Hosting oder offene Gewichte – das Modell ist proprietär und an Foundry gebunden
- Planbare Produktionskosten – ohne Preisangaben ist kein Budget möglich
- Leistung auf Spitzenniveau für Coding-Agenten – Kimi K2.6, GPT-5.4 und DeepSeek V4 schneiden bei SWE-Bench Pro und Verified jeweils besser ab
FAQ
Ist MAI-Thinking-1 Open Source?
Nein. Das Modell ist proprietär und Closed-Weight. Es gibt keine herunterladbaren Gewichte, keinen Hugging-Face-Release und keine Option zum Self-Hosting. Der Zugang erfolgt ausschließlich über Microsoft Foundry.
Betreibt MAI-Thinking-1 Copilot?
Microsoft hat laut Berichten von Bloomberg damit begonnen, OpenAI- und Anthropic-Modelle in Excel und Outlook durch MAI-Modelle zu ersetzen. Es ist jedoch nicht bestätigt, dass MAI-Thinking-1 für GitHub Copilot oder Microsoft 365 Copilot für Endnutzer eingesetzt wird.
Ist MAI-Thinking-1 der Nachfolger von Microsoft Phi?
Microsoft positioniert es nicht so, in der Community wird es aber als Richtungswechsel verstanden. Phi war Microsofts Small-Model-Familie mit offenen Gewichten. MAI ist die neue proprietäre Modellfamilie. Der entscheidende Unterschied: MAI-Thinking-1 ist geschlossen und größer – 35B aktive Parameter gegenüber 3–14B bei Phi – und zielt auf Enterprise-Deployment statt auf die lokale Ausführung.
Unterstützt MAI-Thinking-1 Bilder, Audio oder Video?
Nein. Das Modell akzeptiert und erzeugt ausschließlich Text. Für andere Modalitäten bietet Microsoft separate Modelle an: MAI-Image 2.5 für Text-zu-Bild, MAI-Transcribe-1.5 für Speech-to-Text und MAI-Voice-2 für Sprachgenerierung.
Was ist der Daten-Cutoff von MAI-Thinking-1?
Die Model Card nennt Juli 2025 als Trainings-Cutoff. Der technische Bericht weist jedoch darauf hin, dass die Quellensammlung bis Anfang 2026 reichte: Web-HTML bis September 2025, Web-PDFs bis Dezember 2025 sowie Bücher und Journals bis März 2026. Diese Abweichung legt nahe, dass sich der Cutoff auf das Ende der Datensammlung nach dem Training bezieht, nicht auf den Zeitpunkt, bis zu dem sämtliche Quellen gesammelt wurden.
Kann ich MAI-Thinking-1 über OpenRouter nutzen?
Noch nicht. Microsoft nannte OpenRouter, Fireworks AI und Baseten beim Launch am 2. Juni als geplante Distributionspartner, doch im August 2026 ist keiner davon live. Derzeit führt der einzige Zugangsweg über die Public Preview von Microsoft Foundry.
| Ihr Workload | Heute die bessere Wahl |
|---|---|
| Wettbewerbsmathematik, formale Beweise | MAI-Thinking-1 (97 % AIME) oder Claude Opus 4.6 (99.8 %) |
| Agentisches Coding, Terminal-Automatisierung | GPT-5.4 (75.1 % Terminal-Bench) oder Kimi K2.6 (66.7 %) |
| Code Review, Bug-Erkennung | Claude Sonnet 4.6 (79.6 % SWE-Verified) oder Opus 4.6 (80.8 %) |
| Enterprise-Reasoning nativ auf Azure | MAI-Thinking-1 (First-Party, Foundry-Governance) |
| Produktivbetrieb mit knappem Budget | Gemini 2.5 Pro ($1.25/$10) |
| Self-Hosting oder offene Gewichte | Bei MAI nicht verfügbar; als offene Gewichte kommen DeepSeek V4 oder Qwen3.8 infrage |