Microsoft'un sıfırdan geliştirdiği ilk akıl yürütme modeli MAI-Thinking-1, 12 Ağustos 2026'da Microsoft Foundry'de herkese açık önizlemeye çıktı. 35B aktif / yaklaşık 1T toplam parametreli seyrek bir MoE mimarisi kullanan modelin bağlam penceresi 256K token. Microsoft'un ana vaadi, daha düşük çıkarım yüküyle rekabetçi matematik ve kodlama performansı sunmak. Ancak sonuçlar daha dengeli okunmalı: SWE-Bench Pro'da Claude Opus 4.6'ya oldukça yaklaşıyor (%52,8'e karşı %53,4), buna karşın Terminal-Bench 2.0'da GPT-5.4'ün hayli gerisinde kalıyor (%46,0'a karşı %75,1). Üstelik Microsoft, model için tekrarladığı “orta ölçekli model fiyatı” söylemine rağmen token başına fiyat açıklamış değil.
MAI-Thinking-1 tam olarak ne sunuyor?
MAI-Thinking-1, Microsoft AI bünyesinde tamamen şirket içinde geliştirilen, yaklaşık 1 trilyon toplam parametrenin 35 milyarını aktif kullanan seyrek Mixture-of-Experts akıl yürütme modeli. Teknik raporda temel model için 34,7B aktif ve 962B toplam parametre belirtiliyor. Model 78 katmandan oluşuyor; yönlendirilen her token için 512 uzmandan 8'i seçiliyor. 256.000 tokenlık bağlam penceresi, kabaca 600 sayfa metne karşılık geliyor ve Claude Sonnet 4.6 ile GPT-5.4 seviyesinde yer alıyor.
API tarafında MAI-Thinking-1; yaygın kullanılan Chat Completions API formatını, function calling'i, geliştirici talimatlarını ve yapılandırılmış çıktıyı destekliyor. Dolayısıyla OpenAI'nin sohbet uç noktalarına göre yazılmış mevcut kodları sınırlı değişiklikle uyarlamak mümkün. Model yalnızca metinle çalışıyor; görüntü, ses ya da video girişi ve çıktısı yok. Microsoft bu ihtiyaçlar için MAI-Image 2.5 ve MAI-Voice 2'yi ayrı modeller olarak konumlandırıyor.
Microsoft'un öne çıkardığı temel fark eğitim süreci. Teknik makaleye göre model, ticari lisanslı ve kamuya açık, insanlar tarafından üretilmiş verilerden oluşan 30T ön eğitim tokenı ile eğitildi. Buna 3,55T orta eğitim tokenı da ekleniyor. Eğitim 8.000 GB200 GPU üzerinde yürütüldü; RL aşamasında ise 4.600 GB300 kullanıldı. Microsoft, başka laboratuvarların modellerinin ürettiği sentetik verileri dışarıda bırakarak modeli üçüncü taraf model distilasyonu olmadan eğittiğini söylüyor.
Model ilk kez 2 Haziran 2026'da Microsoft Build kapsamında, yedi modelden oluşan MAI ailesinin parçası olarak duyuruldu. 12 Ağustos 2026'ya kadar özel önizlemede kaldı.
Benchmark sonuçları: Rekabetteki gerçek konumu
En kapsamlı benchmark görünümü Microsoft'un teknik makalesinden geliyor. MAI-Thinking-1 sonuçlarının tamamı; temperature 1, top-p 0,97 ayarlarıyla yapılan dört çalıştırmanın ortalaması. Agentic coding testlerinde toplam bağlam uzunluğu 256K olarak kullanılmış. Rakip modellere ait değerler bağımsız tekrar testlerden değil, ilgili modellerin resmi model kartlarından alınmış.
| Benchmark | MAI-Thinking-1 | Sonnet 4.6 | Opus 4.6 | GPT-5.4 | Kimi K2.6 | DeepSeek V4 | GLM-5.1 |
|---|---|---|---|---|---|---|---|
| AIME 2025 | 97,0 | 95,6 | 99,8 | — | — | — | — |
| AIME 2026 | 94,5 | — | — | — | 96,4 | — | 95,3 |
| GPQA Diamond | 84,2 | 89,9 | 91,3 | 92,8 | 90,5 | 90,1 | 85,2 |
| LiveCodeBench v6 | 87,7 | — | — | — | 89,6 | 93,5 | — |
| SWE-Bench Verified | 73,5 | 79,6 | 80,8 | — | 80,2 | 80,6 | — |
| SWE-Bench Pro | 52,8 | — | 53,4 | 57,7 | 58,6 | 55,4 | 58,4 |
| Terminal-Bench 2.0 | 46,0 | 59,1 | 65,4 | 75,1 | 66,7 | 67,9 | 69,0 |
Tablo belirgin bir eğilime işaret ediyor. Saf matematikte MAI-Thinking-1 güçlü. AIME 2025'teki %97,0 skoru, Sonnet 4.6'nın %95,6'sını geçiyor; ancak Opus 4.6'nın %99,8'ine ulaşamıyor. AIME 2026'da %94,5 alan model, hem Kimi K2.6'nın (%96,4) hem de GLM-5.1'in (%95,3) gerisinde.
Agentic coding tarafında fark daha da açılıyor. Microsoft'un özellikle vurguladığı SWE-Bench Pro sonucu %52,8; bu oran Opus 4.6'nın %53,4'üne yakın. Ancak GPT-5.4 (%57,7), Kimi K2.6 (%58,6), DeepSeek V4 (%55,4) ve GLM-5.1 (%58,4) daha yüksek skor elde ediyor. Çok adımlı terminal aracısı performansını ölçen Terminal-Bench 2.0'da ise MAI-Thinking-1'in %46,0 sonucu, Sonnet 4.6'nın %59,1'inden 13 puan; GPT-5.4'ün %75,1'inden 29 puan aşağıda.
Teknik makale de modelin “alanın lideri olmadığını” kabul ediyor. MAI-Thinking-1, 35B aktif parametreli yapısı dikkate alındığında rekabetçi; liderlik tablosunun zirvesinde ise değil.
Teknik makaledeki, Sonnet 4.6 ile karşılaştırılan ek benchmark verileri şöyle:
| Alan | MAI-Thinking-1 | Sonnet 4.6 |
|---|---|---|
| MMLU-Pro | 85 | 87 |
| SimpleQA Verified | 31 | 29 |
| BFCL v3 (tool calling) | 72 | 76 |
| CyberSecEval Instruct | 63 | 62 |
| GraphWalks (≤128K) | 90 | 96 |
Sonnet 4.6'ya tercih edilme iddiası ne kadar güçlü?
Microsoft'un en yoğun biçimde pazarladığı sonuç, Surge profesyonel değerlendiricileriyle gerçekleştirilen kör yan yana insan değerlendirmesi. Test, %30'u çok turlu olmak üzere 1.276 görevi kapsıyor. Teknik makalede, lansman blogunda yer verilmeyen net rakamlar bulunuyor:
Claude Sonnet 4.6 karşısında:
- MAI-Thinking-1 galibiyetleri: %49, beraberlikler: %6, mağlubiyetler: %45
- Toplam tercih farkı: +0,07 ± 0,06
- En güçlü avantaj: özlülük/ilgililik (+0,11 ± 0,02) ve üslup/ton (+0,08 ± 0,02)
- Talimat takibi, olgusal doğruluk ve tamlıkta istatistiksel olarak berabere
Claude Opus 4.6 karşısında:
- MAI-Thinking-1 galibiyetleri: %43, beraberlikler: %5, mağlubiyetler: %52
- Toplam tercih farkı: -0,07 ± 0,06
Sonnet karşılaştırmasında toplamda “tercih edilen” olma eşiği geçiliyor. Ne var ki ±0,06 güven aralığıyla birlikte +0,07'lik marj, avantajın gerçek olsa da dar olduğunu gösteriyor. Opus karşısındaki sonuç ise net bir yenilgi. Ayrıca görev dağılımı; MAI-Thinking-1'in benchmarklarda en zayıf kaldığı ağır kodlama ve çok adımlı akıl yürütme işlerinden ziyade açık uçlu soru-cevap, içerik yazımı ve özetleme ağırlıklı.
Reddit'te r/LocalLLaMA kullanıcıları, ailenin açık ağırlıklı olmamasına dikkat çekerek MAI-Thinking-1'in Microsoft'un Phi serisinin yerini fiilen alıp almadığını tartışıyor. Stratejik bağlam önemli: Bloomberg haberlerine göre Microsoft, Excel ve Outlook'ta OpenAI ile Anthropic modellerini MAI modelleriyle değiştirmeye başladı. Bu da MAI-Thinking-1'in asıl değerinin Microsoft'un kendi ürünlerindeki maliyet kontrolü olabileceğini düşündürüyor.
Fiyatlandırma ve erişimde mevcut tablo
MAI-Thinking-1 için herkese açık bir token fiyatı bulunmuyor. Microsoft; lansman duyurusunda, model sayfasında ve teknik raporda tek bir dolar tutarı vermeden “orta ölçekli model fiyatı”, “maliyet verimliliği” ve “daha küçük çıkarım yükü” gibi niteliksel ifadeler kullanıyor. Bu belirsizlik, modeli üretim ortamında değerlendiren ekipler için en büyük engel.
Karşılaştırma için benzer akıl yürütme modellerinin fiyatları şöyle (OpenAI fiyatlandırması, Google AI fiyatlandırması):
| Model | Girdi ($/1M token) | Çıktı ($/1M token) |
|---|---|---|
| OpenAI o3 | ~$10 | ~$40 |
| Gemini 2.5 Pro | ~$1.25 | ~$10 |
| Claude Sonnet 4.6* | ~$3 | ~$15 |
\*Claude fiyatlandırması katmana göre değişir; yaklaşık orta seviye değerler Anthropic fiyatlandırmasından alınmıştır.
Microsoft'un “orta ölçekli” konumlandırması, MAI-Thinking-1'in maliyetinin muhtemelen Gemini 2.5 Pro ile Claude Sonnet arasında yer alacağını düşündürüyor. Yine de bir tarife açıklanana kadar bütçe planlaması spekülasyondan ibaret.
Erişim tarafında MAI-Thinking-1, Microsoft Foundry üzerinden herkese açık önizleme olarak sunuluyor; model sayfasında playground bağlantısı da bulunuyor. Haziran duyurusunda OpenRouter, Fireworks AI ve Baseten planlanan dağıtım ortakları olarak açıklanmıştı, ancak bu inceleme itibarıyla hiçbiri aktif değil. Model kapalı ağırlıklı; Hugging Face sürümü, GGUF dosyası veya kendi altyapında çalıştırma seçeneği yok.
MAI-Thinking-1'i bugün kullanmak için:
- Azure hesabınızla Microsoft Foundry'ye giriş yapın
- Foundry içindeki MAI-Thinking-1 model sayfasına gidin
- Test için playground'u kullanın veya Chat Completions uyumlu uç nokta üzerinden dağıtım yapın
- Faturalandırma Azure aboneliğiniz üzerinden ilerler; önizleme dönemindeki ücretler hâlâ açıklanmamıştır
MAI-Thinking-1'i bugün kimler kullanmalı?
Şu senaryolarda mantıklı bir seçenek:
- Kurumsal yönetişim kontrollerine sahip, birinci taraf akıl yürütme modeli isteyen ve hâlihazırda Azure ya da Microsoft Foundry standardında çalışan ekipler
- Matematik, formel akıl yürütme veya yarışma tipi problemler ağırlıklı iş yükleri; AIME 2025'teki %97'lik sonuç kayda değer
- Uyumluluk gerekçeleriyle net veri kökeni gerektiren kurumlar; Microsoft'un “distilasyon yok, lisanslı veri” iddiası düzenlemeye tabi sektörler için önem taşıyabilir
- İnsan değerlendirmesinde öne çıkan kısa ve doğrudan yanıt avantajının değerli olduğu kod inceleme ve analiz ekipleri
Şu ihtiyaçlarınız varsa şimdilik uzak durun:
- Çok modlu girdi/çıktı; model yalnızca metin destekliyor
- Uzun ufuklu agentic görevler; Terminal-Bench 2.0'daki %46,0, terminal otomasyonu için belirleyici bir eksik
- Kendi altyapınızda çalışma veya açık ağırlıklar; model tescilli ve Foundry'e bağlı
- Öngörülebilir üretim maliyetleri; fiyat yoksa bütçe de yok
- En üst seviye kodlama aracısı performansı; Kimi K2.6, GPT-5.4 ve DeepSeek V4, SWE-Bench Pro ve Verified'da daha yüksek skor alıyor
Sık sorulan sorular
MAI-Thinking-1 açık kaynak mı?
Hayır. Model tescilli ve kapalı ağırlıklı. İndirilebilir ağırlıklar, Hugging Face sürümü veya kendi altyapınızda çalıştırma yolu bulunmuyor. Erişim yalnızca Microsoft Foundry üzerinden sağlanıyor.
MAI-Thinking-1, Copilot'a güç veriyor mu?
Bloomberg haberlerine göre Microsoft, Excel ve Outlook'ta OpenAI ile Anthropic modellerini MAI modelleriyle değiştirmeye başladı. Ancak MAI-Thinking-1'in son kullanıcı tarafındaki GitHub Copilot veya Microsoft 365 Copilot'un arkasındaki model olduğu doğrulanmış değil.
MAI-Thinking-1, Microsoft Phi'nin halefi mi?
Microsoft modeli bu şekilde konumlandırmıyor; ancak topluluk bunu bir yön değişimi olarak görüyor. Phi, Microsoft'un açık ağırlıklı küçük model ailesiydi. MAI ise şirketin yeni tescilli ailesi. Temel fark şu: MAI-Thinking-1 kapalı ve daha büyük; Phi'nin 3-14B'sine karşı 35B aktif parametre kullanıyor. Yerelde çalıştırmaktan çok kurumsal dağıtımı hedefliyor.
MAI-Thinking-1 görüntü, ses veya video destekliyor mu?
Hayır. Hem giriş hem çıkış için yalnızca metin destekliyor. Microsoft, diğer modlar için ayrı olarak MAI-Image 2.5 (metinden görüntü), MAI-Transcribe-1.5 (sesten metne) ve MAI-Voice-2 (ses üretimi) sunuyor.
MAI-Thinking-1'in eğitim verisi kesim tarihi nedir?
Model kartında eğitim kesim tarihi Temmuz 2025 olarak listeleniyor. Buna karşılık teknik rapor, kaynak toplamanın 2026'nın ilk aylarına kadar sürdüğünü gösteriyor: web HTML'leri Eylül 2025'e, web PDF'leri Aralık 2025'e, kitaplar ve dergiler ise Mart 2026'ya kadar uzanıyor. Bu çelişki, kesim tarihinin tüm kaynakların toplandığı anı değil, eğitim sonrası veri toplamanın sona erdiği zamanı ifade ettiğini düşündürüyor.
MAI-Thinking-1'i OpenRouter üzerinden kullanabilir miyim?
Henüz değil. Microsoft, 2 Haziran lansmanında OpenRouter, Fireworks AI ve Baseten'i planlanan dağıtım ortakları olarak duyurdu; ancak Ağustos 2026 itibarıyla hiçbiri aktif değil. Mevcut tek erişim yolu Microsoft Foundry herkese açık önizlemesi.
| İş yükünüz | Bugün daha iyi seçenek |
|---|---|
| Yarışma matematiği, formel ispatlar | MAI-Thinking-1 (%97 AIME) veya Claude Opus 4.6 (%99,8) |
| Agentic coding, terminal otomasyonu | GPT-5.4 (%75,1 Terminal-Bench) veya Kimi K2.6 (%66,7) |
| Kod inceleme, hata tespiti | Claude Sonnet 4.6 (%79,6 SWE-Verified) veya Opus 4.6 (%80,8) |
| Azure merkezli kurumsal akıl yürütme | MAI-Thinking-1 (birinci taraf, Foundry yönetişimi) |
| Bütçesi kısıtlı üretim kullanımı | Gemini 2.5 Pro ($1.25/$10) |
| Kendi altyapınızda çalışma veya açık ağırlıklar | MAI için mevcut değil; DeepSeek V4 veya Qwen3.8 açık ağırlıkları değerlendirilebilir |