O MAI-Thinking-1 chegou à prévia pública no Microsoft Foundry em 12 de agosto de 2026 como o primeiro modelo de raciocínio desenvolvido integralmente pela Microsoft. Trata-se de um MoE esparso com 35B de parâmetros ativos e cerca de 1T no total, além de uma janela de contexto de 256K. A proposta é entregar bom desempenho em matemática e programação com uma fração do custo de inferência, mas os benchmarks desenham um quadro menos simples: ele praticamente empata com Claude Opus 4.6 no SWE-Bench Pro, com 52,8% contra 53,4%, porém fica muito atrás no Terminal-Bench 2.0, com 46,0% ante 75,1% do GPT-5.4. E, apesar das repetidas promessas de um preço de modelo intermediário, a Microsoft ainda não divulgou valores por token.
O que é o MAI-Thinking-1
O MAI-Thinking-1 é um modelo de raciocínio Sparse Mixture-of-Experts desenvolvido internamente pela Microsoft AI. São 35 bilhões de parâmetros ativos de aproximadamente 1 trilhão no total. No relatório técnico, os números precisos do modelo-base são 34,7B ativos e 962B totais, distribuídos em 78 camadas e com 8 especialistas selecionados entre 512 para cada token roteado. A janela de contexto chega a 256.000 tokens — algo como 600 páginas de texto —, faixa semelhante à de Claude Sonnet 4.6 e GPT-5.4.
Na API, o MAI-Thinking-1 é compatível com o formato amplamente usado da Chat Completions API e oferece function calling, instruções de desenvolvedor e saída estruturada. Na prática, código já direcionado aos endpoints de chat da OpenAI pode ser adaptado com poucas alterações. É um modelo exclusivamente textual: não recebe nem gera imagens, áudio ou vídeo. Para essas modalidades, a Microsoft posiciona MAI-Image 2.5 e MAI-Voice 2 como modelos separados.
O principal diferencial apontado pela Microsoft está no treinamento. O artigo técnico descreve 30T de tokens de pré-treinamento compostos por dados humanos públicos e licenciados comercialmente, além de 3,55T de tokens no treinamento intermediário. Foram usadas 8.000 GPUs GB200; na etapa de RL, 4.600 GB300s. A Microsoft afirma que treinou o modelo sem destilação de modelos de terceiros, excluindo dados sintéticos gerados por modelos de outros laboratórios.
O modelo foi anunciado inicialmente no Microsoft Build, em 2 de junho de 2026, dentro de uma família MAI de sete modelos. Ele ficou em prévia privada até 12 de agosto de 2026.
Benchmarks: onde o modelo realmente se posiciona
O artigo técnico da Microsoft traz o retrato mais completo dos benchmarks. Todos os resultados do MAI-Thinking-1 são médias de quatro execuções, com temperatura 1, top-p 0,97 e contexto total de 256K nos testes de programação agêntica. Os números dos concorrentes vêm de seus respectivos model cards oficiais, e não de reproduções independentes.
| Benchmark | MAI-Thinking-1 | Sonnet 4.6 | Opus 4.6 | GPT-5.4 | Kimi K2.6 | DeepSeek V4 | GLM-5.1 |
|---|---|---|---|---|---|---|---|
| AIME 2025 | 97.0 | 95.6 | 99.8 | — | — | — | — |
| AIME 2026 | 94.5 | — | — | — | 96.4 | — | 95.3 |
| GPQA Diamond | 84.2 | 89.9 | 91.3 | 92.8 | 90.5 | 90.1 | 85.2 |
| LiveCodeBench v6 | 87.7 | — | — | — | 89.6 | 93.5 | — |
| SWE-Bench Verified | 73.5 | 79.6 | 80.8 | — | 80.2 | 80.6 | — |
| SWE-Bench Pro | 52.8 | — | 53.4 | 57.7 | 58.6 | 55.4 | 58.4 |
| Terminal-Bench 2.0 | 46.0 | 59.1 | 65.4 | 75.1 | 66.7 | 67.9 | 69.0 |
O padrão é claro. Em matemática pura, o MAI-Thinking-1 é forte. Seus 97,0% no AIME 2025 superam os 95,6% do Sonnet 4.6, embora ainda fiquem abaixo dos 99,8% do Opus 4.6. Já no AIME 2026, com 94,5%, ele perde para Kimi K2.6, que marcou 96,4%, e GLM-5.1, com 95,3%.
Em programação agêntica, a distância aumenta. Os 52,8% no SWE-Bench Pro ficam perto dos 53,4% do Opus 4.6 — a comparação específica destacada pela Microsoft. Ainda assim, GPT-5.4, com 57,7%, Kimi K2.6, com 58,6%, DeepSeek V4, com 55,4%, e GLM-5.1, com 58,4%, pontuam mais alto. No Terminal-Bench 2.0, que mede o desempenho de agentes de terminal em tarefas de várias etapas, os 46,0% do MAI-Thinking-1 ficam 13 pontos atrás do Sonnet 4.6, com 59,1%, e 29 pontos abaixo dos 75,1% do GPT-5.4.
O próprio artigo técnico reconhece que o modelo "não lidera o campo". O MAI-Thinking-1 é competitivo considerando seu porte de 35B de parâmetros ativos, mas não disputa o topo do ranking.
Outros dados de benchmark do artigo técnico, comparados ao Sonnet 4.6:
| Área | MAI-Thinking-1 | Sonnet 4.6 |
|---|---|---|
| MMLU-Pro | 85 | 87 |
| SimpleQA Verified | 31 | 29 |
| BFCL v3 (tool calling) | 72 | 76 |
| CyberSecEval Instruct | 63 | 62 |
| GraphWalks (≤128K) | 90 | 96 |
A alegação de preferência sobre o Sonnet 4.6
O resultado mais explorado pela Microsoft é uma avaliação humana cega, lado a lado, conduzida com avaliadores profissionais da Surge. Foram 1.276 tarefas, das quais 30% eram multi-turn. O artigo técnico traz os números exatos que o post de lançamento não mostra:
Contra Claude Sonnet 4.6:
- Vitórias do MAI-Thinking-1: 49%; empates: 6%; derrotas: 45%
- Diferença geral de preferência: +0.07 ± 0.06
- Maior vantagem: concisão/relevância (+0.11 ± 0.02) e estilo/tom (+0.08 ± 0.02)
- Empate estatístico em seguimento de instruções, factualidade e completude
Contra Claude Opus 4.6:
- Vitórias do MAI-Thinking-1: 43%; empates: 5%; derrotas: 52%
- Diferença geral de preferência: -0.07 ± 0.06
A comparação com o Sonnet supera, no agregado, o limiar de "preferido", mas a margem de +0,07 com intervalo de confiança de ±0,06 mostra uma vantagem real, porém estreita. Contra o Opus, a derrota é clara. As tarefas se concentram em perguntas e respostas abertas, produção de conteúdo e resumos, não nas cargas pesadas de programação e raciocínio em múltiplas etapas nas quais os benchmarks do MAI-Thinking-1 são mais fracos.
No Reddit, usuários do r/LocalLLaMA discutem se o MAI-Thinking-1 sucede, na prática, a linha Phi da Microsoft, observando que a família não tem pesos abertos. O contexto estratégico importa: segundo reportagem da Bloomberg, a Microsoft começou a substituir modelos da OpenAI e da Anthropic por MAI no Excel e no Outlook. Isso sugere que o valor real do MAI-Thinking-1 pode estar no controle de custos dos próprios produtos da Microsoft.
Preço e acesso: o que falta saber
Não há preço público por token para o MAI-Thinking-1. A Microsoft usa descrições qualitativas como "preço de modelo intermediário", "eficiente em custos" e "menor pegada de inferência", mas não informa um único valor em dólar no anúncio, na página do modelo ou no relatório técnico. Para quem avalia o uso em produção, esta é a principal barreira.
Como referência, estes são os preços de modelos de raciocínio comparáveis (preços da OpenAI, preços do Google AI):
| Modelo | Entrada ($/1M tokens) | Saída ($/1M tokens) |
|---|---|---|
| OpenAI o3 | ~$10 | ~$40 |
| Gemini 2.5 Pro | ~$1.25 | ~$10 |
| Claude Sonnet 4.6* | ~$3 | ~$15 |
\*O preço do Claude varia conforme a faixa; estimativa intermediária baseada nos preços da Anthropic.
O posicionamento como modelo de porte intermediário indica que o MAI-Thinking-1 provavelmente ficará entre Gemini 2.5 Pro e Claude Sonnet em custo. Mas, até que uma tabela seja publicada, qualquer orçamento será especulativo.
Quanto ao acesso, o MAI-Thinking-1 está em prévia pública no Microsoft Foundry, com link para o playground na página do modelo. O anúncio de junho citou OpenRouter, Fireworks AI e Baseten como parceiros de distribuição planejados, mas nenhum estava disponível até esta análise. O modelo tem pesos fechados: não há lançamento no Hugging Face, GGUF nem opção de auto-hospedagem.
Para usar o MAI-Thinking-1 hoje:
- Entre no Microsoft Foundry com uma conta Azure
- Acesse a página do modelo MAI-Thinking-1 dentro do Foundry
- Use o playground para testes ou faça o deploy pelo endpoint compatível com Chat Completions
- A cobrança passa pela assinatura do Azure; as tarifas seguem não divulgadas durante a prévia
Para quem o MAI-Thinking-1 faz sentido agora
Vale considerar para:
- Equipes que já padronizaram Azure ou Microsoft Foundry e querem um modelo de raciocínio próprio da plataforma, com controles de governança corporativa
- Cargas centradas em matemática, raciocínio formal ou problemas de estilo competitivo — os 97% no AIME 2025 são legítimos
- Organizações que precisam de procedência clara dos dados por razões de compliance — a alegação da Microsoft de "sem destilação, dados licenciados" é relevante para setores regulados
- Times que fazem revisão e análise de código, nos quais a vantagem de concisão observada na avaliação humana é útil
Por enquanto, deixe passar se você precisa de:
- Entrada ou saída multimodal — o modelo trabalha apenas com texto
- Tarefas agênticas de longo horizonte — os 46% no Terminal-Bench 2.0 inviabilizam a automação de terminal
- Auto-hospedagem ou pesos abertos — o modelo é proprietário e preso ao Foundry
- Custos previsíveis em produção — sem preços, não há como orçar
- Desempenho de ponta em agentes de programação — Kimi K2.6, GPT-5.4 e DeepSeek V4 têm notas maiores no SWE-Bench Pro e Verified
Perguntas frequentes
O MAI-Thinking-1 é open source?
Não. O modelo é proprietário e tem pesos fechados. Não há pesos para download, lançamento no Hugging Face nem caminho de auto-hospedagem. O acesso ocorre somente pelo Microsoft Foundry.
O MAI-Thinking-1 é o modelo por trás do Copilot?
Segundo reportagem da Bloomberg, a Microsoft começou a substituir modelos da OpenAI e da Anthropic por modelos MAI no Excel e no Outlook. No entanto, não há confirmação de que o MAI-Thinking-1 seja o modelo usado no GitHub Copilot ou no Microsoft 365 Copilot para usuários finais.
O MAI-Thinking-1 é o sucessor do Microsoft Phi?
Ele não é posicionado dessa forma, mas a comunidade o vê como uma mudança de direção. Phi era a família de modelos pequenos com pesos abertos da Microsoft. MAI é a nova família proprietária da empresa. A diferença central é que o MAI-Thinking-1 é fechado e maior, com 35B ativos contra 3-14B do Phi, mirando implementação corporativa em vez de execução local.
O MAI-Thinking-1 suporta visão, áudio ou vídeo?
Não. Tanto a entrada quanto a saída são exclusivamente textuais. A Microsoft oferece MAI-Image 2.5 para texto em imagem, MAI-Transcribe-1.5 para fala em texto e MAI-Voice-2 para geração de fala em outras modalidades.
Qual é o corte de dados de treinamento do MAI-Thinking-1?
O model card informa um corte de treinamento em julho de 2025, mas o relatório técnico indica que a coleta de fontes foi até o início de 2026: HTML da web até setembro de 2025, PDFs da web até dezembro de 2025 e livros e periódicos até março de 2026. Essa discrepância sugere que o corte se refere ao fim da coleta de dados de pós-treinamento, e não ao momento em que todas as fontes foram reunidas.
Posso usar o MAI-Thinking-1 via OpenRouter?
Ainda não. A Microsoft citou OpenRouter, Fireworks AI e Baseten como parceiros de distribuição planejados no lançamento de 2 de junho, mas nenhum estava disponível até agosto de 2026. No momento, o único caminho de acesso é a prévia pública do Microsoft Foundry.
| Sua carga de trabalho | Melhor escolha hoje |
|---|---|
| Matemática competitiva, provas formais | MAI-Thinking-1 (97% AIME) ou Claude Opus 4.6 (99.8%) |
| Programação agêntica, automação de terminal | GPT-5.4 (75.1% Terminal-Bench) ou Kimi K2.6 (66.7%) |
| Revisão de código, detecção de bugs | Claude Sonnet 4.6 (79.6% SWE-Verified) ou Opus 4.6 (80.8%) |
| Raciocínio corporativo nativo de Azure | MAI-Thinking-1 (modelo próprio, governança do Foundry) |
| Produção com orçamento restrito | Gemini 2.5 Pro ($1.25/$10) |
| Auto-hospedagem ou pesos abertos | Não disponível no MAI; considere os pesos abertos de DeepSeek V4 ou Qwen3.8 |