AIREITER

Review do MAI-Thinking-1: o primeiro modelo de raciocínio da Microsoft (2026)

Última Atualização: 2026-08-13 07:39:56

O MAI-Thinking-1 chegou à prévia pública no Microsoft Foundry em 12 de agosto de 2026 como o primeiro modelo de raciocínio desenvolvido integralmente pela Microsoft. Trata-se de um MoE esparso com 35B de parâmetros ativos e cerca de 1T no total, além de uma janela de contexto de 256K. A proposta é entregar bom desempenho em matemática e programação com uma fração do custo de inferência, mas os benchmarks desenham um quadro menos simples: ele praticamente empata com Claude Opus 4.6 no SWE-Bench Pro, com 52,8% contra 53,4%, porém fica muito atrás no Terminal-Bench 2.0, com 46,0% ante 75,1% do GPT-5.4. E, apesar das repetidas promessas de um preço de modelo intermediário, a Microsoft ainda não divulgou valores por token.

O que é o MAI-Thinking-1

O MAI-Thinking-1 é um modelo de raciocínio Sparse Mixture-of-Experts desenvolvido internamente pela Microsoft AI. São 35 bilhões de parâmetros ativos de aproximadamente 1 trilhão no total. No relatório técnico, os números precisos do modelo-base são 34,7B ativos e 962B totais, distribuídos em 78 camadas e com 8 especialistas selecionados entre 512 para cada token roteado. A janela de contexto chega a 256.000 tokens — algo como 600 páginas de texto —, faixa semelhante à de Claude Sonnet 4.6 e GPT-5.4.

Na API, o MAI-Thinking-1 é compatível com o formato amplamente usado da Chat Completions API e oferece function calling, instruções de desenvolvedor e saída estruturada. Na prática, código já direcionado aos endpoints de chat da OpenAI pode ser adaptado com poucas alterações. É um modelo exclusivamente textual: não recebe nem gera imagens, áudio ou vídeo. Para essas modalidades, a Microsoft posiciona MAI-Image 2.5 e MAI-Voice 2 como modelos separados.

O principal diferencial apontado pela Microsoft está no treinamento. O artigo técnico descreve 30T de tokens de pré-treinamento compostos por dados humanos públicos e licenciados comercialmente, além de 3,55T de tokens no treinamento intermediário. Foram usadas 8.000 GPUs GB200; na etapa de RL, 4.600 GB300s. A Microsoft afirma que treinou o modelo sem destilação de modelos de terceiros, excluindo dados sintéticos gerados por modelos de outros laboratórios.

O modelo foi anunciado inicialmente no Microsoft Build, em 2 de junho de 2026, dentro de uma família MAI de sete modelos. Ele ficou em prévia privada até 12 de agosto de 2026.

Benchmarks: onde o modelo realmente se posiciona

O artigo técnico da Microsoft traz o retrato mais completo dos benchmarks. Todos os resultados do MAI-Thinking-1 são médias de quatro execuções, com temperatura 1, top-p 0,97 e contexto total de 256K nos testes de programação agêntica. Os números dos concorrentes vêm de seus respectivos model cards oficiais, e não de reproduções independentes.

BenchmarkMAI-Thinking-1Sonnet 4.6Opus 4.6GPT-5.4Kimi K2.6DeepSeek V4GLM-5.1
AIME 202597.095.699.8————
AIME 202694.5———96.4—95.3
GPQA Diamond84.289.991.392.890.590.185.2
LiveCodeBench v687.7———89.693.5—
SWE-Bench Verified73.579.680.8—80.280.6—
SWE-Bench Pro52.8—53.457.758.655.458.4
Terminal-Bench 2.046.059.165.475.166.767.969.0

O padrão é claro. Em matemática pura, o MAI-Thinking-1 é forte. Seus 97,0% no AIME 2025 superam os 95,6% do Sonnet 4.6, embora ainda fiquem abaixo dos 99,8% do Opus 4.6. Já no AIME 2026, com 94,5%, ele perde para Kimi K2.6, que marcou 96,4%, e GLM-5.1, com 95,3%.

Em programação agêntica, a distância aumenta. Os 52,8% no SWE-Bench Pro ficam perto dos 53,4% do Opus 4.6 — a comparação específica destacada pela Microsoft. Ainda assim, GPT-5.4, com 57,7%, Kimi K2.6, com 58,6%, DeepSeek V4, com 55,4%, e GLM-5.1, com 58,4%, pontuam mais alto. No Terminal-Bench 2.0, que mede o desempenho de agentes de terminal em tarefas de várias etapas, os 46,0% do MAI-Thinking-1 ficam 13 pontos atrás do Sonnet 4.6, com 59,1%, e 29 pontos abaixo dos 75,1% do GPT-5.4.

O próprio artigo técnico reconhece que o modelo "não lidera o campo". O MAI-Thinking-1 é competitivo considerando seu porte de 35B de parâmetros ativos, mas não disputa o topo do ranking.

Outros dados de benchmark do artigo técnico, comparados ao Sonnet 4.6:

ÁreaMAI-Thinking-1Sonnet 4.6
MMLU-Pro8587
SimpleQA Verified3129
BFCL v3 (tool calling)7276
CyberSecEval Instruct6362
GraphWalks (≤128K)9096

A alegação de preferência sobre o Sonnet 4.6

O resultado mais explorado pela Microsoft é uma avaliação humana cega, lado a lado, conduzida com avaliadores profissionais da Surge. Foram 1.276 tarefas, das quais 30% eram multi-turn. O artigo técnico traz os números exatos que o post de lançamento não mostra:

Contra Claude Sonnet 4.6:

  • Vitórias do MAI-Thinking-1: 49%; empates: 6%; derrotas: 45%
  • Diferença geral de preferência: +0.07 ± 0.06
  • Maior vantagem: concisão/relevância (+0.11 ± 0.02) e estilo/tom (+0.08 ± 0.02)
  • Empate estatístico em seguimento de instruções, factualidade e completude

Contra Claude Opus 4.6:

  • Vitórias do MAI-Thinking-1: 43%; empates: 5%; derrotas: 52%
  • Diferença geral de preferência: -0.07 ± 0.06

A comparação com o Sonnet supera, no agregado, o limiar de "preferido", mas a margem de +0,07 com intervalo de confiança de ±0,06 mostra uma vantagem real, porém estreita. Contra o Opus, a derrota é clara. As tarefas se concentram em perguntas e respostas abertas, produção de conteúdo e resumos, não nas cargas pesadas de programação e raciocínio em múltiplas etapas nas quais os benchmarks do MAI-Thinking-1 são mais fracos.

No Reddit, usuários do r/LocalLLaMA discutem se o MAI-Thinking-1 sucede, na prática, a linha Phi da Microsoft, observando que a família não tem pesos abertos. O contexto estratégico importa: segundo reportagem da Bloomberg, a Microsoft começou a substituir modelos da OpenAI e da Anthropic por MAI no Excel e no Outlook. Isso sugere que o valor real do MAI-Thinking-1 pode estar no controle de custos dos próprios produtos da Microsoft.

Preço e acesso: o que falta saber

Não há preço público por token para o MAI-Thinking-1. A Microsoft usa descrições qualitativas como "preço de modelo intermediário", "eficiente em custos" e "menor pegada de inferência", mas não informa um único valor em dólar no anúncio, na página do modelo ou no relatório técnico. Para quem avalia o uso em produção, esta é a principal barreira.

Como referência, estes são os preços de modelos de raciocínio comparáveis (preços da OpenAI, preços do Google AI):

ModeloEntrada ($/1M tokens)Saída ($/1M tokens)
OpenAI o3~$10~$40
Gemini 2.5 Pro~$1.25~$10
Claude Sonnet 4.6*~$3~$15

\*O preço do Claude varia conforme a faixa; estimativa intermediária baseada nos preços da Anthropic.

O posicionamento como modelo de porte intermediário indica que o MAI-Thinking-1 provavelmente ficará entre Gemini 2.5 Pro e Claude Sonnet em custo. Mas, até que uma tabela seja publicada, qualquer orçamento será especulativo.

Quanto ao acesso, o MAI-Thinking-1 está em prévia pública no Microsoft Foundry, com link para o playground na página do modelo. O anúncio de junho citou OpenRouter, Fireworks AI e Baseten como parceiros de distribuição planejados, mas nenhum estava disponível até esta análise. O modelo tem pesos fechados: não há lançamento no Hugging Face, GGUF nem opção de auto-hospedagem.

Página do modelo MAI-Thinking-1 no Microsoft AI

Para usar o MAI-Thinking-1 hoje:

  1. Entre no Microsoft Foundry com uma conta Azure
  2. Acesse a página do modelo MAI-Thinking-1 dentro do Foundry
  3. Use o playground para testes ou faça o deploy pelo endpoint compatível com Chat Completions
  4. A cobrança passa pela assinatura do Azure; as tarifas seguem não divulgadas durante a prévia

Para quem o MAI-Thinking-1 faz sentido agora

Vale considerar para:

  • Equipes que já padronizaram Azure ou Microsoft Foundry e querem um modelo de raciocínio próprio da plataforma, com controles de governança corporativa
  • Cargas centradas em matemática, raciocínio formal ou problemas de estilo competitivo — os 97% no AIME 2025 são legítimos
  • Organizações que precisam de procedência clara dos dados por razões de compliance — a alegação da Microsoft de "sem destilação, dados licenciados" é relevante para setores regulados
  • Times que fazem revisão e análise de código, nos quais a vantagem de concisão observada na avaliação humana é útil

Por enquanto, deixe passar se você precisa de:

  • Entrada ou saída multimodal — o modelo trabalha apenas com texto
  • Tarefas agênticas de longo horizonte — os 46% no Terminal-Bench 2.0 inviabilizam a automação de terminal
  • Auto-hospedagem ou pesos abertos — o modelo é proprietário e preso ao Foundry
  • Custos previsíveis em produção — sem preços, não há como orçar
  • Desempenho de ponta em agentes de programação — Kimi K2.6, GPT-5.4 e DeepSeek V4 têm notas maiores no SWE-Bench Pro e Verified

Perguntas frequentes

O MAI-Thinking-1 é open source?

Não. O modelo é proprietário e tem pesos fechados. Não há pesos para download, lançamento no Hugging Face nem caminho de auto-hospedagem. O acesso ocorre somente pelo Microsoft Foundry.

O MAI-Thinking-1 é o modelo por trás do Copilot?

Segundo reportagem da Bloomberg, a Microsoft começou a substituir modelos da OpenAI e da Anthropic por modelos MAI no Excel e no Outlook. No entanto, não há confirmação de que o MAI-Thinking-1 seja o modelo usado no GitHub Copilot ou no Microsoft 365 Copilot para usuários finais.

O MAI-Thinking-1 é o sucessor do Microsoft Phi?

Ele não é posicionado dessa forma, mas a comunidade o vê como uma mudança de direção. Phi era a família de modelos pequenos com pesos abertos da Microsoft. MAI é a nova família proprietária da empresa. A diferença central é que o MAI-Thinking-1 é fechado e maior, com 35B ativos contra 3-14B do Phi, mirando implementação corporativa em vez de execução local.

O MAI-Thinking-1 suporta visão, áudio ou vídeo?

Não. Tanto a entrada quanto a saída são exclusivamente textuais. A Microsoft oferece MAI-Image 2.5 para texto em imagem, MAI-Transcribe-1.5 para fala em texto e MAI-Voice-2 para geração de fala em outras modalidades.

Qual é o corte de dados de treinamento do MAI-Thinking-1?

O model card informa um corte de treinamento em julho de 2025, mas o relatório técnico indica que a coleta de fontes foi até o início de 2026: HTML da web até setembro de 2025, PDFs da web até dezembro de 2025 e livros e periódicos até março de 2026. Essa discrepância sugere que o corte se refere ao fim da coleta de dados de pós-treinamento, e não ao momento em que todas as fontes foram reunidas.

Posso usar o MAI-Thinking-1 via OpenRouter?

Ainda não. A Microsoft citou OpenRouter, Fireworks AI e Baseten como parceiros de distribuição planejados no lançamento de 2 de junho, mas nenhum estava disponível até agosto de 2026. No momento, o único caminho de acesso é a prévia pública do Microsoft Foundry.

Sua carga de trabalhoMelhor escolha hoje
Matemática competitiva, provas formaisMAI-Thinking-1 (97% AIME) ou Claude Opus 4.6 (99.8%)
Programação agêntica, automação de terminalGPT-5.4 (75.1% Terminal-Bench) ou Kimi K2.6 (66.7%)
Revisão de código, detecção de bugsClaude Sonnet 4.6 (79.6% SWE-Verified) ou Opus 4.6 (80.8%)
Raciocínio corporativo nativo de AzureMAI-Thinking-1 (modelo próprio, governança do Foundry)
Produção com orçamento restritoGemini 2.5 Pro ($1.25/$10)
Auto-hospedagem ou pesos abertosNão disponível no MAI; considere os pesos abertos de DeepSeek V4 ou Qwen3.8