Microsoft ya tiene su primer modelo de razonamiento desarrollado íntegramente en casa. MAI-Thinking-1 llegó a la vista previa pública de Microsoft Foundry el 12 de agosto de 2026 como un MoE disperso con 35B de parámetros activos y cerca de 1T en total, además de una ventana de contexto de 256K. Sobre el papel promete buen rendimiento en matemáticas y programación con una fracción del coste de inferencia, pero los resultados dibujan un panorama menos rotundo: se queda prácticamente a la par de Claude Opus 4.6 en SWE-Bench Pro (52.8% frente a 53.4%), aunque cae claramente en Terminal-Bench 2.0 (46.0% frente al 75.1% de GPT-5.4). Y, pese a sus reiteradas promesas de un «precio de peso medio», Microsoft todavía no ha publicado tarifas por token.
Qué propone MAI-Thinking-1
MAI-Thinking-1 es un modelo de razonamiento Mixture-of-Experts disperso, creado internamente por Microsoft AI, con 35.000 millones de parámetros activos de aproximadamente 1 billón en total. El informe técnico concreta 34.7B activos y 962B totales en el modelo base, con 78 capas y 8 expertos seleccionados de un total de 512 para cada token enrutado. Su ventana de contexto alcanza los 256.000 tokens, unas 600 páginas de texto, situándolo en una liga similar a Claude Sonnet 4.6 y GPT-5.4.
En la API, MAI-Thinking-1 es compatible con el extendido formato de Chat Completions API, además de function calling, instrucciones de desarrollador y salida estructurada. En la práctica, el código ya preparado para los endpoints de chat de OpenAI puede adaptarse con pocos cambios. Es un modelo solo de texto: no procesa ni genera imágenes, audio o vídeo. Microsoft reserva MAI-Image 2.5 y MAI-Voice 2 para esas modalidades.
La gran baza que Microsoft atribuye al modelo está en su entrenamiento. El documento técnico habla de 30T de tokens de preentrenamiento procedentes de datos humanos públicos y con licencia comercial, junto con 3.55T de tokens de entrenamiento intermedio. Se entrenó con 8.000 GPU GB200 y, durante la fase de RL, con 4.600 GB300. Microsoft sostiene que lo hizo sin destilación de modelos de terceros, excluyendo datos sintéticos generados por modelos de otros laboratorios.
El modelo se anunció por primera vez en Microsoft Build, el 2 de junio de 2026, dentro de una familia MAI de siete modelos. Permaneció en vista previa privada hasta el 12 de agosto de 2026.
Benchmarks: su posición real
El informe técnico de Microsoft ofrece la fotografía comparativa más completa. Todos los resultados de MAI-Thinking-1 son medias de cuatro ejecuciones con temperatura 1 y top-p 0.97; para las pruebas de programación agéntica se empleó una longitud total de contexto de 256K. Las cifras de los competidores proceden de sus respectivas model cards oficiales, no de reproducciones independientes.
| Benchmark | MAI-Thinking-1 | Sonnet 4.6 | Opus 4.6 | GPT-5.4 | Kimi K2.6 | DeepSeek V4 | GLM-5.1 |
|---|---|---|---|---|---|---|---|
| AIME 2025 | 97.0 | 95.6 | 99.8 | — | — | — | — |
| AIME 2026 | 94.5 | — | — | — | 96.4 | — | 95.3 |
| GPQA Diamond | 84.2 | 89.9 | 91.3 | 92.8 | 90.5 | 90.1 | 85.2 |
| LiveCodeBench v6 | 87.7 | — | — | — | 89.6 | 93.5 | — |
| SWE-Bench Verified | 73.5 | 79.6 | 80.8 | — | 80.2 | 80.6 | — |
| SWE-Bench Pro | 52.8 | — | 53.4 | 57.7 | 58.6 | 55.4 | 58.4 |
| Terminal-Bench 2.0 | 46.0 | 59.1 | 65.4 | 75.1 | 66.7 | 67.9 | 69.0 |
La tendencia es bastante clara. En matemáticas puras, MAI-Thinking-1 rinde bien: su 97.0% en AIME 2025 supera el 95.6% de Sonnet 4.6, aunque no alcanza el 99.8% de Opus 4.6. En AIME 2026, con un 94.5%, queda por detrás tanto de Kimi K2.6 (96.4%) como de GLM-5.1 (95.3%).
En programación agéntica, la distancia aumenta. El 52.8% de SWE-Bench Pro se aproxima al 53.4% de Opus 4.6, la comparación concreta que Microsoft destaca. Sin embargo, GPT-5.4 (57.7%), Kimi K2.6 (58.6%), DeepSeek V4 (55.4%) y GLM-5.1 (58.4%) obtienen puntuaciones superiores. En Terminal-Bench 2.0, que mide el rendimiento de agentes de terminal en tareas de varios pasos, el 46.0% de MAI-Thinking-1 queda 13 puntos por debajo de Sonnet 4.6 (59.1%) y 29 puntos por debajo de GPT-5.4 (75.1%).
El propio informe técnico reconoce que el modelo «no lidera el sector». MAI-Thinking-1 es competitivo para un modelo de 35B de parámetros activos, no para ocupar la cima de la clasificación.
Datos adicionales del informe técnico, comparados con Sonnet 4.6:
| Área | MAI-Thinking-1 | Sonnet 4.6 |
|---|---|---|
| MMLU-Pro | 85 | 87 |
| SimpleQA Verified | 31 | 29 |
| BFCL v3 (llamadas a herramientas) | 72 | 76 |
| CyberSecEval Instruct | 63 | 62 |
| GraphWalks (≤128K) | 90 | 96 |
La ajustada victoria frente a Sonnet 4.6
El resultado que Microsoft ha promocionado con más fuerza procede de una evaluación humana ciega, cara a cara, realizada con evaluadores profesionales de Surge. Abarcó 1.276 tareas, de las cuales el 30% eran multivuelta. El informe técnico aporta las cifras exactas que no aparecen en el blog de lanzamiento:
Frente a Claude Sonnet 4.6:
- Victorias de MAI-Thinking-1: 49%; empates: 6%; derrotas: 45%
- Diferencia global de preferencia: +0.07 ± 0.06
- Mayor ventaja: concisión/relevancia (+0.11 ± 0.02) y estilo/tono (+0.08 ± 0.02)
- Empate estadístico en seguimiento de instrucciones, precisión factual e integridad
Frente a Claude Opus 4.6:
- Victorias de MAI-Thinking-1: 43%; empates: 5%; derrotas: 52%
- Diferencia global de preferencia: -0.07 ± 0.06
La comparación con Sonnet supera en conjunto el umbral de «preferido», pero el margen de +0.07, con un intervalo de confianza de ±0.06, revela una ventaja existente pero muy estrecha. Frente a Opus, la derrota es clara. Además, las tareas se inclinan hacia preguntas y respuestas abiertas, redacción de contenidos y resúmenes, no hacia las cargas intensivas de programación y razonamiento en varios pasos donde los benchmarks de MAI-Thinking-1 son más flojos.
En Reddit, los usuarios de r/LocalLLaMA debaten si MAI-Thinking-1 es, en la práctica, el relevo de la línea Phi de Microsoft, señalando que esta familia no ofrece pesos abiertos. El contexto estratégico importa: según información de Bloomberg, Microsoft ha empezado a sustituir modelos de OpenAI y Anthropic por MAI en Excel y Outlook, lo que sugiere que el valor real de MAI-Thinking-1 está en controlar costes dentro de los propios productos de Microsoft.
Precios y acceso: lo que falta por saber
No existe una tarifa pública por tokens para MAI-Thinking-1. Microsoft recurre a descripciones cualitativas como «precio de peso medio», «eficiente en costes» o «menor huella de inferencia», pero no ofrece ni una sola cifra en dólares en el anuncio de lanzamiento, la página del modelo o el informe técnico. Para quien valore su uso en producción, este es el principal obstáculo.
Como referencia, estos son los precios de modelos de razonamiento comparables (precios de OpenAI, precios de Google AI):
| Modelo | Entrada ($/1M tokens) | Salida ($/1M tokens) |
|---|---|---|
| OpenAI o3 | ~$10 | ~$40 |
| Gemini 2.5 Pro | ~$1.25 | ~$10 |
| Claude Sonnet 4.6* | ~$3 | ~$15 |
\*El precio de Claude varía según el nivel; aproximación de gama media basada en los precios de Anthropic.
El posicionamiento de «peso medio» de Microsoft apunta a que MAI-Thinking-1 probablemente se situará en costes entre Gemini 2.5 Pro y Claude Sonnet, pero sin una tarifa publicada cualquier presupuesto sigue siendo especulativo.
En cuanto al acceso, MAI-Thinking-1 está disponible en vista previa pública mediante Microsoft Foundry, con un enlace al playground en la página del modelo. El anuncio de junio mencionó a OpenRouter, Fireworks AI y Baseten como futuros socios de distribución, pero ninguno estaba disponible cuando se realizó este análisis. El modelo tiene pesos cerrados: no hay lanzamiento en Hugging Face, formato GGUF ni opción de autoalojamiento.
Para usar MAI-Thinking-1 hoy:
- Inicia sesión en Microsoft Foundry con una cuenta de Azure
- Ve a la página del modelo MAI-Thinking-1 dentro de Foundry
- Utiliza el playground para probarlo o despliega el modelo mediante el endpoint compatible con Chat Completions
- La facturación se gestiona a través de la suscripción de Azure; las tarifas siguen sin revelarse durante la vista previa
Para quién tiene sentido MAI-Thinking-1 hoy
Encaja bien en estos casos:
- Equipos ya estandarizados en Azure o Microsoft Foundry que busquen un modelo de razonamiento propio de la plataforma con controles de gobernanza empresarial
- Cargas centradas en matemáticas, razonamiento formal o problemas de competición: el 97% en AIME 2025 es un resultado real
- Organizaciones que necesitan una procedencia de datos clara por requisitos de cumplimiento: la afirmación de Microsoft sobre datos con licencia y sin destilación puede importar en sectores regulados
- Equipos dedicados a revisión y análisis de código, donde la ventaja de concisión observada en la evaluación humana aporte valor
Mejor esperar si necesitas:
- Entrada o salida multimodal: es un modelo solo de texto
- Tareas agénticas de largo recorrido: el 46% en Terminal-Bench 2.0 lo descarta para automatización de terminal
- Autoalojamiento o pesos abiertos: es un modelo propietario y restringido a Foundry
- Costes de producción previsibles: sin precios no hay forma de presupuestar
- Rendimiento de primer nivel en agentes de programación: Kimi K2.6, GPT-5.4 y DeepSeek V4 superan sus resultados tanto en SWE-Bench Pro como en Verified
Preguntas frecuentes
¿MAI-Thinking-1 es de código abierto?
No. Es un modelo propietario con pesos cerrados. No hay pesos descargables, lanzamiento en Hugging Face ni opción de autoalojamiento. El acceso se limita a Microsoft Foundry.
¿MAI-Thinking-1 impulsa Copilot?
Según información de Bloomberg, Microsoft ha empezado a reemplazar modelos de OpenAI y Anthropic por modelos MAI en Excel y Outlook. Sin embargo, no está confirmado que MAI-Thinking-1 sea el modelo detrás de GitHub Copilot o Microsoft 365 Copilot para usuarios finales.
¿MAI-Thinking-1 es el sucesor de Microsoft Phi?
Microsoft no lo presenta de ese modo, aunque la comunidad lo percibe como un cambio de rumbo. Phi era la familia de modelos pequeños con pesos abiertos de Microsoft; MAI es su nueva familia propietaria. La diferencia clave es que MAI-Thinking-1 es cerrado y más grande (35B activos frente a los 3-14B de Phi), orientado al despliegue empresarial y no a la ejecución local.
¿MAI-Thinking-1 admite visión, audio o vídeo?
No. Solo admite texto tanto en la entrada como en la salida. Para otras modalidades, Microsoft ofrece MAI-Image 2.5 (texto a imagen), MAI-Transcribe-1.5 (voz a texto) y MAI-Voice-2 (generación de voz).
¿Cuál es la fecha de corte de los datos de entrenamiento de MAI-Thinking-1?
La model card indica julio de 2025 como fecha de corte de entrenamiento, pero el informe técnico señala que la recopilación de fuentes se prolongó hasta principios de 2026: HTML web hasta septiembre de 2025, PDF web hasta diciembre de 2025, y libros y revistas hasta marzo de 2026. Esta discrepancia sugiere que la fecha de corte se refiere al final de la recogida de datos de posentrenamiento, no al momento en que se reunieron todas las fuentes.
¿Puedo usar MAI-Thinking-1 mediante OpenRouter?
Todavía no. Microsoft citó a OpenRouter, Fireworks AI y Baseten como futuros socios de distribución en el lanzamiento del 2 de junio, pero ninguno estaba activo en agosto de 2026. Por ahora, la única vía de acceso es la vista previa pública de Microsoft Foundry.
| Tu carga de trabajo | Mejor opción hoy |
|---|---|
| Matemáticas de competición, demostraciones formales | MAI-Thinking-1 (97% AIME) o Claude Opus 4.6 (99.8%) |
| Programación agéntica, automatización de terminal | GPT-5.4 (75.1% Terminal-Bench) o Kimi K2.6 (66.7%) |
| Revisión de código, detección de errores | Claude Sonnet 4.6 (79.6% SWE-Verified) u Opus 4.6 (80.8%) |
| Razonamiento empresarial nativo de Azure | MAI-Thinking-1 (modelo propio, gobernanza de Foundry) |
| Producción con presupuesto ajustado | Gemini 2.5 Pro ($1.25/$10) |
| Autoalojamiento o pesos abiertos | No disponible con MAI; considera los pesos abiertos de DeepSeek V4 o Qwen3.8 |