12 августа 2026 года Microsoft вывела MAI-Thinking-1 в public preview на Microsoft Foundry. Это первая reasoning-модель компании, полностью разработанная с нуля: разреженная MoE-архитектура с 35 млрд активных и примерно 1 трлн общих параметров, а также контекстным окном 256K токенов. Microsoft делает ставку на производительность в математике и коде при существенно меньших затратах на инференс. Однако результаты выглядят неоднозначно: в SWE-Bench Pro модель почти сравнялась с Claude Opus 4.6 — 52,8% против 53,4%, — но в Terminal-Bench 2.0 серьёзно отстаёт от GPT-5.4: 46,0% против 75,1%. При этом точные цены за токены Microsoft до сих пор не опубликовала, хотя не раз обещала уровень «mid-weight price».
Что представляет собой MAI-Thinking-1
MAI-Thinking-1 — разреженная reasoning-модель типа Mixture-of-Experts, созданная полностью внутри Microsoft AI. Из примерно 1 трлн параметров в каждом запросе задействуются 35 млрд активных параметров. В техническом отчёте приведены более точные цифры для базовой модели: 34,7 млрд активных и 962 млрд общих параметров, 78 слоёв и восемь выбранных экспертов из 512 для каждого маршрутизируемого токена. Контекстное окно — 256 000 токенов, то есть приблизительно 600 страниц текста. Это тот же класс, что Claude Sonnet 4.6 и GPT-5.4.
По API модель поддерживает распространённый формат Chat Completions API, function calling, developer instructions и структурированный вывод. Поэтому код, рассчитанный на chat-эндпоинты OpenAI, можно адаптировать с минимальными изменениями. Модель работает только с текстом: ни входа, ни выхода для изображений, аудио или видео нет. Для этих модальностей Microsoft предлагает отдельные MAI-Image 2.5 и MAI-Voice 2.
Главным отличием Microsoft называет подход к обучению. Согласно технической статье, для претрейнинга использовано 30T токенов коммерчески лицензированных и публичных данных, созданных людьми, а на этапе mid-training — ещё 3,55T токенов. Обучение проходило на 8 000 GPU GB200, а RL-фаза — на 4 600 GB300. Microsoft утверждает, что модель обучалась без дистилляции сторонних моделей: синтетические данные, сгенерированные моделями других лабораторий, исключались.
Впервые модель анонсировали 2 июня 2026 года на Microsoft Build — как часть семейства MAI из семи моделей. До 12 августа 2026 года она оставалась в private preview.
Бенчмарки: реальная позиция модели
Наиболее полную картину дают результаты из технической статьи Microsoft. Все показатели MAI-Thinking-1 усреднены по четырём запускам при temperature 1 и top-p 0,97; для агентных задач по программированию использовался общий контекст длиной 256K. Данные по конкурентам взяты из официальных model card соответствующих моделей, а не из независимого воспроизведения тестов.
| Бенчмарк | MAI-Thinking-1 | Sonnet 4.6 | Opus 4.6 | GPT-5.4 | Kimi K2.6 | DeepSeek V4 | GLM-5.1 |
|---|---|---|---|---|---|---|---|
| AIME 2025 | 97,0 | 95,6 | 99,8 | — | — | — | — |
| AIME 2026 | 94,5 | — | — | — | 96,4 | — | 95,3 |
| GPQA Diamond | 84,2 | 89,9 | 91,3 | 92,8 | 90,5 | 90,1 | 85,2 |
| LiveCodeBench v6 | 87,7 | — | — | — | 89,6 | 93,5 | — |
| SWE-Bench Verified | 73,5 | 79,6 | 80,8 | — | 80,2 | 80,6 | — |
| SWE-Bench Pro | 52,8 | — | 53,4 | 57,7 | 58,6 | 55,4 | 58,4 |
| Terminal-Bench 2.0 | 46,0 | 59,1 | 65,4 | 75,1 | 66,7 | 67,9 | 69,0 |
Картина достаточно ясна. В чистой математике MAI-Thinking-1 действительно сильна: 97,0% в AIME 2025 выше, чем 95,6% у Sonnet 4.6, хотя до 99,8% Opus 4.6 модель не дотягивает. В AIME 2026 результат 94,5% уступает и Kimi K2.6 с 96,4%, и GLM-5.1 с 95,3%.
В агентном программировании отставание заметнее. В SWE-Bench Pro MAI-Thinking-1 набирает 52,8% — почти столько же, сколько Opus 4.6 с 53,4%; именно это сравнение особенно подчёркивает Microsoft. Но GPT-5.4 с 57,7%, Kimi K2.6 с 58,6%, DeepSeek V4 с 55,4% и GLM-5.1 с 58,4% находятся выше. В Terminal-Bench 2.0, измеряющем способность агента выполнять многошаговые задачи в терминале, MAI-Thinking-1 с 46,0% отстаёт от Sonnet 4.6 на 13 пунктов, а от GPT-5.4 — на 29 пунктов.
В самой технической статье признаётся, что модель «не лидирует в отрасли». MAI-Thinking-1 конкурентоспособна с учётом своих 35 млрд активных параметров, но не претендует на вершину общего рейтинга.
Дополнительные результаты из технической статьи в сравнении с Sonnet 4.6:
| Область | MAI-Thinking-1 | Sonnet 4.6 |
|---|---|---|
| MMLU-Pro | 85 | 87 |
| SimpleQA Verified | 31 | 29 |
| BFCL v3 (вызов инструментов) | 72 | 76 |
| CyberSecEval Instruct | 63 | 62 |
| GraphWalks (≤128K) | 90 | 96 |
Насколько MAI-Thinking-1 предпочтительнее Sonnet 4.6
Самый активно продвигаемый Microsoft результат — слепая попарная оценка людьми, проведённая профессиональными оценщиками Surge. В ней было 1 276 задач, из которых 30% — многоходовые. Техническая статья раскрывает точные показатели, которых нет в блоге к запуску:
В сравнении с Claude Sonnet 4.6:
- MAI-Thinking-1 побеждает в 49% случаев, ничья — 6%, проигрыш — 45%
- Общая разница предпочтений: +0,07 ± 0,06
- Наибольшее преимущество: краткость и релевантность (+0,11 ± 0,02), а также стиль и тон (+0,08 ± 0,02)
- По следованию инструкциям, фактической точности и полноте результаты статистически равны
В сравнении с Claude Opus 4.6:
- MAI-Thinking-1 побеждает в 43% случаев, ничья — 5%, проигрыш — 52%
- Общая разница предпочтений: -0,07 ± 0,06
В суммарной оценке MAI-Thinking-1 проходит порог «предпочтительнее» Sonnet, но преимущество +0,07 при доверительном интервале ±0,06 очень невелико. В сравнении с Opus модель явно проигрывает. Набор задач при этом смещён в сторону открытых вопросов и ответов, создания контента и суммаризации, а не тяжёлого кодинга и многошагового рассуждения — тех сценариев, где показатели MAI-Thinking-1 по бенчмаркам слабее всего.
На Reddit пользователи r/LocalLLaMA обсуждают, не стала ли MAI-Thinking-1 фактической заменой линейки Microsoft Phi, отмечая, что семейство не распространяется с открытыми весами. Важен и стратегический контекст: по данным Bloomberg, Microsoft начала заменять модели OpenAI и Anthropic на MAI в Excel и Outlook. Вероятно, реальная ценность MAI-Thinking-1 для Microsoft связана прежде всего с контролем затрат в собственных продуктах.
Цены и доступ: что известно на практике
Публичных тарифов MAI-Thinking-1 за токены нет. В анонсе, на странице модели и в техническом отчёте Microsoft использует качественные формулировки вроде «mid-weight price», «cost-efficient» и «smaller inference footprint», но не приводит ни одной суммы в долларах. Для тех, кто рассматривает модель для production, это главное препятствие.
Для ориентира — расценки сопоставимых reasoning-моделей (цены OpenAI, цены Google AI):
| Модель | Вход ($/1M токенов) | Выход ($/1M токенов) |
|---|---|---|
| OpenAI o3 | ~$10 | ~$40 |
| Gemini 2.5 Pro | ~$1,25 | ~$10 |
| Claude Sonnet 4.6* | ~$3 | ~$15 |
\*Цена Claude зависит от тарифа; указана приблизительная средняя величина по данным Anthropic pricing.
Позиционирование как «mid-weight» позволяет предположить, что MAI-Thinking-1 будет стоить где-то между Gemini 2.5 Pro и Claude Sonnet, но до публикации тарифа планировать бюджет можно лишь наугад.
Что касается доступа, MAI-Thinking-1 доступна в public preview через Microsoft Foundry; ссылка на playground есть на странице модели. В июньском анонсе были названы будущие партнёры по дистрибуции — OpenRouter, Fireworks AI и Baseten, — но на момент этого обзора ни один из них модель не предлагает. Веса закрыты: релиза на Hugging Face, формата GGUF и варианта самостоятельного хостинга нет.
Чтобы использовать MAI-Thinking-1 сейчас:
- Войдите в Microsoft Foundry с учётной записью Azure
- Откройте страницу модели MAI-Thinking-1 в Foundry
- Используйте playground для тестирования либо разверните модель через совместимый с Chat Completions эндпоинт
- Оплата проходит через подписку Azure; в период preview тарифы не раскрываются
Кому стоит попробовать MAI-Thinking-1 уже сейчас
Модель имеет смысл выбрать, если:
- Ваша команда уже работает в Azure или Microsoft Foundry и хочет получить reasoning-модель от первого поставщика с корпоративными средствами управления
- Основная нагрузка — математика, формальные рассуждения или задачи олимпиадного типа: результат 97% в AIME 2025 реален
- Организации важна чистая история происхождения данных с точки зрения комплаенса: заявление Microsoft об отсутствии дистилляции и лицензированных данных существенно для регулируемых отраслей
- Команда занимается ревью кода и анализом, где ценна более лаконичная подача модели, отмеченная в оценке людьми
Пока лучше пропустить модель, если вам нужны:
- Мультимодальные вход и выход — MAI-Thinking-1 работает только с текстом
- Длинные агентные задачи — 46% в Terminal-Bench 2.0 делают её неподходящей для автоматизации работы в терминале
- Самостоятельный хостинг или открытые веса — модель проприетарная и привязана к Foundry
- Предсказуемые затраты в production — без цен невозможно составить бюджет
- Топовая производительность кодового агента — Kimi K2.6, GPT-5.4 и DeepSeek V4 показывают более высокие результаты и в SWE-Bench Pro, и в Verified
FAQ
MAI-Thinking-1 — это open source?
Нет. Модель проприетарная, а её веса закрыты. Скачать веса нельзя, релиза на Hugging Face нет, как и возможности самостоятельного хостинга. Единственный способ доступа — Microsoft Foundry.
MAI-Thinking-1 используется в Copilot?
По данным Bloomberg, Microsoft начала заменять модели OpenAI и Anthropic моделями MAI в Excel и Outlook. Однако нет подтверждения, что именно MAI-Thinking-1 лежит в основе GitHub Copilot или Microsoft 365 Copilot для конечных пользователей.
MAI-Thinking-1 — преемник Microsoft Phi?
Microsoft не позиционирует её таким образом, но сообщество видит в MAI смену направления. Phi была линейкой небольших моделей Microsoft с открытыми весами. MAI — новое проприетарное семейство компании. Ключевое отличие в том, что MAI-Thinking-1 закрыта и крупнее: 35 млрд активных параметров против 3–14 млрд у Phi. Она ориентирована на корпоративное развёртывание, а не на локальный запуск.
Поддерживает ли MAI-Thinking-1 изображения, аудио или видео?
Нет. И на вход, и на выход модель принимает только текст. Для других модальностей Microsoft предлагает отдельные MAI-Image 2.5 для генерации изображений по тексту, MAI-Transcribe-1.5 для распознавания речи и MAI-Voice-2 для генерации речи.
Какова дата отсечения обучающих данных MAI-Thinking-1?
В model card указана дата отсечения — июль 2025 года. Однако из технического отчёта следует, что сбор источников продолжался до начала 2026 года: веб-HTML — до сентября 2025 года, веб-PDF — до декабря 2025 года, книги и журналы — до марта 2026 года. Это расхождение позволяет предположить, что указанная дата относится к окончанию сбора данных для post-training, а не ко времени получения всех источников.
Можно ли использовать MAI-Thinking-1 через OpenRouter?
Пока нет. При запуске 2 июня Microsoft назвала OpenRouter, Fireworks AI и Baseten будущими партнёрами по дистрибуции, но по состоянию на август 2026 года модель не доступна ни у одного из них. Единственный текущий вариант — public preview в Microsoft Foundry.
| Ваша задача | Что выбрать сегодня |
|---|---|
| Олимпиадная математика, формальные доказательства | MAI-Thinking-1 (97% AIME) или Claude Opus 4.6 (99,8%) |
| Агентное программирование, автоматизация терминала | GPT-5.4 (75,1% Terminal-Bench) или Kimi K2.6 (66,7%) |
| Ревью кода, поиск ошибок | Claude Sonnet 4.6 (79,6% SWE-Verified) или Opus 4.6 (80,8%) |
| Корпоративный reasoning в экосистеме Azure | MAI-Thinking-1 (модель первого поставщика, управление через Foundry) |
| Production при ограниченном бюджете | Gemini 2.5 Pro ($1.25/$10) |
| Самостоятельный хостинг или открытые веса | MAI не подходит; рассмотрите открытые веса DeepSeek V4 или Qwen3.8 |