AIREITER

Обзор MAI-Thinking-1: первая reasoning-модель Microsoft (2026)

Последнее обновление: 2026-08-13 07:41:32

12 августа 2026 года Microsoft вывела MAI-Thinking-1 в public preview на Microsoft Foundry. Это первая reasoning-модель компании, полностью разработанная с нуля: разреженная MoE-архитектура с 35 млрд активных и примерно 1 трлн общих параметров, а также контекстным окном 256K токенов. Microsoft делает ставку на производительность в математике и коде при существенно меньших затратах на инференс. Однако результаты выглядят неоднозначно: в SWE-Bench Pro модель почти сравнялась с Claude Opus 4.6 — 52,8% против 53,4%, — но в Terminal-Bench 2.0 серьёзно отстаёт от GPT-5.4: 46,0% против 75,1%. При этом точные цены за токены Microsoft до сих пор не опубликовала, хотя не раз обещала уровень «mid-weight price».

Что представляет собой MAI-Thinking-1

MAI-Thinking-1 — разреженная reasoning-модель типа Mixture-of-Experts, созданная полностью внутри Microsoft AI. Из примерно 1 трлн параметров в каждом запросе задействуются 35 млрд активных параметров. В техническом отчёте приведены более точные цифры для базовой модели: 34,7 млрд активных и 962 млрд общих параметров, 78 слоёв и восемь выбранных экспертов из 512 для каждого маршрутизируемого токена. Контекстное окно — 256 000 токенов, то есть приблизительно 600 страниц текста. Это тот же класс, что Claude Sonnet 4.6 и GPT-5.4.

По API модель поддерживает распространённый формат Chat Completions API, function calling, developer instructions и структурированный вывод. Поэтому код, рассчитанный на chat-эндпоинты OpenAI, можно адаптировать с минимальными изменениями. Модель работает только с текстом: ни входа, ни выхода для изображений, аудио или видео нет. Для этих модальностей Microsoft предлагает отдельные MAI-Image 2.5 и MAI-Voice 2.

Главным отличием Microsoft называет подход к обучению. Согласно технической статье, для претрейнинга использовано 30T токенов коммерчески лицензированных и публичных данных, созданных людьми, а на этапе mid-training — ещё 3,55T токенов. Обучение проходило на 8 000 GPU GB200, а RL-фаза — на 4 600 GB300. Microsoft утверждает, что модель обучалась без дистилляции сторонних моделей: синтетические данные, сгенерированные моделями других лабораторий, исключались.

Впервые модель анонсировали 2 июня 2026 года на Microsoft Build — как часть семейства MAI из семи моделей. До 12 августа 2026 года она оставалась в private preview.

Бенчмарки: реальная позиция модели

Наиболее полную картину дают результаты из технической статьи Microsoft. Все показатели MAI-Thinking-1 усреднены по четырём запускам при temperature 1 и top-p 0,97; для агентных задач по программированию использовался общий контекст длиной 256K. Данные по конкурентам взяты из официальных model card соответствующих моделей, а не из независимого воспроизведения тестов.

БенчмаркMAI-Thinking-1Sonnet 4.6Opus 4.6GPT-5.4Kimi K2.6DeepSeek V4GLM-5.1
AIME 202597,095,699,8————
AIME 202694,5———96,4—95,3
GPQA Diamond84,289,991,392,890,590,185,2
LiveCodeBench v687,7———89,693,5—
SWE-Bench Verified73,579,680,8—80,280,6—
SWE-Bench Pro52,8—53,457,758,655,458,4
Terminal-Bench 2.046,059,165,475,166,767,969,0

Картина достаточно ясна. В чистой математике MAI-Thinking-1 действительно сильна: 97,0% в AIME 2025 выше, чем 95,6% у Sonnet 4.6, хотя до 99,8% Opus 4.6 модель не дотягивает. В AIME 2026 результат 94,5% уступает и Kimi K2.6 с 96,4%, и GLM-5.1 с 95,3%.

В агентном программировании отставание заметнее. В SWE-Bench Pro MAI-Thinking-1 набирает 52,8% — почти столько же, сколько Opus 4.6 с 53,4%; именно это сравнение особенно подчёркивает Microsoft. Но GPT-5.4 с 57,7%, Kimi K2.6 с 58,6%, DeepSeek V4 с 55,4% и GLM-5.1 с 58,4% находятся выше. В Terminal-Bench 2.0, измеряющем способность агента выполнять многошаговые задачи в терминале, MAI-Thinking-1 с 46,0% отстаёт от Sonnet 4.6 на 13 пунктов, а от GPT-5.4 — на 29 пунктов.

В самой технической статье признаётся, что модель «не лидирует в отрасли». MAI-Thinking-1 конкурентоспособна с учётом своих 35 млрд активных параметров, но не претендует на вершину общего рейтинга.

Дополнительные результаты из технической статьи в сравнении с Sonnet 4.6:

ОбластьMAI-Thinking-1Sonnet 4.6
MMLU-Pro8587
SimpleQA Verified3129
BFCL v3 (вызов инструментов)7276
CyberSecEval Instruct6362
GraphWalks (≤128K)9096

Насколько MAI-Thinking-1 предпочтительнее Sonnet 4.6

Самый активно продвигаемый Microsoft результат — слепая попарная оценка людьми, проведённая профессиональными оценщиками Surge. В ней было 1 276 задач, из которых 30% — многоходовые. Техническая статья раскрывает точные показатели, которых нет в блоге к запуску:

В сравнении с Claude Sonnet 4.6:

  • MAI-Thinking-1 побеждает в 49% случаев, ничья — 6%, проигрыш — 45%
  • Общая разница предпочтений: +0,07 ± 0,06
  • Наибольшее преимущество: краткость и релевантность (+0,11 ± 0,02), а также стиль и тон (+0,08 ± 0,02)
  • По следованию инструкциям, фактической точности и полноте результаты статистически равны

В сравнении с Claude Opus 4.6:

  • MAI-Thinking-1 побеждает в 43% случаев, ничья — 5%, проигрыш — 52%
  • Общая разница предпочтений: -0,07 ± 0,06

В суммарной оценке MAI-Thinking-1 проходит порог «предпочтительнее» Sonnet, но преимущество +0,07 при доверительном интервале ±0,06 очень невелико. В сравнении с Opus модель явно проигрывает. Набор задач при этом смещён в сторону открытых вопросов и ответов, создания контента и суммаризации, а не тяжёлого кодинга и многошагового рассуждения — тех сценариев, где показатели MAI-Thinking-1 по бенчмаркам слабее всего.

На Reddit пользователи r/LocalLLaMA обсуждают, не стала ли MAI-Thinking-1 фактической заменой линейки Microsoft Phi, отмечая, что семейство не распространяется с открытыми весами. Важен и стратегический контекст: по данным Bloomberg, Microsoft начала заменять модели OpenAI и Anthropic на MAI в Excel и Outlook. Вероятно, реальная ценность MAI-Thinking-1 для Microsoft связана прежде всего с контролем затрат в собственных продуктах.

Цены и доступ: что известно на практике

Публичных тарифов MAI-Thinking-1 за токены нет. В анонсе, на странице модели и в техническом отчёте Microsoft использует качественные формулировки вроде «mid-weight price», «cost-efficient» и «smaller inference footprint», но не приводит ни одной суммы в долларах. Для тех, кто рассматривает модель для production, это главное препятствие.

Для ориентира — расценки сопоставимых reasoning-моделей (цены OpenAI, цены Google AI):

МодельВход ($/1M токенов)Выход ($/1M токенов)
OpenAI o3~$10~$40
Gemini 2.5 Pro~$1,25~$10
Claude Sonnet 4.6*~$3~$15

\*Цена Claude зависит от тарифа; указана приблизительная средняя величина по данным Anthropic pricing.

Позиционирование как «mid-weight» позволяет предположить, что MAI-Thinking-1 будет стоить где-то между Gemini 2.5 Pro и Claude Sonnet, но до публикации тарифа планировать бюджет можно лишь наугад.

Что касается доступа, MAI-Thinking-1 доступна в public preview через Microsoft Foundry; ссылка на playground есть на странице модели. В июньском анонсе были названы будущие партнёры по дистрибуции — OpenRouter, Fireworks AI и Baseten, — но на момент этого обзора ни один из них модель не предлагает. Веса закрыты: релиза на Hugging Face, формата GGUF и варианта самостоятельного хостинга нет.

Страница модели MAI-Thinking-1 на Microsoft AI

Чтобы использовать MAI-Thinking-1 сейчас:

  1. Войдите в Microsoft Foundry с учётной записью Azure
  2. Откройте страницу модели MAI-Thinking-1 в Foundry
  3. Используйте playground для тестирования либо разверните модель через совместимый с Chat Completions эндпоинт
  4. Оплата проходит через подписку Azure; в период preview тарифы не раскрываются

Кому стоит попробовать MAI-Thinking-1 уже сейчас

Модель имеет смысл выбрать, если:

  • Ваша команда уже работает в Azure или Microsoft Foundry и хочет получить reasoning-модель от первого поставщика с корпоративными средствами управления
  • Основная нагрузка — математика, формальные рассуждения или задачи олимпиадного типа: результат 97% в AIME 2025 реален
  • Организации важна чистая история происхождения данных с точки зрения комплаенса: заявление Microsoft об отсутствии дистилляции и лицензированных данных существенно для регулируемых отраслей
  • Команда занимается ревью кода и анализом, где ценна более лаконичная подача модели, отмеченная в оценке людьми

Пока лучше пропустить модель, если вам нужны:

  • Мультимодальные вход и выход — MAI-Thinking-1 работает только с текстом
  • Длинные агентные задачи — 46% в Terminal-Bench 2.0 делают её неподходящей для автоматизации работы в терминале
  • Самостоятельный хостинг или открытые веса — модель проприетарная и привязана к Foundry
  • Предсказуемые затраты в production — без цен невозможно составить бюджет
  • Топовая производительность кодового агента — Kimi K2.6, GPT-5.4 и DeepSeek V4 показывают более высокие результаты и в SWE-Bench Pro, и в Verified

FAQ

MAI-Thinking-1 — это open source?

Нет. Модель проприетарная, а её веса закрыты. Скачать веса нельзя, релиза на Hugging Face нет, как и возможности самостоятельного хостинга. Единственный способ доступа — Microsoft Foundry.

MAI-Thinking-1 используется в Copilot?

По данным Bloomberg, Microsoft начала заменять модели OpenAI и Anthropic моделями MAI в Excel и Outlook. Однако нет подтверждения, что именно MAI-Thinking-1 лежит в основе GitHub Copilot или Microsoft 365 Copilot для конечных пользователей.

MAI-Thinking-1 — преемник Microsoft Phi?

Microsoft не позиционирует её таким образом, но сообщество видит в MAI смену направления. Phi была линейкой небольших моделей Microsoft с открытыми весами. MAI — новое проприетарное семейство компании. Ключевое отличие в том, что MAI-Thinking-1 закрыта и крупнее: 35 млрд активных параметров против 3–14 млрд у Phi. Она ориентирована на корпоративное развёртывание, а не на локальный запуск.

Поддерживает ли MAI-Thinking-1 изображения, аудио или видео?

Нет. И на вход, и на выход модель принимает только текст. Для других модальностей Microsoft предлагает отдельные MAI-Image 2.5 для генерации изображений по тексту, MAI-Transcribe-1.5 для распознавания речи и MAI-Voice-2 для генерации речи.

Какова дата отсечения обучающих данных MAI-Thinking-1?

В model card указана дата отсечения — июль 2025 года. Однако из технического отчёта следует, что сбор источников продолжался до начала 2026 года: веб-HTML — до сентября 2025 года, веб-PDF — до декабря 2025 года, книги и журналы — до марта 2026 года. Это расхождение позволяет предположить, что указанная дата относится к окончанию сбора данных для post-training, а не ко времени получения всех источников.

Можно ли использовать MAI-Thinking-1 через OpenRouter?

Пока нет. При запуске 2 июня Microsoft назвала OpenRouter, Fireworks AI и Baseten будущими партнёрами по дистрибуции, но по состоянию на август 2026 года модель не доступна ни у одного из них. Единственный текущий вариант — public preview в Microsoft Foundry.

Ваша задачаЧто выбрать сегодня
Олимпиадная математика, формальные доказательстваMAI-Thinking-1 (97% AIME) или Claude Opus 4.6 (99,8%)
Агентное программирование, автоматизация терминалаGPT-5.4 (75,1% Terminal-Bench) или Kimi K2.6 (66,7%)
Ревью кода, поиск ошибокClaude Sonnet 4.6 (79,6% SWE-Verified) или Opus 4.6 (80,8%)
Корпоративный reasoning в экосистеме AzureMAI-Thinking-1 (модель первого поставщика, управление через Foundry)
Production при ограниченном бюджетеGemini 2.5 Pro ($1.25/$10)
Самостоятельный хостинг или открытые весаMAI не подходит; рассмотрите открытые веса DeepSeek V4 или Qwen3.8