Главное о Muse Spark 1.2
Meta выпустила Muse Spark 1.2 5 августа 2026 года — вместе с терминальным агентом Muse Code, созданным специально для этой модели. В программировании новинка заметно лучше версии 1.1, но во всех трёх профильных бенчмарках всё равно уступает Claude Opus 5. В этом и состоит суть релиза. Meta нарастила вычисления для обучения на задачах кодинга, совместно обучала модель с агентом Muse Code — и результаты выросли. Однако часть прироста между версиями объясняется новым окружением для запуска, а не только самой моделью: в Terminal-Bench, DeepSWE и внутренней оценке Meta решение Anthropic по-прежнему впереди на 4–9 пунктов.
Тем не менее Muse Spark 1.2 интересна ценой. Стандартные расценки остались на уровне $1.25/$4.25 за миллион токенов, а contributor-тариф снижает их ещё примерно в 12 раз. Но есть два важных условия: по умолчанию ваш код может использоваться Meta для обучения, а на максимальном уровне рассуждений время до первого токена выросло примерно девятикратно. Для оценки Muse Spark 1.2 в реальной разработке эти детали важнее позиции в рейтинге.
Что изменилось по сравнению с 1.1
Muse Spark 1.2 — обновление флагманской reasoning-модели Meta с фокусом на разработку, выпущенное 5 августа вместе с находящимся в бете терминальным агентом Muse Code. Сама Meta называет его «умеренным улучшением» относительно Muse Spark 1.1. Формулировка сдержанная, хотя обновление направлено именно на самые тяжёлые для кодовых агентов сценарии: рефакторинг нескольких файлов, длительную отладку и задачи, которые не помещаются в один промпт.
Прирост обеспечили два изменения в обучении. Во-первых, Muse Code с самого начала был включён в цикл обучения. Meta совместно обучала модель на траекториях harness, отобранных методом rejection sampling, чтобы она лучше всего работала в собственном агенте. Компания утверждает, что использовала несколько окружений, поэтому модель должна переносить навыки и на другие инструменты разработки. Во-вторых, Meta запустила цикл самоулучшения: Muse Spark 1.1 генерировала сложные среды для программирования и шаблоны следования инструкциям, затем оценивала решения-кандидаты. Так был сформирован датасет для версии 1.2. По словам Meta, именно этот цикл ощутимо улучшил выполнение сложных инструкций.
Обновление закрывает слабое место линейки Muse. Когда Muse Spark дебютировала в апреле 2026 года, в агентном программировании она отставала: 77.4 в SWE-Bench Verified против 80.8 у Claude Opus 4.6. Специализированный чекпойнт для кода в паре с целевым harness — прямой ответ на это отставание, при сохранении общих агентных способностей.
Как читать результаты бенчмарков
В Terminal-Bench 2.1 Muse Spark 1.2 в составе Muse Code набрала 82.9%: это выше, чем у GPT-5.6 Terra в Codex (81.8%) и Grok 4.5 в Grok Build (81.6%), но ниже Claude Opus 5 на максимальном effort в Claude Code — лидер получил 86.7%. В DeepSWE 1.1 результат составил 59.3%: третье место после Opus 5 (65.0%) и GPT-5.6 Terra (64.8%). Наиболее откровенной выглядит собственная внутренняя оценка Meta: 70.6% у Muse Spark 1.2 выше, чем у GPT-5.6 Terra (65.4%) и Gemini 3.6 Flash (63.9%), но почти на девять пунктов ниже 79.4% у Opus 5. Во всех трёх таблицах первое место занимает Claude.
Прогресс между поколениями действительно есть: Muse Spark 1.2 опережает 1.1 на 6.7 пункта в Terminal-Bench и на 6.3 — в DeepSWE. Но тем, кто сравнивает версии, стоит обратить внимание на подписи в графиках. Результаты 1.1 были получены в универсальном mini-swe-agent harness, а 1.2 запускалась в Muse Code. Поэтому часть прироста стоит отнести к новому окружению, а не только к модели. В сводном Intelligence Index от Artificial Analysis версия 1.2 набирает 54 балла и занимает 14-е место из 186 моделей при медиане по классу в 32. У 1.1 было 51 — это более скромный прирост, чем можно предположить по бенчмаркам кодинга.
Именно сравнение с Claude и GPT чаще всего интересует покупателей. Ещё до появления данных по 1.2 один разработчик на Reddit сформулировал вопрос так:
«Кто-нибудь пользовался MUSE Spark 1.1 от Meta? Интересно, как она соотносится с Claude и GPT по рассуждениям, кодингу, скорости, точности и работе с контекстом».
Бенчмарки версии 1.2 дают первый строгий ответ: модель конкурентоспособна, уверенно занимает второе место в кодинге и на большинстве графиков опережает варианты GPT-5.6 и Gemini.
Два ограничения для продакшена
При внедрении Muse Spark 1.2 решающими становятся две практические особенности — и ни одна не отражается в строчке лидерборда.
На xhigh резко выросла задержка
Muse Spark — reasoning-модель: перед ответом она рассуждает, и отключить этот процесс нельзя. Регулятор /effort предлагает пять уровней — от minimal до xhigh, а токены рассуждений оплачиваются как выходные. На верхнем уровне цена высока сразу в двух смыслах. Независимые измерения OrcaRouter показывают, что при xhigh время до первого токена выросло с 2.90 секунды у 1.1 до 26.12 секунды — примерно в девять раз, а скорость генерации упала с 213.5 до 165.0 токенов в секунду. Прогон оценки Artificial Analysis Intelligence Index на версии 1.2 обошёлся в $637.85 — на 16% больше, чем $548.07 у 1.1, исключительно потому, что модель стала дольше обдумывать ответ. В интерактивной разработке, когда человек ждёт ответа, максимальный effort часто даёт слишком дорогой по задержке выигрыш в точности.
Contributor-тариф: скидка в обмен на ваш код
У Meta для Muse Spark 1.2 два тарифа, и тот, на который она направляет новых пользователей, имеет важное условие. Contributor-тариф ($0.10/$0.20 за миллион входных/выходных токенов вместо $1.25/$4.25 на standard) примерно в 12 раз дешевле по входным токенам и в 21 раз — по выходным; кэшированный ввод почти бесплатен — $0.002. В обмен вы явно разрешаете Meta использовать ваши промпты и ответы для обучения будущих моделей. Это самая низкая цена в приведённом сравнении, но платите вы за неё данными.
Именно на этот тариф по умолчанию ведёт стартовая настройка Muse Code. В тесте VentureBeat однострочный установщик сработал на Mac mini — загрузка 97 MB и вход в аккаунт, — но агент не смог ничего запустить: он сообщил об отсутствии доступных моделей и запросил способ оплаты даже на льготном тарифе. Низкая стоимость — верное описание; бесплатным сервис не является. Лимиты здесь тоже строже: 60 запросов в минуту против 3,000 на standard. Это явный признак тарифа для индивидуальных пользователей и прототипирования, а не продакшена. Командам с закрытыми кодовыми базами следует осознанно перейти на standard или запросить у отдела продаж Meta нулевое хранение данных.
Цена на фоне конкурентов
Стандартный тариф Muse Spark 1.2 ($1.25 за миллион входных токенов, $0.15 за кэшированные, $4.25 за выходные, контекстное окно 1M токенов, без надбавки за длинный контекст) находится в нижней части среднего ценового сегмента среди моделей для программирования. Модель заметно дешевле лидеров: Claude Opus 5 за $5/$25 и GPT-5.5 за $5/$30 стоят примерно в 4–7 раз дороже по выходным токенам. По цене она почти совпадает с Z.ai GLM-5.2 за $1.40/$4.40 и дешевле Grok 4.5 за $2/$6. На самом бюджетном конце DeepSeek V4 Pro с $0.435/$0.87 обходит её в несколько раз — как и contributor-тариф самой Muse Spark.
| Модель | Ввод $/M | Вывод $/M | Кэш $/M | Контекст |
|---|---|---|---|---|
| Muse Spark 1.2 (standard) | 1.25 | 4.25 | 0.15 | 1M |
| Muse Spark 1.2 (contributor)* | 0.10 | 0.20 | 0.002 | 1M |
| Claude Opus 5 | 5.00 | 25.00 | — | — |
| GPT-5.5 | 5.00 | 30.00 | — | — |
| GLM-5.2 | 1.40 | 4.40 | — | — |
| Grok 4.5 | 2.00 | 6.00 | — | — |
| DeepSeek V4 Pro | 0.435 | 0.87 | — | — |
\*тариф contributor даёт Meta право обучаться на ваших данных; лимит 60 запросов/мин.
Где модель доступна и что выбрать уже сейчас
Muse Spark 1.2 доступна в трёх местах: через Meta Model API, терминальный агент Muse Code и OpenRouter. На всех агрегаторах её пока нет: в каталоге AIReiter, проверенном 6 августа 2026 года, модели нет. Если ваша инфраструктура построена на едином API и модель для кода нужна сегодня, выбирать придётся из уже подключённых вариантов.
Ближайший по ценовому уровню вариант, доступный сейчас, — GLM-5.2 за $1.40/$4.40. 6 августа 2026 года я запустил через glm-5.2 одноразовую задачу на рассуждение при кодинге, направив её через API платформы, чтобы проверить, что даёт вариант «доступный сегодня»: в Python-функции снятия средств отсутствовала проверка овердрафта. GLM-5.2 ответила за 3.2 секунды (85 токенов промпта, 128 токенов ответа), верно нашла отсутствие проверки баланса, предложила исправление (if amount > 0 and account_balance >= amount:) и написала тест, который падает до исправления и проходит после него. Это одна задача, а не бенчмарк, но перед нами рабочая модель для кода в том же ценовом диапазоне, которую можно вызвать уже сейчас. Список доступных в каталоге AIReiter вариантов для программирования также дополняют DeepSeek V4 Pro, Kimi K3, Claude Sonnet 5 и семейство GPT-5.6.
Стоит ли использовать Muse Spark 1.2?
Выбор зависит от того, что именно для вас важнее.
Выбирайте Muse Spark 1.2, если вам нужна масштабная и чувствительная к цене работа с кодом: крупный рефакторинг нескольких файлов, долгая отладка, агентные задачи с длинным горизонтом — и вы готовы работать с Meta, Muse Code или OpenRouter напрямую. За $1.25/$4.25 модель даёт возможности программирования уровня флагманских решений при цене среднего сегмента, а окно 1M токенов и сжатие контекста подходят для задач длиннее одного промпта. Не поднимайте effort до xhigh, если задача не допускает 26 секунд ожидания первого токена.
Выбирайте Claude Opus 5, если вам нужен максимум в бенчмарках программирования. Она лидирует во всех трёх оценках, где представлена Muse Spark 1.2. За преимущество в точности придётся заплатить в 4–6 раз больше за токен.
Выбирайте модель, уже доступную в вашем агрегаторе, если релиз нужно отправлять сегодня, а Muse Spark на вашей платформе ещё нет. GLM-5.2 предлагает тот же ценовой уровень без ожидания; DeepSeek V4 Pro стоит ещё дешевле, когда главный критерий — минимальная цена.
FAQ
Muse Spark 1.2 лучше Claude Opus 5 в программировании?
Нет. Claude Opus 5 лидирует во всех трёх опубликованных Meta бенчмарках программирования — Terminal-Bench 2.1, DeepSWE 1.1 и внутренней оценке Meta — с отрывом от 3.8 до 9 пунктов. Muse Spark 1.2 уверенно занимает второе место и на большинстве графиков опережает GPT-5.6 Terra и Gemini 3.6 Flash.
Muse Spark 1.2 — open source?
Нет. В отличие от семейства Llama от Meta, Muse Spark — проприетарная модель: только облачный доступ, без загружаемых весов и самостоятельного хостинга. Марк Цукерберг говорил, что ему «будет чем поделиться» о возможных релизах open source, однако версия 1.2 поставляется без весов и лицензии.