Claude Mythos против Claude Opus 4.8: проверенные бенчмарки

Последнее обновление: 2026-07-15 02:18:44

Anthropic опубликовала ровно три бенчмарка, которые напрямую сравнивают её модель класса Mythos с Claude Opus 4.8: SWE-Bench Pro (80.3% vs 69.2%), FrontierCode от Cognition (29.3% vs 13.4%) и ExploitBench (78% vs 40%). Все остальные цифры, связанные с «Claude Mythos vs Claude Opus», которые циркулируют в сети — оценки Humanity's Last Exam, GPQA, AIME или версии Opus, отличные от 4.8 — отсутствуют в релизе Anthropic. Часть из них попросту выдумана; часть сопоставляет текущую модель Mythos с версией Opus, которая на целое поколение отстаёт.

Есть и второе усложнение: почти никто из тех, кто сравнивает Mythos и Opus 4.8 бок о бок, на самом деле не запускает Mythos. Модель, которую большинство получает при обращении к API класса Mythos, — это Fable 5, которая незаметно перенаправляет запрос на Opus 4.8 в тот момент, когда запрос затрагивает кибербезопасность, биологию или несколько других помеченных областей. Поэтому многие прямые сравнения «Mythos против Opus» на деле, сам того не осознавая автор, — это Opus 4.8 против самого себя.

Три бенчмарка, которые Anthropic действительно опубликовала

Июньский запуск Anthropic 9, 2026 года Fable 5 и Mythos 5 включал таблицу бенчмарков, сравнивающую базовую модель класса Mythos с Claude Opus 4.8. Три результата последовательно фигурируют как в собственном релизе Anthropic, так и в независимых источниках, которые напрямую его цитируют, включая разборы этого же релиза от The Decoder и Vellum:

БенчмаркMythos-classClaude Opus 4.8
SWE-Bench Pro (реальное решение проблем GitHub)80.3%69.2%
FrontierCode от Cognition29.3%13.4%
ExploitBench (задачи наступательной безопасности)78%40%

Разрыв SWE-Bench Pro, 11,1 пункта, — это самый цитируемый показатель, если вы решаете, стоит ли гнаться за рассуждениями уровня Mythos для задач программирования. Оценка ExploitBench — та, которая меньше всего важна для типичных покупателей: она измеряет сырую способность базовой модели до того, как подключаются классификаторы безопасности Fable 5, и в продакшене Fable 5 показывает близкие к 0% результаты на киберзадачах, потому что классификатор перенаправляет их на Opus 4.8 до того, как эта способность вообще становится доступной.

Ни один опубликованный Anthropic показатель не сравнивает Mythos-class и Opus 4.8 по Humanity's Last Exam, GPQA Diamond, AIME или Terminal-Bench друг с другом. Если вы видите таблицу, где эти бенчмарки заполнены для обеих моделей, спросите, откуда взяты данные — на момент написания этого текста это не от Anthropic.

Повторяющиеся оценки, которые Anthropic не опубликовала

Поиск по запросу "Claude Mythos vs Claude Opus" выдаёт несколько сайтов с подробными таблицами бенчмарков именно для этого сравнения. Сверка их с релизом Anthropic выявляет две отдельные проблемы, а не одну:

Числа без прослеживаемого источника. В сравнении Benchlm Mythos 5 с Opus 4.6 указан результат по математическому бенчмарку 97.6% для Mythos против 36.3% для Opus — разница в 61 пункт на бенчмарке, который ни в публичных материалах ни одной из моделей не упоминается под таким названием. Ни одна из этих цифр не фигурирует в объявлении Anthropic, в независимых обзорах The Decoder или Vellum по этому поводу, а также ни в одной системной карточке Opus 4.8.

Реальные числа, не тот соперник. На той же странице Benchlm правильно указан собственный показатель SWE-Bench Pro для Mythos-class — 80.3%, что совпадает с реальной цифрой Anthropic, но его сопоставляют с 53.4% у Claude Opus 4.6 вместо 69.2% у Opus 4.8. Opus 4.6 предшествует запуску Fable 5/Mythos 5 на несколько циклов релизов, поэтому сопоставление его с более новым показателем Mythos искусственно создаёт разрыв в 27 пунктов, тогда как сравнение для текущего поколения показывает 11.

Ни один из этих вариантов не делает лежащее в основе утверждение — что рассуждения класса Mythos превосходят Opus 4.8 в задачах программирования и agentic-задачах — ложным. Разрыв в 11 пунктов по SWE-Bench Pro реален. Но разрыв в 11 пунктов и искусственно созданный разрыв в 44 пункта приводят к разным выводам о том, насколько Mythos на самом деле лучше, и только одно из этих чисел исходило от Anthropic.

Почему большинство людей, задающих этот вопрос, не могут проверить это сами

Вот что не отражают таблицы бенчмарков: Mythos 5 — это не модель, к которой можно обратиться через вызов. Anthropic поставляет её только партнёрам Project Glasswing — киберзащитникам правительства США — а программа доверенного доступа открывается для организаций в сфере кибербезопасности и, отдельно, для биомедицинских исследователей. Здесь нет страницы с ценами, формы регистрации и API key, который можно сгенерировать, чтобы провести собственное сравнение SWE-Bench Pro.

В общем доступе находится Fable 5: те же базовые веса класса Mythos, со средствами безопасности, которые отслеживают каждый запрос на наличие контента, связанного с кибербезопасностью, биологией/химией или дистилляцией модели. Когда запрос срабатывает на один из этих классификаторов, Fable 5 в середине диалога передаёт его Opus 4.8, сообщает вам об этом и выставляет счёт за перенаправленную часть по более низкой ставке Opus 4.8 за токен. По собственным данным Anthropic, срабатывание триггера происходит менее чем в 5% сессий. Для остальных более чем 95% случаев то, что вы получаете, вызывая Fable 5, — это действительно результаты бенчмарков класса Mythos, указанные выше; для отмеченного меньшинства вы снова тестируете Opus 4.8 против самого себя.

Вот почему так много обзоров «Mythos vs Opus» звучат расплывчато («Mythos явно лучше справляется со сложными многоэтапными задачами»), а не опираются на бенчмарки: у большинства авторов просто не было Mythos, чтобы его тестировать. Они либо повторяют собственные данные Anthropic из релиза, либо повторяют чужие цифры без источников, либо описывают Fable 5 и называют его Mythos.

Так какой же из них вам действительно следует использовать

Если ваша работа — это общая разработка ПО, написание текстов или анализ, то на практике выбор стоит не между Mythos и Opus 4.8 — а между Fable 5 и Opus 4.8, поскольку Fable 5 — это самое близкое к возможностям класса Mythos, что реально можно получить. Fable 5 и Opus 4.8 имеют разную цену ($10/$50 против $5/$25 за миллион токенов), поэтому разрыв в 11 пунктов по SWE-Bench Pro должен оправдывать примерно двойную стоимость, чтобы Fable 5 был выгоден для чувствительных к цене рабочих нагрузок. Для команд, которые уже распределяют задачи между уровнями Claude в зависимости от сложности, это решение принимается для каждой задачи отдельно, а не разом для всего, и это та же логика маршрутизации, которую API aggregator обрабатывает автоматически, а не выбирает один уровень для всего.

Если ваша работа связана с исследованием безопасности, разработкой эксплойтов или биомедицинскими исследованиями в рамках легитимного институционального кейса, то важна разница в ExploitBench (78% против 40%, при измерении не заблокированной модели), и следующий реальный шаг — подать заявку на программу доверенного доступа Anthropic, а не искать поставщика, утверждающего, что перепродаёт доступ Mythos, которого не существует как доступного для покупки продукта.

Для полного разбора того, как Fable 5 и Mythos 5 соотносятся друг с другом — одна и та же модель, разные настройки безопасности и что это стоит вам на практике — см. Fable 5 vs Mythos 5.

Часто задаваемые вопросы

Является ли Claude Mythos более мощным, чем Claude Opus 4.8?

На трёх бенчмарках, которые Anthropic опубликовала в прямом сравнении — SWE-Bench Pro, FrontierCode от Cognition и ExploitBench — да, на 11–38 пунктов, в зависимости от бенчмарка. Утверждения сверх этих трёх бенчмарков, включая Humanity's Last Exam или результаты GPQA для этого сравнения, не подтверждены ничем из опубликованного Anthropic.

Могу ли я действительно самостоятельно протестировать Claude Mythos против Opus 4.8?

Не напрямую. Mythos 5 ограничен правительственными партнерами по киберобороне Project Glasswing и небольшой программой доверенного доступа. Что вы можете протестировать, так это Fable 5, которая использует те же базовые веса и обеспечивает выход уровня Mythos примерно в 95% сеансов, а в остальных случаях перенаправляет на Opus 4.8.

Почему на некоторых сайтах отображаются разные оценки Mythos и Opus?

Встречаются две повторяющиеся причины: числа без прослеживаемого источника, которые не фигурируют в релизе Anthropic, и реальные оценки класса Mythos, сопоставленные с более старой версией Opus (4.6 вместо 4.8), что завышает видимый разрыв.

В чем на самом деле разница между Fable 5 и Mythos 5?

Это одна и та же модель. Fable 5 запускает классификаторы безопасности, которые перенаправляют запросы, связанные с кибербезопасностью, биологией и дистилляцией, в Opus 4.8; в Mythos 5 эти меры защиты сняты, но доступ ограничен проверенными партнёрами. См. Fable 5 vs Mythos 5 для полного разбора.

Opus 4.8 дешевле, чем модели класса Mythos?

Да. Opus 4.8 стоит $5/$25 за миллион входных/выходных токенов, в отличие от $10/$50 у Fable 5 и Mythos 5. Для нагрузок, которым не нужны улучшения SWE-Bench Pro или FrontierCode, Opus 4.8 — более доступный вариант, без необходимости беспокоиться о перенаправлениях классификатора.

Итог

Три опубликованных Anthropic бенчмарка показывают, что рассуждения класса Mythos опережают Opus 4.8 на реальное, умеренное значение. Всё, что выходит за рамки этих трёх чисел — а также большая часть того, что подпитывает заголовки вроде «Mythos разносит Opus» — либо не имеет источника, либо сравнивается с устаревшей версией Opus. И если вы не являетесь проверенным партнёром в сфере киберзащиты или биомедицины, модель, с которой вы на самом деле тестировали бы Opus 4.8, — это Fable 5, а не сам Mythos 5.

Источники