A Anthropic publicou exatamente três benchmarks que comparam diretamente seu modelo da classe Mythos com o Claude Opus 4.8: SWE-Bench Pro (80,3% vs 69,2%), FrontierCode da Cognition (29,3% vs 13,4%) e ExploitBench (78% vs 40%). Todo e qualquer outro número associado a "Claude Mythos vs Claude Opus" que circula online — pontuações do Humanity's Last Exam, GPQA, AIME ou versões do Opus diferentes da 4.8 — não consta no comunicado da Anthropic. Parte disso é inventada do zero; parte disso compara o modelo Mythos atual com uma versão do Opus que está uma geração inteira atrás.
Há uma segunda complicação: quase ninguém que compara Mythos e Opus 4.8 lado a lado está usando o Mythos. O modelo que a maioria das pessoas obtém quando chama a API da classe Mythos é o Fable 5, que redireciona silenciosamente para o Opus 4.8 no momento em que uma solicitação toca em cibersegurança, biologia ou em alguns outros domínios sinalizados. Então, muitos confrontos diretos de "Mythos vs Opus" são, sem que o autor perceba, Opus 4.8 contra si mesmo.
Os três benchmarks que a Anthropic realmente publicou
O lançamento do Fable 5 e Mythos 5 pela Anthropic em 9 de junho de 2026 incluiu uma tabela de benchmarks comparando o modelo subjacente da classe Mythos com o Claude Opus 4.8. Três resultados aparecem de forma consistente tanto no próprio comunicado da Anthropic quanto em veículos independentes que o citam diretamente, incluindo as análises da The Decoder e da Vellum sobre o mesmo lançamento:
| Benchmark | Mythos-class | Claude Opus 4.8 |
|---|---|---|
| SWE-Bench Pro (resolução real de issue no GitHub) | 80.3% | 69.2% |
| FrontierCode da Cognition | 29.3% | 13.4% |
| ExploitBench (tarefas de segurança ofensiva) | 78% | 40% |
A diferença no SWE-Bench Pro, de 11,1 pontos, é o número mais citável se você estiver decidindo se o raciocínio da classe Mythos vale a pena ser buscado para trabalho de programação. A pontuação do ExploitBench é a que menos importa para compradores típicos: ela mede a capacidade bruta do modelo subjacente antes que os classificadores de segurança do Fable 5 entrem em ação e, na produção, o Fable 5 obtém algo próximo de 0% em tarefas de cibersegurança porque o classificador as redireciona para o Opus 4.8 antes que essa capacidade chegue a ser exposta.
Nenhum número publicado pela Anthropic coloca Mythos-class e Opus 4.8 no Humanity's Last Exam, GPQA Diamond, AIME ou Terminal-Bench um contra o outro. Se você vir uma tabela com esses benchmarks preenchidos para ambos os modelos, pergunte de onde ela foi obtida — até o momento desta escrita, ela não vem da Anthropic.
As pontuações repetidas que a Anthropic não publicou
Pesquisar por "Claude Mythos vs Claude Opus" revela vários sites com tabelas detalhadas de benchmark exatamente para esse confronto. Ao compará-los com o lançamento da Anthropic, surgem dois problemas separados, não apenas um:
Números sem fonte rastreável. A comparação entre Mythos 5 e Opus 4.6 da Benchlm lista uma pontuação de benchmark de Matemática de 97,6% para o Mythos contra 36,3% para o Opus — uma diferença de 61 pontos em um benchmark que os materiais públicos de nenhum dos modelos mencionam por esse nome. Nenhuma das duas cifras aparece no anúncio da Anthropic, nas análises independentes do The Decoder ou da Vellum sobre ele, ou em qualquer system card do Opus 4.8.
Números reais, oponente errado. A mesma página do Benchlm acerta a própria pontuação SWE-Bench Pro da Mythos-class, 80,3%, correspondendo ao número real da Anthropic, mas a compara com os 53,4% do Claude Opus 4.6 em vez dos 69,2% do Opus 4.8. O Opus 4.6 antecede o lançamento do Fable 5/Mythos 5 por vários ciclos de lançamento, então compará-lo com a pontuação mais recente da Mythos fabrica uma diferença de 27 pontos, quando a comparação da geração atual mostra 11.
Nenhum dos padrões torna falsa a alegação subjacente — de que o raciocínio da classe Mythos supera o Opus 4.8 em tarefas de codificação e agentic —. A diferença de 11 pontos no SWE-Bench Pro é real. Mas uma diferença de 11 pontos e uma diferença fabricada de 44 pontos levam a conclusões diferentes sobre o quanto o Mythos realmente é melhor, e apenas um desses números veio da Anthropic.
Por que a maioria das pessoas que faz essa pergunta não consegue testá-la por conta própria
Aqui está a parte que as tabelas de benchmark deixam de fora: o Mythos 5 não é um modelo que você possa chamar. A Anthropic o disponibiliza apenas para parceiros do Project Glasswing — defensores cibernéticos do governo dos EUA — com um programa de acesso confiável abrindo para organizações de cibersegurança e, separadamente, pesquisadores biomédicos. Não há página de preços, formulário de cadastro nem chave de API que você possa gerar para executar sua própria comparação no SWE-Bench Pro.
O que está geralmente disponível é o Fable 5: os mesmos pesos subjacentes da classe Mythos, com classificadores de segurança que monitoram cada solicitação em busca de conteúdo de cibersegurança, biologia/química ou destilação de modelo. Quando uma solicitação aciona um desses classificadores, o Fable 5 a transfere para o Opus 4.8 no meio da conversa, informa que isso aconteceu e cobra a parte redirecionada pela taxa menor por token do Opus 4.8. Os próprios dados da Anthropic situam a taxa de acionamento abaixo de 5% das sessões. Para os outros 95% e mais, o que você obtém ao chamar o Fable 5 é de fato o desempenho de benchmark da classe Mythos acima; para a minoria sinalizada, você volta a testar o Opus 4.8 contra si mesmo.
É por isso que tantos textos sobre "Mythos vs Opus" soam vagos ("Mythos é claramente melhor em tarefas complexas e de várias etapas") em vez de baseados em benchmarks: a maioria dos autores nunca teve o Mythos para testar. Eles estão apenas repetindo os próprios números de lançamento da Anthropic, repetindo os números sem fonte uns dos outros ou descrevendo o Fable 5 e chamando-o de Mythos.
Então, qual você deve realmente usar
Se o seu trabalho é engenharia de software geral, escrita ou análise, a escolha prática não é Mythos vs Opus 4.8 — é Fable 5 vs Opus 4.8, já que Fable 5 é a coisa mais próxima da capacidade da classe Mythos que você realmente pode obter. Fable 5 e Opus 4.8 têm preços diferentes ($10/$50 vs $5/$25 por milhão de tokens), então a diferença de 11 pontos no SWE-Bench Pro precisa valer aproximadamente o dobro do custo para o Fable 5 compensar em cargas de trabalho sensíveis a preço. Para equipes que já alternam entre os níveis do Claude conforme a dificuldade da tarefa, essa é uma decisão por tarefa, e não uma decisão geral, e é a mesma lógica de roteamento que um agregador de API lida automaticamente, em vez de escolher um único nível para tudo.
Se seu trabalho é pesquisa de segurança, desenvolvimento de exploits ou pesquisa biomédica com um caso institucional legítimo, a diferença do ExploitBench (78% vs 40%, medindo o modelo sem bloqueio) é o número que importa, e o verdadeiro próximo passo é se candidatar ao programa de acesso confiável da Anthropic — não procurar um fornecedor que alegue revender acesso ao Mythos, que não existe como um produto comprável.
Para uma análise completa de como Fable 5 e Mythos 5 se relacionam entre si — mesmo modelo, configuração de segurança diferente, e o que isso custa na prática — veja Fable 5 vs Mythos 5.
Perguntas Frequentes
O Claude Mythos é mais poderoso do que o Claude Opus 4.8?
Nos três benchmarks que a Anthropic publicou em comparação direta — SWE-Bench Pro, FrontierCode da Cognition e ExploitBench — sim, por 11 a 38 pontos, dependendo do benchmark. Alegações além desses três benchmarks, incluindo Humanity's Last Exam ou pontuações de GPQA para esse confronto, não têm origem em nada que a Anthropic tenha divulgado.
Posso realmente testar o Claude Mythos contra o Opus 4.8 eu mesmo?
Não diretamente. O Mythos 5 é restrito aos parceiros governamentais de ciberdefesa do Project Glasswing e a um pequeno programa de acesso confiável. O que você pode testar é o Fable 5, que compartilha os mesmos pesos subjacentes e entrega resultados de nível Mythos em cerca de 95% das sessões, redirecionando para o Opus 4.8 no restante.
Por que alguns sites mostram pontuações diferentes de Mythos vs Opus?
Duas razões aparecem repetidamente: números sem fonte rastreável que não aparecem no lançamento da Anthropic e pontuações reais da classe Mythos comparadas com uma versão mais antiga do Opus (4.6 em vez de 4.8), o que infla a diferença aparente.
Qual é a verdadeira diferença entre o Fable 5 e o Mythos 5?
São o mesmo modelo. O Fable 5 executa classificadores de segurança que redirecionam solicitações relacionadas a cibersegurança, biologia e destilação para o Opus 4.8; o Mythos 5 tem essas salvaguardas removidas, mas é restrito a parceiros validados. Veja Fable 5 vs Mythos 5 para a análise completa.
O Opus 4.8 é mais barato do que os modelos da classe Mythos?
Sim. O Opus 4.8 custa US$5/US$25 por milhão de tokens de entrada/saída, em comparação com US$10/US$50 do Fable 5 e do Mythos 5. Para cargas de trabalho que não precisam dos ganhos do SWE-Bench Pro ou do FrontierCode, o Opus 4.8 é a opção de menor custo, sem redirecionamentos de classificador com os quais se preocupar.
Conclusão
Três benchmarks publicados pela Anthropic mostram o raciocínio da classe Mythos à frente do Opus 4.8 por uma margem real e moderada. Tudo além desses três números — e a maior parte do que está impulsionando as manchetes de “Mythos esmaga Opus” — é ou sem fonte ou está comparando com uma versão antiga do Opus. E, a menos que você seja um parceiro verificado de defesa cibernética ou biomédico, o modelo contra o qual você realmente estaria testando o Opus 4.8 é o Fable 5, não o próprio Mythos 5.
