Claude Mythos vs Claude Opus 4.8: Los benchmarks verificados

Última actualización: 2026-07-15 02:17:42

Anthropic ha publicado exactamente tres benchmarks que comparan directamente su modelo de clase Mythos con Claude Opus 4.8: SWE-Bench Pro (80.3% vs 69.2%), FrontierCode de Cognition (29.3% vs 13.4%) y ExploitBench (78% vs 40%). Cualquier otro dato asociado a "Claude Mythos vs Claude Opus" que circula en línea — puntuaciones de Humanity's Last Exam, GPQA, AIME, o versiones de Opus distintas de 4.8 — no aparece en el comunicado de Anthropic. Parte de ello está inventado por completo; parte compara el modelo Mythos actual con una versión de Opus que está una generación completa por detrás.

Hay una segunda complicación: casi nadie que compara Mythos y Opus 4.8 lado a lado está ejecutando Mythos. El modelo que la mayoría obtiene cuando llama a la API de clase Mythos es Fable 5, que redirige silenciosamente a Opus 4.8 en el momento en que una solicitud toca ciberseguridad, biología o un puñado de otros dominios marcados. Así que muchos enfrentamientos directos de "Mythos vs Opus" son, sin que el autor se dé cuenta, Opus 4.8 contra sí mismo.

Los tres puntos de referencia que Anthropic realmente publicó

El lanzamiento de Fable 5 y Mythos 5 de Anthropic el 9 de junio de 2026 incluyó una tabla de referencia que comparaba el modelo subyacente de la clase Mythos con Claude Opus 4.8. Tres resultados aparecen de forma consistente tanto en la propia publicación de Anthropic como en medios independientes que lo citan directamente, incluidos los análisis de The Decoder y Vellum sobre el mismo lanzamiento:

EvaluaciónMythos-classClaude Opus 4.8
SWE-Bench Pro (resolución real de incidencias de GitHub)80.3%69.2%
FrontierCode de Cognition29.3%13.4%
ExploitBench (tareas de seguridad ofensiva)78%40%

La brecha de SWE-Bench Pro, 11.1 puntos, es el dato más citable si estás decidiendo si vale la pena perseguir un razonamiento de clase Mythos para tareas de programación. La puntuación de ExploitBench es la que menos importa para los compradores típicos: mide la capacidad bruta del modelo subyacente antes de que intervengan los clasificadores de seguridad de Fable 5, y en producción, Fable 5 obtiene cerca de 0% en tareas de ciberseguridad porque el clasificador las redirige a Opus 4.8 antes de que esa capacidad llegue siquiera a exponerse.

Ningún número publicado por Anthropic coloca a Mythos-class y Opus 4.8 en Humanity's Last Exam, GPQA Diamond, AIME o Terminal-Bench enfrentados entre sí. Si ves una tabla con esos benchmarks completos para ambos modelos, pregunta de dónde proviene la fuente; a fecha de redacción, no es de Anthropic.

Las puntuaciones que se repitieron y que Anthropic no publicó

Buscar "Claude Mythos vs Claude Opus" muestra varios sitios con tablas detalladas de benchmarks para exactamente este enfrentamiento. Al compararlos con el lanzamiento de Anthropic, aparecen dos problemas separados, no uno:

Números sin fuente rastreable. La comparación de Mythos 5 vs Opus 4.6 de Benchlm enumera una puntuación de referencia de Matemáticas del 97.6% para Mythos frente al 36.3% para Opus — una diferencia de 61 puntos en una referencia que los materiales públicos de ninguno de los dos modelos mencionan con ese nombre. Ninguna de las dos cifras aparece en el anuncio de Anthropic, en los análisis independientes de The Decoder o Vellum sobre él, ni en ninguna tarjeta de sistema de Opus 4.8.

Números reales, oponente equivocado. La misma página de Benchlm acierta la puntuación SWE-Bench Pro propia de Mythos-class, 80,3 %, coincidiendo con la cifra real de Anthropic, pero la compara con el 53,4 % de Claude Opus 4.6 en lugar del 69,2 % de Opus 4.8. Opus 4.6 es anterior al lanzamiento de Fable 5/Mythos 5 por varios ciclos de lanzamiento, así que emparejarlo con la cifra más reciente de Mythos fabrica una diferencia de 27 puntos donde la comparación de la generación actual muestra 11.

Ninguno de los dos patrones hace falsa la afirmación subyacente — que el razonamiento de clase Mythos supera a Opus 4.8 en tareas de codificación y agentes —. La diferencia de 11 puntos en SWE-Bench Pro es real. Pero una diferencia de 11 puntos y una diferencia fabricada de 44 puntos conducen a conclusiones distintas sobre cuánto mejor es realmente Mythos, y solo uno de esos números provino de Anthropic.

Por qué la mayoría de las personas que hacen esta pregunta no pueden probarlo por sí mismas

Esto es lo que omiten las tablas de referencia: Mythos 5 no es un modelo al que puedas llamar. Anthropic lo ofrece únicamente a los socios de Project Glasswing —defensores cibernéticos del gobierno de EE. UU.— con un programa de acceso de confianza que se abre para organizaciones de ciberseguridad y, por separado, para investigadores biomédicos. No hay página de precios, ni formulario de registro, ni clave API que puedas generar para ejecutar tu propia comparación de SWE-Bench Pro.

Lo que está generalmente disponible es Fable 5: los mismos pesos subyacentes de clase Mythos, con clasificadores de seguridad que vigilan cada solicitud en busca de contenido de ciberseguridad, biología/química o destilación del modelo. Cuando una solicitud activa uno de esos clasificadores, Fable 5 la transfiere a Opus 4.8 en medio de la conversación, te informa de que ocurrió y factura la parte redirigida a la tarifa por token más baja de Opus 4.8. Los datos de Anthropic sitúan la tasa de activación por debajo del 5% de las sesiones. Para el otro 95% y más, lo que obtienes al llamar a Fable 5 es realmente el rendimiento de referencia de clase Mythos mencionado arriba; para la minoría marcada, vuelves a probar Opus 4.8 contra sí mismo.

Esta es la razón por la que tantos textos sobre "Mythos vs Opus" suenan vagos ("Mythos es claramente mejor en tareas complejas de varios pasos") en lugar de estar respaldados por benchmarks: la mayoría de los autores nunca tuvo Mythos para probarlo. O bien están repitiendo los propios números de lanzamiento de Anthropic, repitiendo los números sin fuente de los demás, o describiendo Fable 5 y llamándolo Mythos.

Entonces, ¿cuál deberías usar realmente?

Si tu trabajo es ingeniería de software general, redacción o análisis, la opción práctica no es Mythos vs Opus 4.8: es Fable 5 vs Opus 4.8, ya que Fable 5 es lo más parecido a una capacidad de clase Mythos que realmente puedes conseguir. Fable 5 y Opus 4.8 tienen precios distintos ($10/$50 frente a $5/$25 por millón de tokens), así que la brecha de 11 puntos en SWE-Bench Pro tendría que valer aproximadamente el doble del costo para que Fable 5 resulte rentable en cargas de trabajo sensibles al precio. Para los equipos que ya están enrutando entre niveles de Claude según la dificultad de la tarea, esa es una decisión por tarea en lugar de una decisión general, y es la misma lógica de enrutamiento que un API aggregator gestiona automáticamente en vez de elegir un solo nivel para todo.

Si tu trabajo es investigación de seguridad, desarrollo de exploits o investigación biomédica con un caso institucional legítimo, la brecha de ExploitBench (78% frente a 40%, midiendo el modelo no bloqueado) es el número que importa, y el verdadero siguiente paso es solicitar el programa de acceso de confianza de Anthropic, no buscar un proveedor que afirme revender acceso a Mythos, que no existe como producto adquirible.

Para un desglose completo de cómo Fable 5 y Mythos 5 se relacionan entre sí — el mismo modelo, una configuración de seguridad diferente y lo que eso te cuesta en la práctica — consulta Fable 5 vs Mythos 5.

Preguntas frecuentes

¿Es Claude Mythos más poderoso que Claude Opus 4.8?

En los tres benchmarks que Anthropic ha publicado cara a cara — SWE-Bench Pro, FrontierCode de Cognition y ExploitBench — sí, por 11 a 38 puntos según el benchmark. Las afirmaciones más allá de esos tres benchmarks, incluidos Humanity's Last Exam o las puntuaciones de GPQA para este enfrentamiento, no están respaldadas por nada que Anthropic haya publicado.

¿Puedo realmente probar Claude Mythos contra Opus 4.8 yo mismo?

No directamente. Mythos 5 está restringido a los socios gubernamentales de ciberdefensa de Project Glasswing y a un pequeño programa de acceso de confianza. Lo que puedes probar es Fable 5, que comparte los mismos pesos subyacentes y ofrece resultados de clase Mythos en aproximadamente el 95% de las sesiones, redirigiendo a Opus 4.8 para el resto.

¿Por qué algunos sitios muestran puntuaciones diferentes de Mythos frente a Opus?

Dos razones aparecen repetidamente: números sin una fuente rastreable que no figuran en el lanzamiento de Anthropic, y puntuaciones reales de clase Mythos comparadas con una versión más antigua de Opus (4.6 en lugar de 4.8), lo que infla la brecha aparente.

¿Cuál es la verdadera diferencia entre Fable 5 y Mythos 5?

Son el mismo modelo. Fable 5 ejecuta clasificadores de seguridad que redirigen las solicitudes relacionadas con ciberseguridad, biología y destilación a Opus 4.8; Mythos 5 tiene esas salvaguardas desactivadas, pero está restringido a socios verificados. Consulta Fable 5 vs Mythos 5 para el desglose completo.

¿Es Opus 4.8 más barato que los modelos de la clase Mythos?

Sí. Opus 4.8 cuesta $5/$25 por millón de tokens de entrada/salida, frente a $10/$50 para Fable 5 y Mythos 5. Para cargas de trabajo que no necesitan las mejoras de SWE-Bench Pro o FrontierCode, Opus 4.8 es la opción de menor costo sin reruteos de clasificador de los que preocuparse.

Conclusión

Tres benchmarks publicados por Anthropic muestran que el razonamiento de clase Mythos supera a Opus 4.8 por un margen real y moderado. Todo lo que va más allá de esos tres números —y la mayor parte de lo que impulsa los titulares de «Mythos aplasta a Opus»— o bien no tiene fuente o bien compara con una versión obsoleta de Opus. Y, a menos que seas un socio verificado de ciberdefensa o biomedicina, el modelo contra el que realmente estarías probando en relación con Opus 4.8 es Fable 5, no Mythos 5 en sí.

Fuentes