Claude Mythos vs Claude Opus 4.8: 검증된 벤치마크

마지막 업데이트: 2026-07-15 02:18:14

Anthropic는 Mythos급 모델을 Claude Opus 4.8과 직접 비교하는 벤치마크를 정확히 세 가지 공개했습니다: SWE-Bench Pro(80.3% 대 69.2%), Cognition의 FrontierCode(29.3% 대 13.4%), 그리고 ExploitBench(78% 대 40%). 온라인에서 돌고 있는 “Claude Mythos vs Claude Opus” 관련 다른 수치들 — Humanity's Last Exam 점수, GPQA, AIME, 또는 4.8이 아닌 Opus 버전들 — 은 Anthropic의 발표문에 포함되어 있지 않습니다. 그중 일부는 아예 날조된 것이고, 일부는 현재의 Mythos 모델을 한 세대 뒤처진 Opus 버전과 비교한 것입니다.

두 번째 복잡한 점이 있습니다. Mythos와 Opus 4.8을 나란히 비교하는 사람들 중 거의 아무도 Mythos를 실제로 사용하고 있지 않습니다. 대부분의 사람들이 Mythos 계열 API를 호출할 때 받는 모델은 Fable 5인데, 이 모델은 요청이 사이버보안, 생물학 또는 몇몇 다른 플래그가 지정된 도메인에 닿는 순간 조용히 Opus 4.8로 다시 라우팅합니다. 그래서 많은 “Mythos 대 Opus” 일대일 비교는, 작성자가 모르는 사이에, 사실상 Opus 4.8 대 자기 자신인 셈입니다.

Anthropic이 실제로 발표한 세 가지 벤치마크

Anthropic의 2026년 6월 9일 Fable 5와 Mythos 5 출시에는 기반 Mythos 계열 모델을 Claude Opus 4.8과 비교하는 벤치마크 표가 포함되어 있었습니다. 다음을 포함해 Anthropic의 자체 발표와 이를 직접 인용한 독립 매체들, 즉 The Decoder의Vellum의 동일한 발표에 대한 분석에서 세 가지 결과가 일관되게 나타납니다:

벤치마크Mythos-classClaude Opus 4.8
SWE-Bench Pro(실제 GitHub 이슈 해결)80.3%69.2%
Cognition의 FrontierCode29.3%13.4%
ExploitBench(공격적 보안 작업)78%40%

SWE-Bench Pro 격차인 11.1점은 Mythos급 추론을 코딩 작업을 위해 추구할 가치가 있는지 결정할 때 가장 인용할 만한 수치입니다. ExploitBench 점수는 일반적인 구매자에게 가장 덜 중요한 지표입니다. 이는 Fable 5의 안전 분류기가 개입하기 전의 기본 모델의 순수한 역량을 측정하며, 실제 운영에서는 분류기가 그 작업을 Opus 4.8로 재라우팅하기 때문에 Fable 5는 사이버 작업에서 거의 0%에 가까운 점수를 기록합니다.

Anthropic가 발표한 어떤 수치도 Humanity's Last Exam, GPQA Diamond, AIME, 또는 Terminal-Bench에서 Mythos-class와 Opus 4.8을 서로 비교한 결과를 제시하지 않습니다. 두 모델에 대해 해당 벤치마크가 모두 채워진 표를 보게 되면, 출처가 어디인지 물어보세요 — 이 글을 쓰는 시점 기준으로, 그것은 Anthropic에서 나온 것이 아닙니다.

Anthropic가 게시하지 않은 점수가 반복되고 있습니다

"Claude Mythos 대 Claude Opus"를 검색하면 바로 이 대결에 대한 자세한 벤치마크 표가 있는 여러 사이트가 나옵니다. 이를 Anthropic의 출시 정보와 대조해 보면, 하나가 아니라 두 가지 별개의 문제가 드러납니다:

출처를 추적할 수 없는 수치. Benchlm의 Mythos 5 vs Opus 4.6 비교에는 Math 벤치마크 점수가 Mythos는 97.6%, Opus는 36.3%로 나와 있으며, 이는 두 모델의 공개 자료 어디에서도 그 이름으로 언급되지 않는 벤치마크에서 61포인트 차이가 나는 수치입니다. 이 두 수치 모두 Anthropic의 발표문, The Decoder나 Vellum의 독립적인 관련 लेख기, 또는 어떤 Opus 4.8 시스템 카드에서도 찾아볼 수 없습니다.

실제 수치, 잘못된 상대. 같은 Benchlm 페이지는 Mythos-class의 자체 SWE-Bench Pro 점수를 80.3%로 올바르게 표시해 Anthropic의 실제 수치와 일치시키지만, 이를 Claude Opus 4.8의 69.2%가 아니라 Opus 4.6의 53.4%와 비교합니다. Opus 4.6은 Fable 5/Mythos 5 출시보다 여러 릴리스 주기 앞서 있으므로, 이를 더 새로운 Mythos 수치와 비교하면 현재 세대 비교에서는 11로 보이는 차이를 27포인트로 만들어 냅니다.

어느 패턴도 근본적인 주장 — Mythos-class reasoning이 코딩 및 agentic 작업에서 Opus 4.8보다 뛰어나다는 주장 — 을 거짓으로 만들지 않습니다. 11포인트의 SWE-Bench Pro 격차는 실제입니다. 하지만 11포인트 격차와 조작된 44포인트 격차는 Mythos가 실제로 얼마나 더 나은지에 대해 서로 다른 결론을 이끌어내며, 이 숫자들 중 Anthropic에서 나온 것은 하나뿐입니다.

왜 이 질문을 하는 대부분의 사람들은 직접 테스트할 수 없는가

벤치마크 표에서 빠져 있는 부분은 이것입니다: Mythos 5는 호출할 수 있는 모델이 아닙니다. Anthropic은 이를 Project Glasswing 파트너 — 미국 정부의 사이버 방어 조직 — 에만 제공하며, 신뢰된 액세스 프로그램은 사이버 보안 조직과, 별도로 생의학 연구자를 대상으로 열릴 예정입니다. 가격 페이지도 없고, 가입 양식도 없고, 자체적으로 SWE-Bench Pro 비교를 실행하기 위해 생성할 수 있는 API 키도 없습니다.

일반적으로 제공되는 것은 Fable 5입니다: 동일한 기반 Mythos-class 가중치에, 모든 요청에서 cybersecurity, biology/chemistry, 또는 model-distillation 콘텐츠를 감시하는 safety classifiers가 더해져 있습니다. 요청이 이러한 classifiers 중 하나에 걸리면, Fable 5는 대화 도중 그 요청을 Opus 4.8로 넘기고, 그 사실을 사용자에게 알리며, 우회된 부분은 Opus 4.8의 더 낮은 per-token rate로 청구합니다. Anthropic의 자체 데이터에 따르면 이러한 trigger rate는 세션의 5% 미만입니다. 나머지 95% 이상에서는 Fable 5를 호출했을 때 실제로 Mythos-class benchmarks를 넘어서는 결과를 얻는 셈이며, flag된 소수의 경우에는 Opus 4.8을 자기 자신과 비교해 테스트하는 것으로 돌아갑니다.

이것이 바로 많은 "Mythos vs Opus" 글들이 모호하게 읽히는 이유입니다("Mythos는 복잡한 다단계 작업에서 분명히 더 낫다")라기보다 벤치마크 기반이 아닌 이유는: 대부분의 저자들이 Mythos를 직접 테스트해 보지 못했기 때문입니다. 그들은 Anthropic의 자체 공개 수치를 되풀이하거나, 서로의 출처 없는 수치를 되풀이하거나, Fable 5를 설명해 놓고 그것을 Mythos라고 부르고 있습니다.

그럼 실제로 어떤 것을 사용해야 할까요

당신의 업무가 일반적인 소프트웨어 엔지니어링, 글쓰기, 또는 분석이라면, 실질적인 선택은 Mythos 대 Opus 4.8이 아니라 Fable 5 대 Opus 4.8입니다. Fable 5가 실제로 얻을 수 있는 것 중 Mythos급 역량에 가장 가까운 것이기 때문입니다. Fable 5와 Opus 4.8은 가격이 다릅니다(백만 토큰당 $10/$50 대 $5/$25)이므로, Fable 5가 가격에 민감한 워크로드에서 비용을 정당화하려면 11포인트의 SWE-Bench Pro 격차가 대략 두 배의 비용을 감수할 만큼의 가치가 있어야 합니다. 이미 작업 난이도에 따라 Claude 티어를 나누어 라우팅하는 팀이라면, 이는 일괄적인 선택이 아니라 작업별 결정이며, 하나의 티어를 모든 용도에 선택하는 대신 API aggregator가 자동으로 처리하는 바로 그 라우팅 로직과 같습니다.

귀하의 작업이 보안 연구, 익스플로잇 개발, 또는 정당한 기관 사례가 있는 생의학 연구라면, ExploitBench 격차(78% 대 40%, 차단되지 않은 모델을 측정한 것)는 중요한 수치이며, 진짜 다음 단계는 Anthropic의 trusted-access 프로그램에 신청하는 것입니다 — Mythos 액세스를 재판매한다고 주장하는 판매처를 찾는 것이 아니라, 그런 것은 구매 가능한 제품으로 존재하지 않기 때문입니다.

Fable 5와 Mythos 5가 서로 어떤 관계인지에 대한 전체 분석 — 같은 모델, 다른 안전 설정, 그리고 실제로 그로 인해 치르게 되는 대가 — 는 Fable 5 vs Mythos 5를 참고하세요.

자주 묻는 질문

Claude Mythos는 Claude Opus 4.8보다 더 강력한가요?

Anthropic가 1대1로 공개한 세 가지 벤치마크 — SWE-Bench Pro, Cognition의 FrontierCode, 그리고 ExploitBench — 에서는, 예, 벤치마크에 따라 11점에서 38점까지 앞섭니다. Humanity's Last Exam 또는 이 대결의 GPQA 점수와 같은 이 세 가지 벤치마크를 넘어서는 주장들은 Anthropic가 공개한 어떤 자료에도 근거하지 않습니다.

Claude Mythos를 Opus 4.8과 실제로 직접 테스트해볼 수 있나요?

직접적으로는 아닙니다. Mythos 5는 Project Glasswing 정부 사이버 방어 파트너와 소규모 신뢰 액세스 프로그램으로 제한됩니다. 대신 테스트할 수 있는 것은 Fable 5인데, 이는 동일한 기본 가중치를 공유하며 세션의 약 95%에서 Mythos 수준의 출력을 제공하고, 나머지는 Opus 4.8으로 라우팅합니다.

왜 일부 사이트는 Mythos와 Opus 점수가 다르게 표시되나요?

반복적으로 나타나는 두 가지 이유가 있습니다: 추적 가능한 출처가 없고 Anthropic의 릴리스에는 나타나지 않는 수치, 그리고 더 오래된 Opus 버전(4.8이 아니라 4.6)과 비교된 실제 Mythos-class 점수로 인해 겉보기 격차가 과장된다는 점입니다.

Fable 5와 Mythos 5의 실제 차이점은 무엇인가요?

그들은 같은 모델입니다. Fable 5는 안전 분류기를 실행하여 사이버 보안, 생물학, 그리고 증류와 관련된 요청을 Opus 4.8로 재라우팅합니다. Mythos 5는 이러한 보호 장치가 해제되어 있지만 검증된 파트너에게만 제한됩니다. 전체 분석은 Fable 5 vs Mythos 5를 참조하세요.

Opus 4.8는 Mythos-class 모델보다 더 저렴한가요?

네. Opus 4.8은 입력/출력 100만 토큰당 $5/$25이며, Fable 5와 Mythos 5의 $10/$50과 비교됩니다. SWE-Bench Pro 또는 FrontierCode 개선이 필요 없는 워크로드의 경우, Opus 4.8은 분류기 재라우팅을 걱정할 필요가 없는 더 저렴한 옵션입니다.

핵심 요약

Anthropic이 발표한 세 가지 벤치마크는 Mythos급 추론이 Opus 4.8보다 실제로 상당한 차이로 앞선다는 것을 보여줍니다. 그 세 숫자 이후의 모든 내용, 그리고 “Mythos가 Opus를 압도한다”는 헤드라인을 이끄는 대부분의 근거는 출처가 없거나 오래된 Opus 버전과 비교한 것입니다. 또한 검증된 사이버 방어 또는 생명과학 파트너가 아니라면, 여러분이 실제로 Opus 4.8과 대조해 테스트하게 될 모델은 Mythos 5 자체가 아니라 Fable 5입니다.

출처