Anthropic, Mythos sınıfı modelini Claude Opus 4.8 ile doğrudan karşılaştıran tam olarak üç benchmark yayımladı: SWE-Bench Pro (%80.3 vs %69.2), Cognition'ın FrontierCode'u (%29.3 vs %13.4) ve ExploitBench (%78 vs %40). İnternette dolaşan ve "Claude Mythos vs Claude Opus" başlığına eklenen diğer tüm sayılar — Humanity's Last Exam puanları, GPQA, AIME veya 4.8 dışındaki Opus sürümleri — Anthropic'in duyurusunda yer almıyor. Bunların bir kısmı tamamen uydurma; bir kısmı ise mevcut Mythos modelini, kendisinden tam bir nesil geride olan bir Opus sürümüyle eşleştiriyor.
İkinci bir komplikasyon daha var: Mythos ve Opus 4.8'i yan yana karşılaştıran neredeyse hiç kimse Mythos çalıştırmıyor. İnsanların Mythos-sınıfı API'yi çağırdıklarında elde ettikleri model çoğunlukla Fable 5 oluyor; bu model, bir istek siber güvenlik, biyoloji ya da etiketlenmiş diğer birkaç alandan birine dokunduğu anda sessizce Opus 4.8'e yönlendiriyor. Dolayısıyla "Mythos vs Opus" şeklindeki pek çok bire bir karşılaştırma, yazar farkında olmadan, Opus 4.8'in kendi kendisiyle karşılaştırılmasından ibaret.
Anthropic’in gerçekten yayımladığı üç kıyaslama
Anthropic'in 9 Haziran 2026'da Fable 5 ve Mythos 5'i duyurması, alttaki Mythos sınıfı modeli Claude Opus 4.8 ile karşılaştıran bir benchmark tablosu içeriyordu. Üç sonuç, Anthropic'in kendi duyurusunda ve ona doğrudan atıfta bulunan bağımsız yayınlarda tutarlı şekilde görünmektedir; buna The Decoder'ın ve Vellum'un aynı duyuruyu ele alan incelemeleri de dahildir:
| Karşılaştırma Ölçütü | Mythos-class | Claude Opus 4.8 |
|---|---|---|
| SWE-Bench Pro (gerçek GitHub sorun çözümü) | 80.3% | 69.2% |
| Cognition's FrontierCode | 29.3% | 13.4% |
| ExploitBench (saldırı odaklı güvenlik görevleri) | 78% | 40% |
SWE-Bench Pro açığı olan 11,1 puan, kodlama işleri için Mythos sınıfı muhakemenin peşinden gitmeye değip değmeyeceğine karar veriyorsanız en çok alıntılanabilir sayıdır. ExploitBench skoru ise tipik alıcılar için en az önemli olanıdır: Fable 5'in güvenlik sınıflandırıcıları devreye girmeden önce temel modelin ham yeteneğini ölçer ve üretimde Fable 5, siber görevlerde yaklaşık %0 puan alır çünkü sınıflandırıcı, bu yetenek hiç ortaya çıkmadan önce onları Opus 4.8'e yönlendirir.
Anthropic tarafından yayımlanan hiçbir sayı, Mythos-class ve Opus 4.8’i Humanity's Last Exam, GPQA Diamond, AIME veya Terminal-Bench üzerinde birbirleriyle karşılaştırmıyor. Eğer bu benchmark’lar için her iki modelin de doldurulduğu bir tablo görürseniz, kaynağının neresi olduğunu sorun — bu yazı itibarıyla, bu kaynağın Anthropic olmadığı açıktır.
Anthropic'ın yayımlamadığı tekrar eden puanlar
"Claude Mythos vs Claude Opus" araması, tam olarak bu karşılaşma için ayrıntılı benchmark tabloları içeren birkaç siteyi öne çıkarıyor. Bunları Anthropic'in yayınladığı bilgilerle karşılaştırınca tek değil, iki ayrı sorun ortaya çıkıyor:
İzlenebilir kaynağı olmayan sayılar. Benchlm'nin Mythos 5 ile Opus 4.6 karşılaştırması, Mythos için %97,6'lık bir Math benchmark puanı ile Opus için %36,3'lük bir puan listeliyor — bu, her iki modelin de halka açık materyallerinde bu adla anmadığı bir benchmarkta 61 puanlık bir fark. Bu iki rakamdan hiçbiri Anthropic'in duyurusunda, The Decoder'ın ya da Vellum'un buna ilişkin bağımsız yazılarında veya herhangi bir Opus 4.8 system card'ında yer almıyor.
Gerçek sayılar, yanlış rakip. Aynı Benchlm sayfası, Mythos-class’ın kendi SWE-Bench Pro skorunu doğru biçimde, %80.3 olarak veriyor; Anthropic’in gerçek rakamıyla uyumlu. Ancak bunu Claude Opus 4.6’nın %53.4’üyle eşleştiriyor; Opus 4.8’in %69.2’siyle değil. Opus 4.6, Fable 5/Mythos 5 lansmanından birden fazla sürüm döngüsü önceye ait olduğundan, onu daha yeni Mythos rakamıyla karşılaştırmak, mevcut nesil karşılaştırmasının gösterdiği 11 puan yerine 27 puanlık bir fark yaratıyor.
Her iki örüntü de temel iddiayı — Mythos sınıfı akıl yürütmenin kodlama ve ajanik görevlerde Opus 4.8'i geçtiği iddiasını — yanlış kılmaz. 11 puanlık SWE-Bench Pro farkı gerçektir. Ancak 11 puanlık bir fark ile uydurulmuş 44 puanlık bir fark, Mythos'un gerçekte ne kadar daha iyi olduğuna dair farklı sonuçlara götürür ve bu sayıların yalnızca biri Anthropic'ten gelmiştir.
Neden bu soruyu soran çoğu insan bunu kendi başına test edemez
Benchmark tablolarının atladığı kısım şu: Mythos 5, çağırabileceğiniz bir model değil. Anthropic onu yalnızca Project Glasswing ortaklarına — ABD hükümeti siber savunucularına — sunuyor; ayrıca siber güvenlik kuruluşları ve ayrı olarak biyomedikal araştırmacılar için güvenilir erişim programı açılıyor. Fiyatlandırma sayfası yok, kayıt formu yok, kendi SWE-Bench Pro karşılaştırmanızı çalıştırmak için oluşturabileceğiniz bir API key de yok.
Genel kullanıma sunulan Fable 5’tir: aynı temel Mythos sınıfı ağırlıkları ve her isteği siber güvenlik, biyoloji/kimya veya model-distillation içeriği açısından izleyen güvenlik sınıflandırıcılarıyla birlikte. Bir istek bu sınıflandırıcılardan birini tetiklediğinde, Fable 5 onu konuşmanın ortasında Opus 4.8’e aktarır, bunun olduğunu size söyler ve yeniden yönlendirilen kısmı Opus 4.8’in daha düşük token başı oranı üzerinden ücretlendirir. Anthropic’in kendi verileri, tetikleme oranını oturumların %5’inin altında gösteriyor. Diğer %95+ için, Fable 5’i çağırdığınızda elde ettiğiniz şey gerçekten yukarıdaki Mythos sınıfı ölçütleridir; işaretlenen azınlık içinse, Opus 4.8’i yine kendisine karşı test etmeye geri dönersiniz.
İşte bu yüzden birçok "Mythos vs Opus" değerlendirmesi belirsiz ("Mythos, karmaşık, çok adımlı görevlerde açıkça daha iyi") görünür; çünkü çoğu yazarın test edecek Mythos'u hiç olmadı. Ya Anthropic'in kendi yayınladığı sayıları tekrar ediyorlar, ya birbirlerinin kaynaksız sayıları tekrarlıyorlar, ya da Fable 5'i tarif edip ona Mythos diyorlar.
Öyleyse aslında hangisini kullanmalısınız
Eğer işiniz genel yazılım mühendisliği, yazma veya analiz ise, pratik seçim Mythos ile Opus 4.8 arasında değil — Fable 5 ile Opus 4.8 arasındadır; çünkü Fable 5, gerçekte elde edebileceğiniz Mythos sınıfı yeteneğe en yakın şeydir. Fable 5 ve Opus 4.8 farklı fiyatlandırılır (milyon token başına $10/$50 ile $5/$25), bu yüzden 11 puanlık SWE-Bench Pro farkının, fiyat hassasiyeti olan iş yüklerinde Fable 5’in maliyeti haklı çıkarması için yaklaşık iki kat maliyete değmesi gerekir. Zaten görev zorluğuna göre Claude katmanları arasında yönlendirme yapan ekipler için bu, genel bir karar değil görev bazlı bir karardır ve bu, her şey için tek bir katman seçmek yerine bir API toplayıcısının otomatik olarak ele aldığı yönlendirme mantığının aynısıdır.
Eğer çalışmanız güvenlik araştırması, exploit geliştirme veya meşru kurumsal bir vaka kapsamında biyomedikal araştırma ise, ExploitBench açığı (engellenmemiş modeli ölçerken %78’e karşı %40) önemli olan sayıdır ve gerçek bir sonraki adım, Anthropic’in güvenilir erişim programına başvurmak — Mythos erişimini yeniden sattığını iddia eden bir satıcı aramak değil; çünkü böyle satın alınabilir bir ürün yoktur.
Fable 5 ve Mythos 5’in birbiriyle nasıl ilişkili olduğuna dair eksiksiz bir döküm için — aynı model, farklı güvenlik yapılandırması ve bunun pratikte size neye mal olduğu — Fable 5 vs Mythos 5 bölümüne bakın.
SSS
Claude Mythos, Claude Opus 4.8'den daha güçlü mü?
Anthropic’in bire bir yayınladığı üç benchmark’ta — SWE-Bench Pro, Cognition's FrontierCode ve ExploitBench — evet, benchmark’a bağlı olarak 11 ile 38 puan arasında. Humanity's Last Exam veya bu karşılaşma için GPQA skorları da dahil olmak üzere bu üç benchmark’ın ötesindeki iddialar, Anthropic’in yayımladığı hiçbir şeye dayandırılmıyor.
Claude Mythos’u gerçekten Opus 4.8’e karşı kendim test edebilir miyim?
Doğrudan değil. Mythos 5, Project Glasswing hükümet siber savunma ortakları ve küçük bir güvenilir erişim programıyla sınırlıdır. Test edebileceğiniz şey Fable 5’tir; bu model, aynı temel ağırlıkları paylaşır ve oturumların yaklaşık %95’inde Mythos sınıfı çıktı sağlar, kalanında ise Opus 4.8’e yönlendirilir.
Neden bazı siteler farklı Mythos ve Opus puanları gösterir?
Tekrarlayan iki neden ortaya çıkıyor: Anthropic’in sürüm duyurusunda yer almayan, izlenebilir bir kaynağı olmayan sayılar ve eski bir Opus sürümüne (4.8 yerine 4.6) karşı eşleştirilen gerçek Mythos sınıfı puanlar; bu da görünür farkı şişiriyor.
Fable 5 ile Mythos 5 arasındaki gerçek fark nedir?
Aynı modeldir. Fable 5, siber güvenlik, biyoloji ve distillation ile ilgili istekleri Opus 4.8'e yönlendiren güvenlik sınıflandırıcıları çalıştırır; Mythos 5 bu güvenceler kaldırılmıştır ancak doğrulanmış ortaklarla sınırlıdır. Tam döküm için Fable 5 vs Mythos 5 adresine bakın.
Opus 4.8, Mythos sınıfı modellerden daha mı ucuz?
Evet. Opus 4.8, milyon giriş/çıkış token başına $5/$25'tir; Fable 5 ve Mythos 5 için bu oran $10/$50'dir. SWE-Bench Pro veya FrontierCode kazanımlarına ihtiyaç duymayan iş yükleri için Opus 4.8, endişe etmeniz gereken sınıflandırıcı yönlendirmeleri olmadan daha düşük maliyetli seçenektir.
Özet
Anthropic tarafından yayımlanan üç benchmark, Mythos sınıfı akıl yürütmenin Opus 4.8’in önünde, gerçek ve orta düzey bir farkla olduğunu gösteriyor. Bu üç sayının ötesindeki her şey — ve “Mythos, Opus’u eziyor” başlıklarını besleyenlerin çoğu — ya kaynaksızdır ya da eski bir Opus sürümüyle karşılaştırma yapmaktadır. Ayrıca, doğrulanmış bir siber savunma ya da biyomedikal ortak değilseniz, aslında Opus 4.8’e karşı test edeceğiniz model Mythos 5’in kendisi değil, Fable 5’tir.
