AIREITER

Claude Sonnet 5 vs Sonnet 4.6: Gerçekten Daha Ucuz mu?

Son Güncelleme: 2026-07-01 09:19:04

Sonnet 5'in manşet fiyatı Sonnet 4.6'nınkinden daha düşük ($2/$10 introductory through Aug 31, 2026, vs. Sonnet 4.6's $3/$15), ve Anthropic'in kendi lansman grafiği onu Sonnet 4.6'ya göre "strict improvement" olarak nitelendiriyor. Bunun pratikte ne anlama geldiğini görmek için her iki modeli de aynı görevde birkaç farklı effort level'da çalıştırdık. Sonuç: testimizde Sonnet 5, denediğimiz her effort level'da Sonnet 4.6'dan daha fazla maliyet çıkardı — daha az değil. Bulduklarımız ve nedenleri burada.

Tek bir görev, tekli çalıştırmalar. Aşağıdaki her şey tek bir kodlama görevinden gelir; her model/çaba yapılandırması için bir çalıştırma yapılmıştır. Belirli sayıları yön gösterici olarak değerlendirin, istatistiksel olarak ortalaması alınmış bir kıyaslama olarak değil — kendi iş yükünüzde bunu yeniden üretmek isterseniz, tam istem ve ham API çıktısının bir örneği ekte yer alıyor.

Sonnet 5 Gerçekten Sonnet 4.6’dan Daha Ucuz mu? Test Ettik.

Her iki modele de aynı görevi verdik — Python’da testleri olan bir token-bucket rate limiter oluştur, testleri çalıştır, başarısız olan her şeyi düzelt — Claude Code CLI (claude -p --model <id> --effort <level> --output-format json) aracılığıyla; böylece maliyet ve süre doğrudan API yanıtından geliyor. 2026-07-01 tarihinde çalıştırıldı.

Kurulum

Maliyet

Süre

Tur

Sonuç

Sonnet 5, effort medium

$0.344

31.6s

5

6/6 tests pass

Sonnet 4.6, effort low

$0.261

36.0s

6

7/7 tests pass

Sonnet 4.6, effort medium

$0.253

35.3s

5

7/7 tests pass

Sonnet 5, effort high

$0.349

36.4s

5

8/8 tests pass

Sonnet 5, medium effort seviyesinde daha hızlıydı, ancak test ettiğimiz Sonnet 4.6 yapılandırmalarının ikisinde de Sonnet 4.6’dan daha pahalıydı — daha düşük bir effort ayarında çalışan Sonnet 4.6 da dahil. Bu, eşleştirilmiş effort kademelerini karşılaştırdığınızda Sonnet 5’in Sonnet 4.6’dan daha ucuz hale geldiğini iddia eden bazı topluluk anekdot raporlarının tam tersidir.

Olası neden: Sonnet 5 yeni bir tokenizer üzerinde çalışır. Anthropic’in kendi dokümantasyonu, aynı metin için Sonnet 4.6’ya kıyasla "yaklaşık %30 daha fazla token" ürettiğini belirtir ve Simon Willison tarafından yapılan bağımsız testler, özellikle İngilizce içeriğin ~1.4 kata kadar daha fazla token kullandığını bulmuştur. Sonnet 5’in daha düşük etiket fiyatı test görevimizde bunu tamamen dengelemedi ve 31 Ağustos 2026’dan sonra — Sonnet 5’in giriş fiyatlandırmasının sona erdiği ve her iki modelin de aynı $3/$15 etiket oranında olduğu zaman — yalnızca tokenizer farkı, başka herhangi bir fiyat değişikliği yoksa, Sonnet 5’in eşdeğer İngilizce işler için aynı değil, muhtemelen daha pahalıya mal olacağını düşündürüyor. (Dillere göre tam döküm için Sonnet 5 fiyatlandırma rehberimize bakın.)

Maliyetin Ötesinde Başka Neler Değişti

Resmî benchmark’larda Sonnet 5 gerçek kazanımlar sunuyor: Terminal-Bench 2.1’de %80,4’e karşı %67,0, SWE-bench Pro’da %63,2’ye karşı %58,1; her ikisi de Anthropic'in Claude Sonnet 5 sistem kartına göre (Opus 4.8 dahil tam benchmark tablomuzu görün). Anthropic'in kendi lansman duyurusu grafiği, Sonnet 5'i Sonnet 4.6'ya göre "strict improvement" olarak tanımlıyor.

Kendi dört test çıktımıza baktığımızda, benchmark tablosunun yakalayamadığı bir davranış farkı göze çarpıyordu: Sonnet 5, istemediğimiz şeyleri ekledi. Her iki çaba seviyesinde de, gerçek time.sleep() çağrılarını önlemek için testlerde monkeypatch edilmiş sahte bir saat kullandı ve high çaba düzeyinde, istenmeden rate limiter’a thread-safety ekledi. Sonnet 4.6 ise her iki çaba seviyesinde de, gerçek görev tanımına daha yakın kaldı — testlerde gerçek time.sleep() kullanarak ve medium çaba düzeyinde, okunabilirlik için bir özet tablo ekledi ama istenenlerin ötesinde gerçek uygulamaya hiçbir şey eklemedi.

Bu, Sonnet 5’in lansmanının ilk günü içinde paylaşılan gerçek kullanıcı geri bildirimleriyle örtüşüyor: bir r/claude başlığı onu "akıl yürütme açısından Sonnet 4.6’ya kıyasla nesnel bir yükseltme... ama aynı zamanda 4.6’ya göre ÇOK daha gergin hissettiriyor" diye tanımlıyordu. Testimiz tek bir görevin örneğinden oluşuyor, ancak "istenmeyen kapsamı daha kolay ekliyor" ifadesi, aynı gözlemin somut ve spesifik bir versiyonu.

Yükseltmeli misiniz?

  • Yükseltin eğer iş yükünüz ağırlıklı olarak Çince ise (tokenizer değişikliği Çince token sayısını neredeyse etkilemez) ya da Terminal-Bench ve SWE-bench kazanımlarının mütevazı bir maliyet artışından daha önemli olduğu agentic/tool ağırlıklı işler yapıyorsanız.

  • Bekleyin eğer iş yükünüz yüksek hacimli ve İngilizce ağırlıklıysa ve Sonnet 4.6 zaten kalite beklentinizi karşılıyorsa — özellikle başlangıç fiyatlandırma dönemi 31 Ağustos 2026'da sona erdikten sonra, etiket fiyatına güvenmek yerine kendi maliyet hesabınızı yeniden yapın.

  • Her iki durumda da, daha yeni ve daha ucuz görünen modelin görev başına otomatik olarak daha az maliyetli olduğunu varsaymayın. Bizim testimizde öyle olmadı.

SSS

Sonnet 5 gerçekten Anthropic’in dediği gibi Sonnet 4.6’ya kıyasla “katı bir iyileştirme” mi?

Anthropic’in yayınladığı yetenek benchmark’larında evet — Sonnet 4.6’nın önde olduğu bir tane bulamadık. Görev başına maliyette ise, tokenizer değişikliğini hesaba kattığınızda testimiz tam tersini buldu; dolayısıyla “katı bir iyileştirme” her iş yükü için maliyet verimliliğine uzanmıyor.

Sonnet 5 neden Sonnet 4.6'dan daha "gergin" hissettiriyor?

Anthropic bununla ilgili ayrıntı yayınlamadı. Kendi test çıktılarımıza göre, Sonnet 5, Sonnet 4.6’ya kıyasla istenmeyen kapsam eklemeye daha istekliydi (thread-safety, daha savunmacı bir test-clock kurulumu); Sonnet 4.6 ise talebin harfi harfine karşılığına daha yakın kaldı. Bu, topluluk açıklamasıyla tutarlı — ancak ondan daha dar kapsamlı.

Sonnet 5 artık varsayılan model mi? Hâlâ Sonnet 4.6 kullanabilir miyim?

Anthropic'in lansman duyurusuna göre, Sonnet 5, claude.ai üzerinde Free ve Pro kullanıcılar için varsayılan olarak Sonnet 4.6'nın yerini aldı. Max, Team ve Enterprise kullanıcıları ile API kullanıcıları, Sonnet 4.6'yı doğrudan seçmeye devam edebilir.

Sonnet 5'i Sonnet 4.6 ile mi yoksa Opus 4.8 ile mi karşılaştırmalıyım?

Tamamen farklı bir karar. Bu sayfa nesil yükseltmesi hakkındadır; eğer özellikle Sonnet 5 ve Opus 4.8 arasında seçim yapıyorsanız, ayrı bir başa baş test seti yaptık — Sonnet 5 vs Opus 4.8: gerçek testler bölümüne bakın.

İnternette insanların paylaştığı “daha yüksek çaba seviyesi daha ucuzdur” iddiası gerçek mi?

Testimizde değil. Sonnet 5’i medium ve high ayarlarında, Sonnet 4.6’ya karşı low ve medium ayarlarında çalıştırdık ve Sonnet 5 her eşleştirmede daha pahalıya geldi. Tekil anekdotsal raporlar göreve göre değişir — belirli bir effort-level kesişimi varsaymadan önce kendi gerçek iş yükünüz üzerinde kendi karşılaştırmanızı yapın.

Ek: Tam İstem ve Ham Çıktı

Her iki modele gönderdiğimiz görev:

Python sınıfı `RateLimiter(capacity: int,
refill_rate: float)` olarak bir token-bucket oran sınırlayıcı uygulayın; `allow() -> bool` adlı bir yöntemle, bir isteğin şu anda izinli olup olmadığını döndürsün ve uygunsa bir token tüketsin. Monotonik bir saat kullanın, harici bağımlılık olmasın. Bunu limiter.py dosyasına kaydedin.

Ardından, en az 5 test vakası içeren test_limiter.py dosyasını yazın; şu durumları kapsasın: kapasiteye kadar ani istekler başarıyla geçer, sonra engellenir; token’lar zamanla yenilenir (time.sleep veya mock’lanabilir bir saat kullanın); yenileme hızı korunur (anında tam dolum olmaz); kapasite hiçbir zaman aşılmaz; ve sıfır/negatif kapasite makul şekilde ele alınır.

Testleri pytest ile çalıştırın ve hepsinin geçtiğinden emin olun. Herhangi biri başarısız olursa, kodu düzeltin ve hepsi geçene kadar yeniden çalıştırın. Son pytest çıktısını raporlayın.

Sonnet 5 (medium) çalışmasının, maliyet ve zamanlamayla ilgili alanlara indirgenmiş gerçek API yanıtı:

{
  "duration_ms": 31616,
  "num_turns": 5,
  "stop_reason": "end_turn",
  "total_cost_usd": 0.3438645,
  "usage": {
    "input_tokens": 4302,
    "cache_creation_input_tokens": 60894,
    "cache_read_input_tokens": 233420,
    "output_tokens": 2172
  }
}