DeepSeek bugün deepseek-v4-flash modelini sessiz sedasız yeniden derledi. Dört puanlı görevde GLM-5.2 ile üçünü berabere tamamladı, dördüncüyü kazandı ve çalıştırma maliyeti 19 kat daha düşük çıktı. Yine de kâğıt üzerindeki puanlarda daha güçlü model GLM-5.2. Dördüncü görevde kaybetmesinin nedeni ise isteyerek de düşebileceğiniz bir tuzak: akıl yürütme bütçesi.
Test ettiğim endpoint üzerinden GLM-5.2, kısa istemlerde bile uzun uzun düşündü. Spesifikasyonu yoğun bir görevde 16.000 çıktı token'ı harcadı, ancak hiç yanıt üretmedi. Flash aynı görevi 2.525 token ile tamamladı.
deepseek-v4-flash için 0731 güncellemesi ne getirdi?
DeepSeek'in API dokümanlarında deepseek-v4-flash için model sürümü artık DeepSeek-V4-Flash-0731 olarak görünüyor. Çağırma yöntemi değişmedi; alias da en güncel derlemeye yönlenmeye devam ediyor. Dolayısıyla kodunuz bozulmuyor, fakat alttaki modelin değiştiğine dair size bir uyarı da gelmiyor.
Fiyatlandırma sayfasında bu güncellemeye ilişkin bir değişiklik kaydı yok. DeepSeek haber dizininde de 2026-07-31 tarihinde kontrol ettiğimde Temmuz 2026 tarihli bir kayıt görünmüyordu. Karşılaştırmaları okurken bunun sonucu şu: yayımlanmış bir Flash puanı, test sırasında hangi derleme aktifse onu ölçer. Bu nedenle hem değerlendirme tarihini hem de varyantı kontrol edin; çünkü "Flash Base", "Flash (Reasoning)" ve "Flash (Reasoning, Max Effort)" farklı sayılara sahip üç ayrı satır.
Aynı doküman sayfası, karşılaştırmada önemli olan teknik ayrıntıları da doğruluyor: 1M bağlam, 384K azami çıktı, varsayılan olarak açık gelen thinking modu ve kullanılabilen non-thinking modu. Ayrıca Pro'nun 500 olan eşzamanlılık sınırına karşılık 2.500 eşzamanlılık limiti var. Responses API şu anda yalnızca deepseek-v4-flash modelini destekliyor; deepseek-v4-pro için hedef tarih Ağustos 2026'nın başı.
Dört görevde gerçek sonuçlar
Her iki modele de 2026-07-31 tarihinde OpenAI uyumlu bir relay üzerinden aynı istemleri gönderdim. Thinking varsayılan ayarında kaldı; aksi belirtilmedikçe max_tokens değeri 8.000 idi. Çıktıları gözle yorumlamak yerine mekanik olarak puanladım. İki kodlama görevi sırasıyla 6 ve 8 gizli test senaryosunda çalıştırıldı. JSON görevi istenen şemaya karşı anahtar anahtar denetlendi. Bilgi getirme görevinde ise tek bir doğru dize vardı.
| Görev | DeepSeek V4 Flash (0731) | GLM-5.2 |
|---|---|---|
| t1 — interval-merge sınır durumunu bulup düzeltme | 6/6 test, 5.0 sn, 361 çıktı | 6/6 test, 19.0 sn, 990 çıktı |
t2 — 8 kurallı spesifikasyona göre next_version() yazma | 8/8 test, 29.9 sn, 2.525 çıktı | yanıt dönmedi |
| t3 — katı JSON, tam anahtarlar, code fence yok | başarılı, 5.2 sn, 327 çıktı | başarılı, 11.2 sn, 826 çıktı |
| t4 — ~45K token içinden 3 bilgiyi bulup birleştirme | doğru, 5.2 sn, 172 çıktı | doğru, 9.7 sn, 317 çıktı |
Dört görevin üçü için dürüst sonuç beraberlik. İki model de t1'de aynı hatayı buldu: Temas eden (1,4) ve (4,5) aralıklarını birleştirmeyen katı bir < kullanımı. İkisi de aynı tek karakterlik düzeltmeyi yaptı. Katı JSON görevini ikisi de byte byte doğru üretti. t4'te de ikisi doğru sonuca ulaştı; 211. kayıttaki gizli bilgiyi 1290. kayıttaki kuralla birleştirip quartz-mallard-90 döndürdüler.
İstisna t2 ve burada zafer turu atmak yerine net olmak gerekiyor. GLM-5.2 yanlış yanıt vermedi; hiç yanıt vermedi. 8.000 token sınırında tüm 8.000 token'ı akıl yürütmede tüketti ve 110 saniye sonra boş içerik döndürdü. Sorunun benim koyduğum limitten kaynaklanmadığını görmek için testi 16.000 ile tekrarladım: 16.000 token harcandı, içerik yine boştu, süre 214 saniyeydi. 24.000 ile yapılan üçüncü deneme ise 301 saniye sonra hata verdi. Flash, ValueError fırlatması gereken üçü de dahil tüm sekiz senaryoyu geçen bir fonksiyon üretti.
Sınırları açıkça belirtmek gerek: Bu bir benchmark değil; tek bir relay endpoint üzerinde görev başına n=1 ölçüm. Burada akıl yürütme token'ları completion_tokens içinde faturalandırılıyor; resmi Z.ai endpoint'i bunları farklı biçimde stream edebilir veya hesaplayabilir. Bu veriden savunabileceğim şey kesin oran değil, genel eğilim: GLM-5.2 görev başına çok daha fazla token ve duvar saati süresi harcıyor.
GLM-5.2'nin gerçekten öne çıktığı yerler
Sektörde kullanılan ölçütlere göre GLM-5.2 daha güçlü model; sonuçlarımı "ucuz olan her şeyi kazanır" diye okumak yanlış olur. Artificial Analysis, GLM-5.2 (max) için Intelligence Index'te 51, DeepSeek V4 Flash (Reasoning, Max Effort) için ise 40 puan veriyor. Bu, çok daha büyük bir modelde 11 puanlık fark anlamına geliyor: Flash'ın 284B toplam ve 13B aktif parametresine karşı GLM-5.2'de 753B toplam ve ~40B aktif parametre var.
Z.ai'ın GLM-5.2 için yayımladığı değerler, bir amiral gemisi modelden bekleneceği seviyede: SWE-bench Pro %62.1, Terminal-Bench 2.1 81.0, AIME 2026 %99.2, GPQA Diamond %91.2 ve araçlarla HLE 54.7%. Bunlar üreticinin bildirdiği sonuçlar; Flash'ın bunların çoğunda karşılaştırılabilir bir kaydı yok.
Benchmark tarafındaki asıl manşet de bu eksiklik: iki model neredeyse hiç ortak değerlendirmeye sahip değil. Model takip sitesi benchlm ikisini karşılaştırıyor ama kazanan ilan etmiyor; çiftin bire bir eşleşen sıfır satırı olduğunu belirtiyor. Flash'ın herkese açık skorları temel model paketinden geliyor: MMLU %88.7, HumanEval %69.5, GSM8K %90.8. GLM-5.2'ninkiler ise ajan tabanlı kodlama paketinden.
Bilgi kategorisi iki modelin kesiştiği tek alan ve benchlm burada GLM-5.2'yi 59.6'ya 56.4 önde gösteriyor. Bu eşleşme hakkında iki karşılaştırma sayfası farklı şeyler söylüyorsa, genellikle farklı varyantları farklı paketlerde puanlamışlardır. Çağırmayı planladığınız modelin varyantı ve tarihiyle eşleşen sayıya güvenin.
Uygulayıcılar da ayrımı benim ölçtüğüme benzer şekilde anlatıyor. Her iki modelde aynı görevi çalıştıran bir r/opencodeCLI başlığından:
GLM 5.2 reasons hard on everything. V4 scales it, almost no wind-up on the simple fix, GLM 5.2 pulls ahead on anything that is not banally [simple] …
Özet tek cümlede bu: GLM-5.2'nin akıl yürütmesi zor problemlerde bir avantaj, kolay olanlarda ise yalnızca ek yük.
Gerçek maliyet farkı fiyat listesinden daha büyük
Önce, iki üreticinin kendi sayfalarından 2026-07-31 tarihinde doğruladığım liste fiyatları:
| 1M token başına | DeepSeek V4 Flash | GLM-5.2 | GLM çarpanı |
|---|---|---|---|
| Girdi (cache miss) | $0.14 | $1.40 | 10.0x |
| Girdi (cache hit) | $0.0028 | $0.26 | 92.9x |
| Çıktı | $0.28 | $4.40 | 15.7x |
| Azami çıktı | 384K | 128K | — |
Bu oranları, dört görevde her modelin gerçekten tükettiği token'lara uyguladığınızda fark yalnızca 15.7x çıktı oranıyla sınırlı kalmıyor. Çünkü pahalı model aynı zamanda daha uzun çıktı üretiyor:
| Görev | Flash girdi→çıktı | Flash maliyeti | GLM-5.2 girdi→çıktı | GLM-5.2 maliyeti | Çarpan |
|---|---|---|---|---|---|
| t1 hata düzeltme | 165→361 | $0.000124 | 170→990 | $0.004594 | 37.0x |
| t2 uygulama | 182→2,525 | $0.000732 | 196→16,000 | $0.070674 | 96.5x |
| t3 katı JSON | 171→327 | $0.000116 | 177→826 | $0.003882 | 33.5x |
| t4 uzun bağlam | 45,225→172 | $0.006380 | 44,164→317 | $0.063224 | 9.9x |
| Dört görevin tamamı | 45,743→3,385 | $0.007352 | 44,707→18,133 | $0.142375 | 19.4x |
Tüm istemler soğuk gönderildi; dolayısıyla bütün girdiler cache-miss oranından ücretlendirildi. Herhangi bir rakamı yeniden hesaplamak için yukarıdaki sütunları önceki tablodaki fiyatlarla çarpmanız yeterli.
En dar fark t4'te, yani 9.9x. İş yükü girdi ağırlıklı olduğunda 10x girdi oranı baskın hale geliyor ve çıktıdaki uzunluk farkı önemini kaybediyor. GLM-5.2 priminin sınırlı kaldığı tek iş yükü biçimi bu.
DeepSeek'in fiyatlandırma sayfasında API'nin, Pekin saatiyle (UTC+8) 09:00–12:00 ve 14:00–18:00 arasında tüm faturalama kalemlerinde 2x uygulanacak bir yoğun saat/yoğun olmayan saat politikası"na yakında geçeceği yazıyor; yürürlük tarihi duyuruya bağlı. Bu, Asya mesai saatlerinde Flash'ın çıktı maliyeti avantajını yaklaşık 5x'e düşürür. Tersi yönde ise Flash'ın $0.0028'lik cache-hit girdi ücreti, GLM-5.2'nin $0.26 ücretinden 93x daha ucuz; büyük ve sabit bir öneki tekrar oynatmak farkı açar. Kullanımınız özellikle kodlama odaklıysa, GLM-5.2'yi içeren ve yoğun olmayan saat kullanımını yarı fiyatına sunan Z.ai Coding Plan $18/aydan başlıyor. Bu, yukarıdaki token başı ücretlerden farklı bir faturalama modeli.
İş yüküne göre hangi model seçilmeli?
| İş yükü | Tercih | Neden |
|---|---|---|
| Yüksek hacimli, basit-orta seviye kod düzenlemeleri | V4 Flash | t1'de GLM-5.2 ile aynı yanıt, 3.8x daha hızlı, 37x daha ucuz |
| Ölçekli katı format / yapılandırılmış çıktı | V4 Flash | 1/34 maliyetle byte düzeyinde aynı sonuç |
| Büyük dokümanlarda uzun bağlamlı bilgi getirme | V4 Flash | Aynı doğru yanıt; en dar maliyet farkı olsa da hâlâ 9.9x |
| Zor ajan tabanlı veya çok dosyalı kodlama | GLM-5.2 | Intelligence Index'te 51'e 40 ve güçlü olduğu alan kendi ajan tabanlı paketi |
Sıkı max_tokens limiti olan her şey | V4 Flash | GLM-5.2 t2'de 8K ve 16K sınırlarında hiçbir şey döndürmedi |
| Tek çağrıda 128K token'ı aşan çıktı | V4 Flash | GLM-5.2'nin 128K sınırına karşı 384K azami çıktı |
Bunu kesinleşmiş bir kural değil, doğrulamanız gereken varsayılan maliyet yönlendirmesi olarak görün; sonuçta tek seferlik, dört görevli bir çalışmaya dayanıyor. İşleri önce Flash'a yönlendirin; yanlış yanıtın maliyeti token harcamasının 19 katından yüksek olan görev alt kümesinde GLM-5.2'ye geçin. GLM-5.2 kullanacaksanız da ona alan tanıyın; Flash için rahat sayılacak bir limit, ücretli ama yanıtsız bir çağrıya dönüşebilir.
Bu karşılaştırmanın çözemediği bir nokta var: 0731 bugün geldiğinden, Flash için henüz üçüncü taraf yeniden puanlaması yayımlanmadı. Dolayısıyla 51'e 40 farkı Nisan derlemesini tanımlıyor. Güncel yetenek farkı ölçülmüş değil; kendi iş yükünüzdeki farkı görmenin tek yolu iki alias ile de kendi değerlendirmelerinizi çalıştırmak.
Sık sorulan sorular
DeepSeek V4 Flash 0731 yeni bir model mi, güncelleme mi?
Yeni model değil, mevcut modelin güncellemesi. DeepSeek dokümanları sürümü DeepSeek-V4-Flash-0731 olarak listeliyor ve çağırma yönteminin değişmediğini belirtiyor. Bu nedenle sizin tarafınızda kod değişikliği yapmadan deepseek-v4-flash en yeni derlemeye çözülmeye devam eder.
DeepSeek V4 Flash, GLM-5.2'yi geçti mi?
Yetenek açısından değil: Artificial Analysis, GLM-5.2 (max) için 51, DeepSeek V4 Flash (Reasoning, Max Effort) için 40 puan veriyor. Flash ise çözülen görev başına maliyette öne çıktı; dört puanlı görevin üçünü berabere tamamlayıp toplamda 19.4x daha düşük maliyete ulaştı.
GLM-5.3 çıktı mı?
2026-07-31 itibarıyla hayır. GLM-5.2, Z.ai'ın kendi fiyatlandırma tablosu ve Coding Plan model listelerindeki en yeni kayıt; ikisinde de 5.3 satırı bulunmuyor.
1M token bağlamlı bir iş için hangisi daha ucuz?
DeepSeek V4 Flash. Cache-miss girdide 10x, cache-hit girdide ise 93x daha ucuz. ~45K token'lık bilgi getirme görevim Flash'ta $0.006380, GLM-5.2'de ise $0.063224 tuttu.
İkisini de Claude Code içinde kullanabilir miyim?
Evet, iki üretici de Anthropic formatında bir endpoint dokümante ediyor. DeepSeek, OpenAI formatındaki temel URL'nin yanında https://api.deepseek.com/anthropic adresini listeliyor. Z.ai'ın Claude Code rehberi ise ANTHROPIC_BASE_URL değerini https://api.z.ai/api/anthropic olarak ayarlamanızı ve Sonnet ile Opus yuvalarını glm-5.2[1m] modeline eşlemenizi istiyor.
İlgili okumalar
Kaynaklar
- DeepSeek Models & Pricing — 0731 sürüm notu, fiyatlar, yoğun saat/yoğun olmayan saat politikası; 2026-07-31 tarihinde doğrulandı
- Z.ai pricing — GLM-5.2 ücretleri; 2026-07-31 tarihinde doğrulandı
- Z.ai Coding Plan — abonelik katmanları ve GLM-5.2 kapsamı; 2026-07-31 tarihinde doğrulandı
- Z.ai: Claude Code setup — Anthropic uyumlu temel URL ve model eşlemesi
- DeepSeek news index — 2026-07-31 tarihinde kontrol edildi, Temmuz 2026 kaydı yok
- Artificial Analysis: GLM-5.2 vs DeepSeek V4 Flash — Intelligence Index, parametreler
- benchlm: DeepSeek V4 Flash Base vs GLM-5.2 — ortak benchmark kapsamı, bilgi skorları
- r/opencodeCLI: DeepSeek V4 vs GLM 5.2 for coding — uygulayıcı raporu