Kısa cevap: GLM-5.2 şu anda kodlama için en güçlü açık kaynak LLM — uzun süreli kullanımda çıktı kalitesi Claude Sonnet seviyesine yaklaşıyor ve en zor problemleri emanet edeceğimiz model bu. Ayrıca yavaş ve token tüketimi yüksek; bu yüzden hızlı API kodlama ajanları için Kimi K2.7 Code, en düşük maliyet için DeepSeek V4 Flash, kendi 24GB GPU’nuz için ise Qwen3.6-27B seçin.
Aynı iki kodlama görevini beş açık kaynak amiral gemisine, kapalı kaynak bir referans olarak Claude Opus 4.8 ile birlikte vermenin sonucu bu. Hepsi doğru kod üretti. Onları ayıran şey, oraya ulaşmak için ne kadar token harcadıklarıydı ve bu fark maliyette 48 kata kadar çıkıyordu.
İfadelerle ilgili bir not: bunların neredeyse tamamı teknik olarak open-weight modellerdir: ağırlıklar ücretsizdir, eğitim verileri ise değildir. Biz "open source" diyoruz çünkü insanlar bu terimi arıyor. Bu ayrım yalnızca aşağıdaki bir SSS yanıtı için önemlidir.
Nasıl test ettik
İki görev, her model için aynı istem, varsayılan ayarlarla 17 Temmuz 2026 tarihinde gönderildi:
- Görev 1: zor uç durumlara sahip bir süre ayrıştırma fonksiyonu yazın (12 test vakası)
- Görev 2: hatalı bir aralık birleştirme fonksiyonunu düzeltin (6 test vakası)
Kodu yerel olarak puanladık ve her çalıştırma için üç sayı kaydettik: geçme oranı, çıktı tokenları ve gerçek süre. Maliyet, token sayısının her satıcının liste fiyatı ile çarpımıdır; bunu aynı gün doğruladık. İki görev bir deneme niteliğindedir, bir benchmark değil, ancak yüzlerce kez göndereceğiniz türden bir rutin istektir.
Sonuçlar
Tüm modeller her test durumunu geçti. Bu nedenle aşağıdaki tablo yalnızca bir şeyle ilgilidir: verimlilik:
| Model | Çıktı tokenları (iki görev de) | Görev 1 süresi | Maliyet |
|---|---|---|---|
| Kimi K2.7 Code | 2,183 | 45.2s | $0.0090 |
| DeepSeek V4 Flash | 2,231 | 16.7s | $0.00066 |
| DeepSeek V4 Pro | 2,527 | 37.3s | $0.0023 |
| MiniMax M3 | 5,409 | 36.7s | $0.0067 |
| GLM-5.2 | 7,130 | 99.3s | $0.0318 |
| Claude Opus 4.8 (baseline) | 539 | 8.1s | — |
Token sütunu işin özünü anlatıyor. GLM-5.2 ve MiniMax M3, "thinking" modelleridir: varsayılan olarak yanıt vermeden önce uzun uzun akıl yürütürler. Bu akıl yürütme, çıktı olarak ücretlendirilir. Aynı doğru işlev için GLM-5.2, Kimi K2.7 Code’dan 3 kat daha fazla token yazdı.
Bir token sınırıyla daha da kötüleşiyor. Yanıtları 2.048 token ile sınırladığımızda, her iki düşünme modeli de tüm bütçeyi akıl yürütmeye harcadı ve hiç kod döndürmedi. Parayı ödersiniz, hiçbir şey almazsınız. GLM-5.2’nin tamamlanması için 16.384 token’lık bir üst sınıra ihtiyacı oldu ve başarısız iki denemesi tek başına yaklaşık 0,045 $ tuttu. Bir kodlama ajanı içinde düşünme modeli kullanıyorsanız, max_tokens değerini yükseltin ya da rutin düzenlemeler için düşünmeyi kapatın.
Karşılaştırma için, Claude Opus 4.8 her iki görevi de 539 token ile çözdü. Açık modeller doğrulukta yetişti; kısa olma konusunda ise kapalı temel model hâlâ 4 kat önde.
Dağıtım katmanına göre en iyi açık kaynak kodlama modelleri
Modelün çalışacağı yere göre seçim yapın. Fiyatlar 1M token başınadır, doğrulandı 2026-07-17.
Bekleyebilirseniz en güçlü model: GLM-5.2
Zorlu, çok adımlı kodlama işlerinde GLM-5.2'nin çıktı kalitesi, açık bir modelin şu anda Claude seviyesine en çok yaklaştığı noktadır — ajan tabanlı benchmark'larda (SWE-Bench Pro, Terminal-Bench 2.1) liderdir ve kendi uzun süreli kullanımımızda, diğerlerinin tökezlediği sorunlarda güvendiğimiz model odur. Daha fazlası için GLM-5.2 API rehberimize bakın.
Bu kalitenin bedeli sabırdır. Testimizdeki en yavaş ve en açgözlü model oydu (Görev 1’de 99,3 sn ve 5.695 token), ve ağır servis hızı modelin kendisinden çok satıcı tarafındaki kısıtlı GPU kapasitesini yansıtıyor. Girişte $1.40 / çıkışta $4.40, 1M bağlam, sade MIT. Zor problemleri ve büyük bir token bütçesini ona verin; hızlı düzenlemeleri başka yere yönlendirin.
Hızlı API kodlama ajanları için en iyisi: Kimi K2.7 Code
Test ettiğimiz en token-verimli açık model: hata düzeltmesi 259 token aldı, Claude benzeri kısalıkta. Ayrıca Kilo'nun görev tamamlama benchmark'ında %60,7 ile lider.
Fiyatlandırma: girişte $0.95 / çıkışta $4.00, cache hits için $0.19. Tek gerçek sınırlama bağlamdır: 262K token, oysa bu listenin geri kalanı 1M sunuyor. En yakın rakibine karşı nasıl konumlandığını görmek için Kimi K2.7 Code vs GLM-5.2 bölümüne bakın.
En iyi değer: DeepSeek V4 Flash
$0.14 giriş / $0.28 çıkış, buradaki açık ara en ucuz model ve önüne koyduğumuz her şeyi yine de geçti; açık modeller arasında en hızlısı. Yayınlanan skorları (%79.0 SWE-Bench Verified, %91.6 LiveCodeBench) büyük kardeşinin yalnızca iki puan gerisinde. Bağlam 1M token, lisans ise dümdüz MIT.
Buradan başlayın. V4 Pro'ya yalnızca çok dosyalı çalışma farkı ortaya çıkarmaya başladığında geçin.
24GB tüketici GPU’sunda en iyi: Qwen3.6-27B
Tek bir tüketici kartına sığan bir modelden SWE-Bench Verified üzerinde %77,2 puan alan yoğun bir 27B; bu yüzden r/LocalLLaMA başlıklarında "I have 24GB of VRAM." diye başlayan, tekrar tekrar önerilen cevaptır.
Daha hızlı kardeşi Qwen3-Coder-Next (toplam 80B, token başına yalnızca 3B aktif, Apache 2.0) toplulukta hız tercihi olarak öne çıkıyor: bir kullanıcı onu tam 262K bağlamda tek bir RX 9070 XT üzerinde ~20 token/sn hızında çalıştırdı. API olarak kullanmayı tercih ederseniz, Alibaba Cloud üzerinden fiyatlandırma $0.30/$1.50'dan başlıyor.
En iyi tek GPU kendi kendine barındırma: Gemma 4 31B
Google'ın model kartına göre, 31B sürümü 256K bağlamla tek bir 80GB H100'e sığar ve Apache 2.0 kapsamındadır. 12B varyantı 16GB VRAM'de çalışır.
Bir boyutlandırma tuzağı: MoE modelleri küçük "active" parametre sayılarıyla tanıtılır, ancak yine de tüm ağırlıkları depolamanız gerekir. DeepSeek V4 Flash, token başına 13B’yi etkinleştirir ancak toplamda 284B ağırlığındadır; 4-bit’te bile yaklaşık 142GB. Bu, tek bir kartlık değil, çoklu GPU gerektiren bir projedir.
Uzun otonom çalıştırmalar için en iyi bütçe seçimi: MiniMax M3
1M bağlam, $0.30/$1.20 fiyatla, çok saatli ajan oturumları için tasarlandı — MiniMax, 12 saatlik gözetimsiz bir araştırma çalışmasını göstermiştir. Sonuçlar tablosunda gördüğünüz düşünme modeli ayrıntı düzeyini paylaşır, bu yüzden token bütçenizi buna göre ayarlayın. Uzun bir çalışmada maliyetten çok kalite önemliyse, yukarıdaki GLM-5.2 yükseltmedir.
Sıralama tablolarının size söylemediği şey
Benchmark sayıları artık birbirine yakın: Stanford'un AI Index'i, #1 ve #10 model arasındaki farkın bir yılda %11.9'dan %5.4'e düştüğünü buldu. Skor tablolarının hâlâ gizlediği üç şey:
Görev başına maliyet, token başına maliyeti geride bırakır. GLM-5.2'nin $4.40 çıktı fiyatı Kimi'nin $4.00 değerine yakın görünüyor. Gerçek token sayılarından sonra, aynı iş 3.5x daha pahalıya mal olur. Kilo'nun canlı istatistikleri uç örneği gösteriyor: DeepSeek V4 Pro, $0.87 etiket fiyatıyla tamamlanan her benchmark denemesi başına ortalama $15.91 tutuyor.
Aynı model, farklı altyapı, farklı sonuç. İyi oluşturulmuş bir agent döngüsü içinde (yapılandırılmış araçlar, yeniden denemeler, makul token sınırları) bulunan bir model, ham bir chat çağrısındaki aynı model gibi davranmaz. GLM zero-code hatalarımız bir yapılandırma etkileşimiydi, bir yetenek eksikliği değil.
Her benchmark farklı bir işi ölçer. LiveCodeBench algoritmik üretimdir; DeepSeek V4 Pro bunu %93.5 ile kazanır ve kapalı modellerin yayımlanmış skorlarının üzerindedir. SWE-Bench Verified repo düzeyinde hata düzeltmedir; Claude Mythos 5, açık modeller yaklaşık %80 civarındayken %95.5 ile hâlâ liderdir. Bir sıralamaya güvenmeden önce benchmarkı gerçek işinizle eşleştirin.
Claude aboneliğini değiştirme
Açık kaynak olmaya yönelten yaygın bir tetikleyici: iş gününün ortasında Claude’un abonelik limitlerine takılmak. Matematik tutuyor. İki görevli sorgumuz DeepSeek V4 Flash üzerinde $0.00066 tuttu; günde bu türden birkaç yüz çağrı bile bir doların altında kalıyor.
Geçiş, eskisine göre artık daha az zahmetli. DeepSeek, Anthropic uyumlu bir uç nokta (api.deepseek.com/anthropic) yayınlıyor; bu sayede Claude Code, yalnızca bir ortam değişkeni değişikliğiyle onu kullanabiliyor; aynı kurulum GLM-5.2 için de çalışır. Ve rutin işleri açık modellere yönlendirirken Claude’u zor problemler için saklamak istiyorsanız, AIReiter gibi platformlar Claude’u aynı Anthropic uyumlu arayüz üzerinden liste fiyatının %20’sine sunar.
Kimi K3: izlenmesi gereken model
Moonshot, Kimi K3'ü 16 Temmuz 2026'da yayınladı ve frontend çalışmalarında şimdiden en güçlü kapalı modeli geride bıraktı: Frontend Code liderlik tablosunda 1.679 ile #1 sırada, Claude Fable 5'in 1.631'inin önünde ve ilk uygulamalı raporlar da aynı yöne işaret ediyor.
Burada sıralanmamasının tek bir nedeni var: ağırlıklar 27 Temmuz'da açılıyor. O zamana kadar, $3/$15 fiyatla kapalı bir API. Yayınlandıklarında, K3 bugüne kadar yayımlanan en büyük açık ağırlıklı model olacak ve yukarıdaki frontend rakamları bu listenin en üstü için yarışacağını gösteriyor. K3 açık ağırlık sürümünü ayrı olarak takip ediyoruz.
Nasıl seçilir
1. Nerede çalışacak? 16GB VRAM altında: bir API kullanın (Gemma 4 12B yerel olarak sığar, ancak gerçek bir kalite düşüşü bekleyin). 24GB: Qwen3.6-27B. Bir H100: Gemma 4 31B. API: DeepSeek V4 Flash, yetersiz olduğu kanıtlanana kadar. 2. Nasıl bir iş? Hızlı düzenlemeler kısa modelleri tercih eder: Kimi K2.7 Code veya DeepSeek. Zor problemler ve uzun ajan çalışmaları, cömert token bütçeleriyle GLM-5.2'yi (veya bütçeye uygunsa MiniMax M3) tercih eder. 3. Lisans kısıtlamaları? MIT (GLM, DeepSeek) ve Apache 2.0 (Qwen, Gemma) hiçbir koşul içermez. Kimi'nin değiştirilmiş MIT lisansı, yalnızca çok büyük ticari ölçekte devreye giren bir atıf kuralı ekler.
SSS
2026'da kodlama için en iyi açık kaynak LLM hangisidir?
GLM-5.2 en yüksek potansiyele sahiptir — zor problemlerде Claude Sonnet seviyesine yakın çıktı, ancak hızdan ödün vererek. Kimi K2.7 Code, API agents için token verimliliğinde öne çıkar; yerel donanım için Qwen3.6-27B, maliyette ise DeepSeek V4 Flash.
Bu modelleri yerel olarak ücretsiz çalıştırabilir miyim?
Ağırlıklar ücretsizdir; donanım ise değil. 27B’lik bir model 24GB’lık bir GPU gerektirir, Gemma 4 31B 80GB ister ve trilyon parametreli amiral gemileri yalnızca API veya küme üzerinden kullanılabilir.
Açık kaynak ile açık ağırlıklı arasındaki fark nedir?
Açık ağırlık, özgür ağırlıklar ancak özel eğitim verisi ve kod anlamına gelir; bu da buradaki neredeyse her modeli tanımlar. Tam açık kaynak modelleri (OpenCoder, StarCoder2, IBM Granite Code) her şeyi yayımlar ancak yetenek bakımından geride kalır.
Kodlama için Claude kadar iyi bir açık kaynak LLM var mı?
Algoritmik benchmarklarda evet: DeepSeek V4 Pro’nun %93.5 LiveCodeBench skoru, yayımlanmış kapalı model skorlarını geride bırakıyor. Depo düzeyi düzeltmelerde ise Claude hâlâ önde (%95.5’e karşı yaklaşık %80 SWE-Bench Verified). Testimizde açık modeller doğruluk açısından Claude ile aynı seviyeye geldi, ancak 4–13 kat daha fazla token kullandı.
C++ veya niş diller için en iyi açık kaynak LLM hangisidir?
Kimi'nin K2 serisi, en güçlü niş dil itibarına sahiptir (Moonshot özellikle Zig'i öne çıkarıyor). C++ için topluluk mutabakatı DeepSeek V4 Pro ve Qwen3 Coder Next'i işaret ediyor. Ne seçerseniz seçin, kendi kod tabanınızda test edin; niş dil kalitesi, Python benchmark'larının ima ettiğinden çok daha fazla değişkenlik gösterir.
