Aynı kodlama görevlerini Kimi K2.7 Code ve Claude Opus 4.8’e tek bir API üzerinden gönderdim ve geri dönenleri ölçtüm. Doğrulukta berabere kaldılar: ikisi de bir SemVer öncelik tuzağını ve gizli bir aralık-birleştirme hatasını başarıyla çözdü. Ancak Opus, çıktı token’larının dörtte biriyle 3–9× daha hızlı yanıt verdi; buna karşılık Kimi, liste fiyatına göre görev başına yaklaşık %46 daha ucuzdu. Dolayısıyla seçim, hangi modelin "daha akıllı" olduğu ile ilgili değil. Maliyete duyarlı veya toplu kodlama işleri yürütüyorsanız, fiyat açısından Kimi K2.7 kazanıyor. Düşük gecikme, 1M token’lık bağlam ya da güvenebileceğiniz bir son inceleme modeli gerekiyorsa, Opus 4.8 ekstra ücrete değer; birçok ekip sonunda ikisi arasında yönlendirme yapıyor.
Uygulamalı: Aynı kodlama görevlerini ikisinden de geçirdim
Nasıl test ettim: model kimlikleri kimi-k2.7-code ve claude-opus-4-8, 2026-07-13 tarihinde tek bir OpenAI uyumlu gateway uç noktası üzerinden çağrıldı; her görev için varsayılan parametrelerle, prompt önbellekleme olmadan tek atış yapıldı. Gecikme, istemci tarafında ölçülen gerçek zamanlı süredir; bu nedenle yalnızca üretim süresini değil, ağ ve kuyruk süresini de içerir. Puanlamadan önce, bir sağlamlık kontrolü olarak her modelden kendini tanımlamasını istedim (Kimi "made by Moonshot AI" yanıtını verdi, Opus ise Anthropic dedi); bu bir yönlendirme kontrolüdür, sürümün kanıtı değildir. Bu, iki görevlik bir örnektir, bir benchmark değildir. Hissedebileceğiniz davranışı gösterir; çok turlu, ajanik performansı ölçemez.
Görev 1, her modelden SemVer 2.0.0 spesifikasyonunu izleyen bir compare_semver() işlevi uygulamasını istedi; buna çoğu uygulamanın yanlış yaptığı bölüm de dahildi: ön sürüm önceliği, burada 1.0.0-alpha.1 < 1.0.0-alpha.beta, sayısal tanımlayıcılar alfasayısal olanlardan daha düşük sırada yer alır ve beta.11 > beta.2 dize sırasına göre değil, sayısal olarak değerlendirilir. Her yanıtı, spesifikasyonun kanonik sıralamasından oluşturulmuş 72 karşılaştırmalı bir matrisle değerlendirdim. Görev 2, gerçek hatası last[1] = cur[1] yerine max(...) olması gereken, hatalı bir merge_intervals() işlevi verdi; bu satır, [1,10],[2,3] gibi tamamen kapsanan bir aralığı sessizce yutar; ben de tamamen kapsanan bu aralık da dahil olmak üzere 5 durum üzerinden değerlendirdim.

Metrik | Kimi K2.7 Code | Claude Opus 4.8 |
|---|---|---|
Görev 1 doğruluğu (72 öncelik + uç durumlar) | 72/72 | 72/72 |
Görev 2 doğruluğu (iç içe aralık dahil 5 durum) | 5/5 | 5/5 |
Görev 1 gecikmesi (istemci tarafı) | 49.1s | 5.3s |
Görev 2 gecikmesi (istemci tarafı) | 11.5s | 7.6s |
Görev 1 tokenları (girdi / çıktı) | 172 / 1,907 | 774 / 418 |
Görev 1 maliyeti (yerel liste fiyatı) | $0.0078 | $0.0143 |
Maliyet, yukarıdaki token sayımlarından yerel liste fiyatlarıyla hesaplanmıştır (Kimi milyon başına giriş/çıkış için $0.95/$4, Opus $5/$25): Kimi = 172×$0.95/M + 1,907×$4/M ≈ $0.0078; Opus = 774×$5/M + 418×$25/M ≈ $0.0143. Girdi token sayıları (172 ile 774) farklıdır; bunun nedeni görevlerin farklı olması değil, her modelin tokenizer’ının ve gateway’in muhasebesinin aynı istemi farklı şekilde saymasıdır. Her iki model de her iki görevde de tamamen doğru kod üretti. Fark, oraya nasıl ulaştıklarındaydı. Opus kısa ve hızlıydı; Görev 1’de 5.3 saniyede 418 token döndürdü. Kimi 49.1 saniye sürdü ve 1,907 token üretti; bunun büyük kısmı, kodla birlikte geri döndürdüğü adım adım bir akıl yürütme iziydi. Ancak Kimi’nin tokenları yaklaşık 6× daha ucuz olduğu için, bu uzun çıktı yine de daha az maliyetli oldu.
Düello neyi kanıtlar ve neyi kanıtlamaz
Sınırlı, iyi tanımlanmış kodlama problemlerinde Kimi K2.7 Code’un bir frontier model ile aynı doğru cevaba ulaştığını kanıtlar. Ancak bu, Kimi’nin uzun, çok adımlı ajanik oturumlarda Opus ile aynı seviyede olduğunu kanıtlamaz; çünkü iki tek denemelik görev bunu ölçemez. Kimi’nin kendi en güçlü iddiası tam da bu ajanik alandadır ve aşağıdaki benchmark’lar bunu doğrudan ele almaktadır.
Karşılaştırmalar: üçüncü taraf ile Moonshot'ın kendi tablosu arasındaki fark nedir
İşte döküm, her sayı kaynağıyla etiketlenmiş halde. Kimi’nin en güçlü göründüğü yer Moonshot’un kendi raporladığı tablodur; bağımsız değerlendirme ise model yeni olduğu için daha sınırlıdır ve henüz üçüncü taraf bir K2.7 sayısı bulunmayan yerlerde, en yakın yayımlanmış değer K2.6 içindir (aşağıda işaretlenmiştir).
Benchmark | Kimi K2.7 Code | Claude Opus 4.8 | Kaynak |
|---|---|---|---|
MCPMark Verified (tool use) | 81.1 | 76.4 | Moonshot, self-reported |
SWE-bench Verified | 60.4% | aynı formatta yayımlanmadı | Moonshot, self-reported |
Intelligence Index | 35 (K2.6 proxy) | 56 | Artificial Analysis, third-party |
Output speed | ~45 tok/s (K2.6 proxy) | 59 tok/s | Artificial Analysis, third-party |
Karşılaştırmanın dayandığı tek sayı olan MCPMark Verified 81.1 ile 76.4, bağımsız bir laboratuvardan değil, Moonshot'un kendi tablosundan geliyor. Bu, onu göz ardı etmek için bir neden değil; çünkü MCP tarzı araç kullanımı tam da Kimi'nin ince ayarlandığı alan. Ancak "Kimi Opus'u geçiyor" başlığını, satıcı tarafından optimize edilmiş bir ölçüt üzerindeki bir satıcı iddiası olarak okuyun. Dışarıdan bir tarafça ölçülen tek bire bir karşılaştırmada, Artificial Analysis, Opus 4.8'i Intelligence Index'inde (56'ya karşı 35) belirgin şekilde öne koyuyor; ancak bu satır, yazım anında K2.7 bağımsız olarak puanlanmamış olduğu için K2.6'yı bir vekil olarak kullanıyor.
Bağlam penceresi boşluğunun gizlediği kıyaslamalar
Opus 4.8, 1M token bağlam penceresine sahiptir; Kimi K2.7 ise 256K ile sınırlıdır. Benchmark puanları bunu nadiren ortaya koyar, ancak asıl işi belirleyen budur. 256K’lık bir pencere, orta boy bir repo ile uzun bir ajan izini rahatça barındırır ve çoğu kodlama oturumu için yeterlidir. Tüm büyük bir monorepo’yu, uzun belge setlerini veya birkaç saatlik ajan transkriptlerini tek bir prompt’a beslediğinizde sınırı aşarsınız. Orada Opus’un 4 kat daha büyük penceresi, bir grafikteki bir nokta değil, pratik farktır.
Fiyatlandırma: 5–6× fark ve önbellek kaldıraç etkisi
Yerel API liste fiyatlarında, Kimi K2.7 Code milyon girdi tokenı başına 0,95 $ ve milyon çıktı başına 4,00 $; Claude Opus 4.8 ise 5 $ ve 25 $ seviyesinde çalışır. Bu, çıktı tarafında 5–6 katlık bir fark demektir ve ekiplerin Kimi'yi hiç değerlendirmesinin başlıca nedeni budur.
Çoğu fiyatlandırma tablosunun gözden kaçırdığı kaldıraç önbelleklemedir. Kimi, bir cache hit durumunda milyon token başına $0.19 ücret alır; bu, zaten gönderdiğiniz girişte %80 indirim demektir. Her adımda aynı codebase’i yeniden okuyan bir agentic loop’ta, faturanızı önbelleğe alınmış giriş domine eder, bu yüzden efektif maliyet etiket fiyatının çok altına düşer. Baseten’den Philip Kiely bildirdi ki Opus 4.8’den Kimi 2.7 Code’a geçtikten sonra örnek bir iş yükünde yaklaşık %82 tasarruf sağlandı; bu, Kimi’nin fiyatlandırmasının birleşik etki yarattığı türden cache- ve input-ağır bir iştir. Sizin rakamınız input-to-output oranınıza göre değişir, ancak yön aynıdır: ürettiğinize kıyasla bağlamı ne kadar çok yeniden okursanız, maliyet açısından Kimi o kadar fazla avantaj sağlar.
Opus, fiyatını çıktılar tarafında geri kazanıyor. Task 1’imde Kimi’nin ürettiği tokenların yalnızca dörtte birini üretti; bu yüzden büyük dosyalar yazmak ya da ayrıntılı yeniden düzenlemeler gibi üretim ağırlıklı işlerde, token başına fark gerçek harcamada daralıyor ve Opus’un hızı, bir mühendisin beklemesi için ödeme yaptığınız toplam süreyi azaltıyor.
Açık ağırlıkların vaadi ile 577GB gerçeği
Kimi K2.7, değiştirilmiş bir MIT lisansı altında açık ağırlıklarla sunulur; bu nedenle onu kendi altyapınızda barındırabilir ve fine-tune edebilirsiniz. Opus 4.8 ise yalnızca API üzerinden kullanılabilir; kodunuz ve reasoning kayıtlarınız Anthropic’e gider. Kağıt üzerinde bu, Kimi için belirleyici bir gizlilik ve kilitlenme karşıtı avantajdır. Pratikte ise önce donanım maliyetine bakın.
Kimi K2.7, 1 trilyon parametreli bir Mixture-of-Experts modelidir (token başına 32B aktif, 384 uzman). Bağımsız inceleyiciler, ağırlıklar, KV cache ve çalışma zamanı ek yükü hesaba katıldığında tam bir INT4 dağıtımını yaklaşık 577GB VRAM olarak değerlendiriyor; bu da minimum pratik kurulumu yaklaşık 8× H100 80GB ya da DGX Spark sınıfı bir kutuya denk getiriyor. Tek bir RTX 4090 (24GB), tam modeli kullanılabilir ayarlarda çalıştıramaz. Birkaç iyi fonlanmış ekip dışında herkes için “open weights”, bir hosting sağlayıcısına yönlendirme ya da kiralanmış GPU’larda fine-tune etme özgürlüğü anlamına gelir; modeli kurum içinde ayağa kaldırmak anlamına gelmez. Kimi’yi seçme nedeniniz kurum içi veri kontrolüyse, taahhütte bulunmadan önce kümenin maliyetini hesaplayın; çoğu ekip için self-hosting hâlâ teorik kalıyor.
Hangisini seçmelisiniz
Modeli bir kazanan seçmek yerine iş yüküne göre eşleştirin:
Fiyat hassasiyetinin yüksek olduğu, yüksek hacimli veya agentic kodlama için Kimi K2.7 Code'u seçin; burada bir codebase'i tekrar tekrar yeniden okursunuz, gecikme kritik değildir ve 256K bağlam yeterlidir. Önbellekleme indirimi sizin lehinize bileşik etki yaratır.
Düşük gecikmeye, büyük repo'lar veya uzun oturumlar için 1M-token bağlama, daha kısa çıktıya ya da yüksek riskli değişikliklerde güvenilecek bir son-inceleme modeline ihtiyaç duyduğunuzda Claude Opus 4.8'i seçin; bağımsız akıl yürütme puanlarındaki üstünlüğünün en çok önem kazandığı yer burasıdır.
Hibrit yaklaşım: ucuz model taslak oluşturur, sınır model tamamlar
Her ikisini de çalıştıran ekipler arasında en yaygın desen birini seçmek değil, yönlendirmedir. Kimi K2.7’nin toplu üretim ve yinelemeyi ucuza üstlenmesine izin verin, ardından nihai inceleme veya frontier yargısı gerektiren kısımlar için çıktıyı Opus 4.8’e aktarın. Kimi, OpenAI formatını yerel olarak konuşurken Opus Anthropic’in kendi API’sini kullanır; bu yüzden aralarında yönlendirme yapmanın pratik yolu, her ikisini de tek bir OpenAI uyumlu uç noktanın arkasında sunan bir gateway’dir; örneğin AIReiter gibi bir platformda ikisi de tek bir anahtar altında bulunur ve bu da Kimi’den Opus’a geçişi yeniden entegrasyon yerine yalnızca bir model dizesi değişikliği haline getirir. Yukarıdaki %82 tasarruf tam da bu tür bir yönlendirmeden geldi, Opus’u tamamen bırakmaktan değil.
SSS
Kimi K2.7, kodlama için Claude Opus 4.8'den daha mı iyi?
Sınırlı, iyi tanımlanmış görevlerde başa başlar; testimde ikisi de tamamen doğru kod döndürdü. Kimi'nin avantajı ajan benzeri araç kullanımıdır (MCPMark 81.1'e karşı 76.4, Moonshot tarafından bildirildi); Opus ise genel akıl yürütmede, hızda ve uzun bağlamlı çalışmalarda öndedir.
Kimi K2.7, Opus 4.8'den ne kadar daha ucuz?
Liste fiyatında yaklaşık 5–6× daha ucuzdur (milyon başına $0.95/$4 vs $5/$25). Tekrarlayan iş yüklerinde önbellek isabetleriyle ($0.19/M input), gerçek dünyadaki tasarruflar %80 veya daha fazlasına ulaşabilir.
Kimi K2.7 ile Opus 4.8’in bağlam penceresi nedir?
Kimi K2.7, 256K tokenu işler; Opus 4.8 ise 1M işler, dört kat daha büyük.
Kimi K2.7'yi yerel olarak çalıştırabilir miyim?
Yalnızca ciddi donanımla. Tam bir INT4 dağıtımının yaklaşık 577GB VRAM gerektirdiği bildiriliyor (kabaca 8× H100 veya bir DGX Spark). RTX 4090 gibi tek bir tüketici GPU’su tam modeli çalıştıramaz.
Kimi K2.7 açık kaynak mı?
Değiştirilmiş bir MIT lisansı altında açık ağırlıklar olarak sunulur; böylece kendi sunucunuzda barındırabilir ve fine-tune edebilirsiniz. Opus 4.8 kapalıdır ve yalnızca API üzerinden kullanılabilir.
Sonuç
Eğer darboğazınız bütçeyse, varsayılan olarak Kimi K2.7 Code'u seçin ve geri kalanını caching'e bırakın. Eğer mesele latency, context length ya da yanlış olmasını göze alamayacağınız bir değişiklikse, Opus 4.8 için ödeme yapın. open-weights lisansını, ancak GPU'lara sahipseniz kullanıma sokacağınız bir bonus olarak değerlendirin. Ve emin değilseniz, ikisini de kurup göreve göre yönlendirin; böylece iş akışını, sonradan geri almak zorunda kalacağınız tek bir bahse dayandırmamış olursunuz.
