0.9B’den 375B’ye uzanan altı modellik bir seri, her ölçek için hazır bir dağıtım seçeneği varmış izlenimi yaratıyor. Ancak maliyet tarafı o kadar basit değil. K2 Horizon’ın Apache 2.0 lisansı model lisansı ücretini ortadan kaldırıyor; MoVA aktif hesaplama yükünü azaltıyor; fakat depolama, KV önbelleği, çalışma zamanı ve donanım maliyetleri yerinde duruyor.
Apache 2.0 ile gelen altı K2 Horizon modeli
IFM, 3 Eylül 2026 tarihinde K2 Horizon’ı altı modelden oluşan bağlantılı bir aile olarak duyurdu: 375B-A23B, 36B-A4B, 32B, 7B, 3.7B ve 0.9B. Duyuruya göre modeller ve kod Apache 2.0 altında yayımlanırken veri setleri kendi geçerli lisanslarına tabi (IFM duyurusu).
Tek aile, altı model ve farklı olgunluk seviyeleri
Ailenin üyeleri şöyle:
| Model | Mimari | Resmî konumlandırma | Resmî materyallerde belirtilen bağlam |
|---|---|---|---|
| K2 Horizon 0.9B | Yoğun | Saatler, gözlükler, kısıtlı edge cihazlar | 128K / 131,072 token |
| K2 Horizon 3.7B | Yoğun | Telefonlar, ince ayar, hafif yerel işler | 512K / 524,288 token |
| K2 Horizon 7B | Yoğun | Telefonlar, yerel asistanlar, kodlama ve ajanlar | 512K / 524,288 token |
| K2 Horizon 32B | Yoğun | İş istasyonları ve şirket içi sunucular | 512K / 524,288 token |
| K2 Horizon MoVA 36B-A4B | Seyrek MoE + MoVA | Yerel ve verimli sunum | 512K / 524,288 token |
| K2 Horizon 375B-A23B | Seyrek MoE | Kurumsal ve çok hızlandırıcılı dağıtımlar | 512K / 524,288 token |
0.9B modelinin daha küçük kelime haznesi kullanması dışında aile, aynı mimari tabanı ve dağıtım araçlarını paylaşıyor. Bu ortak temel, modeller arasında geçişi ya da boyuta göre yönlendirmeyi kolaylaştırmayı hedefliyor (IFM basın bülteni).
Burada önemli bir olgunluk farkı var: resmî K2-Horizon-32B kartı, görünen checkpoint’i Stage1 olarak tanımlıyor ve nihai checkpoint’in henüz yayımlanacağını söylüyor. Buna karşılık MoVA 36B-A4B ile 375B-A23B kartları, nihai checkpoint’lerin yayımlandığını belirtiyor. Dolayısıyla “altı model duyuruldu” ifadesi doğru; ancak “altısının da üretime hazır nihai checkpoint’i var” demek doğru değil (32B model kartı, 375B model kartı).
Apache 2.0, kendi altyapısında çalıştıran ekip için ne sağlar?
Apache 2.0, ekiplerin modeli ve kodunu değiştirmesine, yeniden dağıtmasına ve ticari ürünlerine token başına bir ücret ödemeden entegre etmesine izin veriyor. IFM, veri setlerinin ODC-BY gibi kendi koşullarına tabi olduğunu; kısıtlı kaynakların doğrudan yeniden dağıtılamayabileceğini belirtiyor (IFM duyurusu).
Apache 2.0 lisans bedelini kaldırır, operasyon faturasını değil. GPU kiralama ya da amortismanı, model depolama, KV önbellek kapasitesi, çalışma zamanı mühendisliği, izleme ve güvenlik incelemesi hâlâ maliyet kalemi. Ayrıca 36B sunum tarifi ile 375B model kartı, örneklerinde trust_remote_code=True kullanımını gösteriyor.
Önce bellek: altı modelin kapasite hesabı
Parametre sayıları model kapasitesini kıyaslamak için faydalı, ancak kendi altyapısında çalıştırmada ilk sınır genellikle ham ağırlık depolamasıdır. Aşağıdaki tahminlerde BF16 için parametre başına iki bayt, idealize edilmiş 4-bit gösterim için parametre başına yarım bayt kullanıldı. Meta veriler, çalışma zamanı tamponları, KV önbelleği, tokenizer dosyaları ve işletim sistemi belleği hesaba katılmadı.
| Model | Planlamada kullanılan toplam parametre | Token başına aktif parametre | Ham BF16 planlama alt sınırı | İdealize edilmiş 4-bit alt sınırı | Pratik seviye |
|---|---|---|---|---|---|
| K2 Horizon 0.9B | 0.9B | 0.9B | ~1.8 GB | ~0.45 GB | Edge ve gömülü sistem denemeleri |
| K2 Horizon 3.7B | 3.7B | 3.7B | ~7.4 GB | ~1.85 GB | Kompakt yerel veya mobil kullanım |
| K2 Horizon 7B | 7B sınıfı | 7B sınıfı | ~14 GB* | ~3.5 GB* | İlk ciddi yerel test |
| K2 Horizon 32B | 32B | 32B | ~64 GB | ~16 GB | İş istasyonu veya sunucu |
| K2 Horizon MoVA 36B-A4B | 36B | ~4B | ~72 GB | ~18 GB | Quantize iş istasyonu veya çok GPU’lu sunum |
| K2 Horizon 375B-A23B | 375B | ~23B | ~750 GB | ~187.5 GB | Kurumsal veya küme ölçeği |
\*7B model kartı modeli “7B-core” olarak adlandırırken Hugging Face meta verileri 9B parametre gösteriyor. Kapasite planlaması yalnızca aile etiketine değil, depodaki gerçek dosyalara dayanmalı (7B model kartı).
Somut depolar, bu değerlerin neden birer alt sınır olduğunu gösteriyor. 0.9B BF16 GGUF 2.16 GB, 3.7B BF16 GGUF 10.1 GB, 32B Stage1 BF16 GGUF 69.6 GB ve MoVA 36B BF16 GGUF 74.9 GB olarak listelenmiş durumda (0.9B GGUF, 3.7B GGUF, 32B GGUF, 36B GGUF).
Edge sınıfı: 0.9B, 3.7B ve 7B
0.9B ve 3.7B, depolama ihtiyacını en aza indiriyor. Bu modeller, hata toparlaması yoğun ajanlardan çok kısıtlı ve odaklı iş yüklerine hitap ediyor (0.9B model kartı, 3.7B GGUF kartı).
Aile içindeki ilk yerel deneme için en ayrıntılı dokümantasyon 7B modelinde bulunuyor: kartında akıl yürütme ve araç çağrısı ayrıştırıcıları, tek cihazlı tensor parallel ayarı ve quantize varyantlar yer alıyor. Görüntülenen benchmark tablosu SWE-bench Verified’da %70.6, Terminal-Bench 2.1’de %39.1 ve tau3-Banking’de %25.8 sonuçlarını raporluyor. Ancak tüm sonuçlar yüksek akıl yürütme eforuyla alınmış ve kart, protokol ayrıntılarının farklılık gösterebileceği uyarısını yapıyor (7B model kartı).
7B kartı yüksek akıl yürütme eforunu ve en az 32,768 çıktı token’ını öneriyor. Daha uzun akıl yürütme, üretim süresini uzatır; belleğe sığan bir modeli duvar saati açısından pahalı hâle getirebilir.
Yerel/sunucu sınıfı: 32B ve 36B-A4B
32B tamamen yoğun bir model olduğu için değerlendirmesi daha kolay; ancak Stage1 statüsü ve resmî 69.6 GB GGUF dosyası, planlamadaki asıl sınırlar (32B Stage1 GGUF).
MoVA 36B-A4B ise farklı bir soru soruyor: daha düşük aktif hesaplamaya sahip bir model, daha büyük toplam kapasiteyi korurken yoğun modellerin yetenek düzeyine yaklaşabilir mi? IFM’nin GGUF benchmark tablosu, model için tau3-Banking’de %26.8 ve listelenen karşılaştırma kümesinde lider olduğu Terminal-Bench 2.1’de %58.6 bildiriyor. Buna karşılık model, her bilim, olgusal doğruluk veya uzun bağlam ölçümünde lider değil (36B GGUF benchmark kartı).
Ağırlıklar belleğe yüklendikten sonra daha düşük aktif parametre sayısı sürdürülebilir throughput’u iyileştirebilir. Yine de sonuç; backend’e, batch yapısına, ara bağlantıya ve quantization’a bağlıdır.
Amiral gemisi: 375B-A23B
Resmî model kartında K2 Horizon 375B-A23B için doğrulanmış bir SGLang yapılandırması yer alıyor: sekiz H200 GPU, 8 tensor parallelism, 8 expert parallelism, BF16 ve FlashAttention-3 (375B model kartı).
Toplam ve aktif parametreler arasındaki oran, yoğun 375B bir modele kıyasla hesaplamayı azaltabilir. Fakat yaklaşık 750GB’lık BF16 planlama alt sınırı, altyapı eşiğini hâlâ belirliyor. Artificial Analysis, model için 47 Intelligence Index puanı ve görüntülenen sınıfta 112 model arasında #11 sıralaması veriyor; ancak çıktı hızı ya da görev başına maliyet verisi bildirmiyor (Artificial Analysis profili).
Şu anda dokümante edilmiş ve doğrulanmış sekiz H200 profiline bakıldığında, bunu küme ölçekli bir dağıtım olarak değerlendirmek gerekir.
MoVA hesaplamayı değiştiriyor, depolama tabanını değil
MoVA, Mixture-of-Value Attention ifadesinin kısaltması. Geleneksel mixture-of-experts tasarımlarında seyrek yönlendirme genellikle feed-forward katmanlarında uygulanır. IFM ise MoVA’nın uzman yönlendirmesini attention mekanizmasının value bileşenine taşıdığını; FlashAttention ve grouped-query attention gibi tekniklerle uyumunu koruduğunu anlatıyor (IFM mimari açıklaması).
36B-A4B etiketi ne anlatıyor?
“36B-A4B” adı iki farklı büyüklüğü ifade ediyor: toplamda yaklaşık 36B parametre erişilebilir durumda, ancak her token için yaklaşık 4B parametre etkinleşiyor. Bu, özellikle sürekli üretim yapılan iş yüklerinde aktif yolun çarpma-toplama işlemlerini ve bellek trafiğini azaltabilir.
Bu, kullanılmayan uzmanların ortadan kalktığı anlamına gelmiyor. Resmî GGUF dosyası BF16’da 74.9 GB; vLLM tarifi ise embedding’ler dâhil 37.44B depolanmış parametre ve token başına 5.95B aktif parametre içeren bir model tanımlıyor. Bu değerler, aynı mimariye ait paketleme ve muhasebe perspektifleri; ayrı bir 37B modelin kanıtı değiller (vLLM tarifi).
Bu yapıyı anlamak için şu zihinsel model yararlı:
- Bellekte tutulan kapasite: Depolama ve bellek, seçilebilecek tüm ağırlıkları barındırmalıdır.
- Aktif hesaplama: Her token yalnızca yönlendirilmiş bir alt kümeyi kullanır.
- Çalışma zamanı durumu: KV önbelleği, geçici tamponlar, batch işlemleri ve framework yükü devam eder.
- Sistem maliyeti: Ara bağlantı, enerji, ana makine RAM’i ve operasyon süresi faturayı belirler.
512K bağlam iddiası neden bir bütçe hesabı değildir?
K2 Horizon kartları, büyük modeller için 524,288 token yerel bağlam desteği duyuruyor. Buna rağmen hem MoVA 36B-A4B hem de 375B-A23B için yayımlanan vLLM tariflerinde --max-model-len 131072 yapılandırması var; bu değer, öne çıkarılan maksimumun dörtte biri (36B vLLM tarifi, 375B model kartı).
131K’lık tarifler, yerel 512K bağlamın ücretsiz bir sunum varsayılanı olmadığını gösteriyor: daha uzun bağlamlar KV önbelleğini büyütür, eşzamanlılığı düşürür ve prompt gecikmesini artırır.
Maliyetli kendi altyapında çalıştırma senaryoları
K2 Horizon için temel alınabilecek şeffaf ve evrensel bir API fiyatı yok. Resmî MoVA GGUF sayfası, modeli şu anda hiçbir inference sağlayıcısının dağıtmadığını söylüyor. Artificial Analysis ise 375B profili için $0.00 giriş ve çıkış fiyatı gösterirken hız ve görev başına maliyet alanlarını kullanılamaz olarak işaretliyor; bu, ücretsiz bir üretim endpoint’i olduğuna dair kanıt sayılmaz (MoVA GGUF kartı, Artificial Analysis).
| Senaryo | Sağladığı değer | Başlıca ekonomik risk | Sonuç |
|---|---|---|---|
| Uygun bir 4-bit 36B quant ile 24GB sınıfı GPU | Düşük maliyetli deneme ve gizlilik | Bağlam ve eşzamanlılık için az boşluk; quant ve çalışma zamanı desteği olgunlaşmamış olabilir | Pilot için en uygun seçenek, garantili üretim hedefi değil |
| 32B BF16 veya 36B BF16 iş istasyonu | Daha yüksek doğruluk ve daha sade kalite karşılaştırmaları | Önbellek ve çalışma zamanı belleği öncesinde 64–75GB ağırlık | Genellikle çok GPU’lu veya yüksek bellekli sistem gerekir |
| İki H200 tarzı 36B sunumu | Dokümante edilmiş MoVA sunum biçimiyle uyum | Kiralama, ana makine, depolama ve kullanım oranı maliyetleri | Sürekli servis veya kontrollü değerlendirme için makul |
| Sekiz H200 ile 375B sunumu | Amiral gemisi kapasitesi ve kurumsal ölçekli throughput | Yüksek sermaye ya da saatlik altyapı taahhüdü | Yalnızca küme ölçeğinde |
24GB sınıfında bir deneme
36B bir model için idealize edilmiş 4-bit alt sınır yaklaşık 18GB. Bu da 24GB kartta quantization meta verileri, çalışma zamanı tamponları ve KV önbelleği için 6GB’tan az alan bırakıyor. Bu hesap, orta uzunlukta bağlamlarda 24GB sınıfı bir testi olası kılıyor; ancak evrensel bir minimum ortaya koymuyor. Kullanılabilir bir çalışma için gerekli koşulları tam quantization yöntemi, backend, offload politikası ve prompt uzunluğu belirlemeye devam eder.
Referans verilen resmî MoVA GGUF artefaktı, küçük bir tüketici quantization’ı değil BF16 sürümü. Hugging Face koleksiyonu aile genelinde GGUF ve FP8 varyantlarını listeliyor; ancak sürüm günündeki dönüştürme ve uyumluluk çalışmaları da dağıtım bütçesine dâhil edilmeli (K2 Horizon koleksiyonu).
“Sanırım diğer GGUF’ları hâlâ yüklüyorlar--şimdilik gördüğüm tek şey BF16 GGUF” — r/LocalLLaMA içinde u/apoptosist.
Dokümante edilmiş 36B yolu için iki H200
IFM’nin MoVA vLLM tarifi; 2 tensor parallelism, expert parallelism, BF16 ve 131,072 token’lık sunum limiti kullanıyor. SGLang dokümantasyonu bu yapılandırmanın 2× H200 üzerinde doğrulandığını belirtiyor; bu, model adının tek başına verdiği sinyalden daha güçlü bir donanım göstergesi (vLLM tarifi, resmî GGUF kartı).
Sağlayıcıların yayımladığı fiyatlar, kullanım oranının neden kritik olduğunu gösteriyor. DigitalOcean, özel NVIDIA H200 için GPU-saat başına $4.47 ve 8× H200 yapılandırması için saatte $35.78 listeliyor. Google Cloud ise bağlı vCPU, bellek ve SSD’nin makine türü fiyatına dâhil olduğu 8× H200 A3 Ultra makinesi için saatte $84.806908493 fiyatını veriyor (DigitalOcean fiyatlandırması, Google Cloud fiyatlandırması).
Listelenen GPU başı fiyatla iki H200, ana makine ve depolama maliyetleri hariç yaklaşık saatte $8.94 ya da 730 saatlik ayda $6,526 anlamına geliyor. Bu rakamı iki GPU’lu bir fiyat teklifi olarak değil, kullanım oranına duyarlı bir referans olarak değerlendirin.
375B-A23B için sekiz H200
Amiral gemisinin resmî sunum tarifi sekiz H200, TP=8, EP=8 ve BF16 kullanıyor. Bu yapılandırma, modelin yaklaşık 750GB’lık ham BF16 planlama alt sınırıyla uyumlu ve kurumsal eşiği net biçimde ortaya koyuyor (375B model kartı).
Google’ın listelediği 8× H200 makine fiyatı olan saatte $84.81, 730 saat için yaklaşık $61,909 ediyor. Vergiler, veri transferi, kalıcı depolama ve uygulama operasyonları buna dâhil değil. Bu değer bir altyapı referansı; K2 Horizon fiyatı ya da yayımlanan tarifin belirli bir token/saniye düzeyine ulaşacağının garantisi değil.
İlk kendi altyapında çalıştırma verileri ne söyler, ne söylemez?
İlk raporlar K2 Horizon’ın çalıştırılabildiğini gösteriyor. Ancak farklı quantization yöntemleri ve çalışma zamanları, henüz evrensel bir maliyet-performans eğrisi oluşturmuyor.
X’te yayımlanan ayrıntılı bir rapor, backend’in ne kadar etkili olabileceğine iyi bir örnek:
“36B-A4B MoVA, llama.cpp ile 2x 5090 üzerinde 131-142 tok/s veriyor (IFM’nin fork’u, Q8_0, 131K ctx); vLLM’de ise 52...” — @abtraore_.
Faydalı ama kontrolsüz bu rapor, backend ve yapılandırma belirtilmeden “MoVA daha hızlı” demenin eksik kaldığını gösteriyor.
Reddit tartışmalarında quantization, düşük VRAM, karşılaştırma ve araç çağrısı konusunda çözülmemiş sorular görülüyor; henüz doğrulanmış performans değil (r/LocalLLaMA başlığı).
Ciddi bir satın alma kararı için eksik olan ölçümler şunlar: quantization’a göre bellekteki gerçek kullanım, bağlam uzunluğuna göre KV önbellek büyümesi, prompt ve üretim hızı, araç çağrısı güvenilirliği, güç tüketimi ve kontrollü tek bir iş yükünde başarılı görev başına maliyet.
Aktif parametre pazarlamasına değil, kullanım oranına göre seçin
Doğru K2 Horizon modeli; ne sıklıkta çalışacağına, ne kadar bağlama ihtiyaç duyduğuna ve çıktı kalitesinin altyapı maliyetini haklı çıkarıp çıkarmadığına bağlı. Kısa süreli bir pilotta geri dönülebilirlik, sürekli açık özel bir serviste ise kullanım oranı ve operasyonel kararlılık öncelikli olmalı.
| İş yükünüz | Başlangıç modeli | Neden | Ne zaman durmalı veya yükseltmeli? |
|---|---|---|---|
| Giyilebilir, gömülü ya da dar kapsamlı sınıflandırıcı tarzı görev | 0.9B | En küçük ayak izi ve 128K bağlam iddiası | Araç derinliği veya alan kapsamı darboğaz olduğunda |
| Kompakt yerel asistan ya da ince ayar denemesi | 3.7B | 0.9B’den daha geniş akıl yürütme ile düşük depolama yükü | Kodlama ve hata toparlama sorunları baskın hâle geldiğinde |
| İlk ciddi yerel kodlama/ajan pilotu | 7B | Ayrıştırıcıları, tensor parallelism’i ve quantize varyantları dokümante ediyor | Uzun görevlerde daha güvenilir planlama veya araç kullanımı gerektiğinde |
| Yoğun model taban çizgisine sahip yüksek kapasiteli iş istasyonu | 32B Stage1, temkinli şekilde | Yoğun davranışı karşılaştırmak daha kolay, ancak mevcut checkpoint nihai değil | Nihai checkpoint ve ölçülmüş sonuçlar bellek maliyetini haklı çıkardığında |
| Aktif hesaplamanın önemli olduğu tekrarlı yerel/sunucu inference | MoVA 36B-A4B | Daha düşük aktif parametre sayısı ve dokümante edilmiş TP=2/EP yolu | Bağlam, eşzamanlılık veya çalışma zamanı sürtünmesi verimlilik kazancını yok ettiğinde |
| Kurumsal akıl yürütme ve uzun soluklu ajanlar | 375B-A23B | Ailenin en yüksek kapasiteli üyesi ve dokümante edilmiş 8× H200 yolu | Görev başına maliyet veya kullanım oranı iş gerekçesini karşılamadığında |
İlk pilotta model değiştirmeden önce beş değeri kaydedin: tepe VRAM/RAM, prompt uzunluğu, ilk token’a kadar geçen süre, saniyede üretilen token ve tamamlanan görev başına maliyet. İş yükü daha fazlasının KV önbellek ve gecikme maliyetine değdiğini kanıtlayana kadar bağlam limitini dokümante edilmiş 131,072 token seviyesinde tutun.
Soru, belirli bir makineye hangi aile üyesinin sığacağıysa ayrı K2 Horizon model boyutlandırma rehberi bu daha dar seçim konusunu ele alıyor. Bu sayfa ise aktif parametre etiketleri yerine kullanım oranını ve ölçülmüş görev maliyetini öne çıkarıyor.
K2 Horizon modelleri: Sık sorulan sorular
Apache 2.0, tüm K2 Horizon veri setlerinin de Apache 2.0 olduğu anlamına mı gelir?
Hayır. IFM, modellerin ve kodun Apache 2.0 kullandığını; veri setlerinin ise ODC-BY gibi geçerli lisanslarına tabi olduğunu belirtiyor. Yeniden dağıtım veya ticari eğitim kullanımı öncesinde her depoyu ve veri setini kontrol edin (IFM duyurusu).
4B aktif parametre, K2 Horizon MoVA 36B-A4B’nin 4B model kadar belleğe ihtiyaç duyduğu anlamına mı gelir?
Hayır. Model token başına yaklaşık 4B parametreyi etkinleştiriyor, ancak resmî BF16 GGUF dosyası yaklaşık 74.9GB. Gerçek bellek gereksinimini ağırlık depolaması, KV önbelleği, çalışma zamanı tamponları, quantization ek yükü ve eşzamanlılık belirler.
Tek bir 24GB GPU, K2 Horizon MoVA 36B-A4B’yi çalıştırabilir mi?
Uygun bir 4-bit quantization, 36B ağırlıklar için idealize edilmiş taban yaklaşık 18GB olduğu için orta uzunluklu bağlamda bir denemeyi mümkün kılabilir. Ancak resmî BF16 artefaktı ve doğrulanmış iki H200 sunum yolu çok daha fazla boşluk gerektiriyor. Bu nedenle 24GB sonucu, genel bir üretim garantisi değil pilot yapılandırması olarak görülmeli.
Duyurulan 512K bağlamı sunmak ekonomik mi?
Otomatik olarak değil. Model kartları 524,288 token’lık yerel bağlamı belirtirken dokümante edilmiş vLLM örnekleri 131,072 token kullanıyor. Daha uzun bağlam KV önbellek ihtiyacını ve gecikmeyi artırır; çoğu durumda eşzamanlılığı da azaltır.
K2 Horizon 375B-A23B normal bir kendi altyapında çalıştırma modeli mi?
Hayır. IFM sekiz H200’lü bir SGLang yapılandırması dokümante ediyor ve ham BF16 planlama alt sınırı, çalışma zamanı ek yükü öncesinde yaklaşık 750GB. Bir sağlayıcı daha küçük doğrulanmış bir yapılandırma yayımlamadığı sürece bunu kurumsal veya küme dağıtımı olarak ele alın.
K2 Horizon 375B için gösterilen $0.00 fiyatı gerçekten ücretsiz bir API mi?
Bu yönde bir sonuç desteklenmiyor. Artificial Analysis $0.00 giriş ve çıkış fiyatı gösterse de hız ile görev başına maliyeti kullanılamaz olarak listeliyor; resmî model sayfasında da Hugging Face inference sağlayıcısı yok. Bu rakamı bütçede kullanmadan önce adı belirtilmiş bir sağlayıcının sözleşmesini ve fiyat listesini doğrulayın.