AIREITER
API DOKÜMANLARIFİYATLANDIRMA
ŞABLONLAR
  • AIReiter
  • Blog
  • K2 Horizon Modelleri: Hangi Boyutu Kullanmalısınız? (2026)

K2 Horizon Modelleri: Hangi Boyutu Kullanmalısınız? (2026)

Son Güncelleme: 2026-09-03 19:00:37

K2 Horizon ailesinde 0.9B’den 375B’ye uzanan altı model var. Burada doğru tercih, parametre sayısının zirvesine bakarak değil; iş yükünüze, çalıştırma ortamınıza ve kullanılabilir belleğe göre yapılıyor.

Hızlı karar: parametre sayısına değil, iş yüküne bakın

IFM, altı K2 Horizon modelini resmî lansman yazısında belirtildiği üzere 3 Eylül 2026’da yayımladı. Modeller farklı dağıtım senaryolarını hedefliyor; duyurulan 512K bağlam penceresi de 512K’lık üretim iş yüklerinin otomatik olarak ekonomik olacağı anlamına gelmiyor.

Kullanım senaryonuzİlk tercihHam ağırlık planlaması*Temel uyarı
Kısıtlı edge veya gömülü sistem denemesiK2 Horizon 0.9B~1.8GB BF16; teorik 4-bit ~0.45GBYalnızca model boyutuna bakarak gerçek cihaz hızını tahmin etmeyin
Hafif yerel asistan veya fine-tuningK2 Horizon 3.7B~7.4GB BF16; teorik 4-bit ~1.85GBZorlu, çok adımlı ajan görevlerinde hatadan toparlanma küçük modeller için hâlâ zayıf nokta
Yerel kodlama ajanı veya belgeli ilk denemeK2 Horizon 7B~14–18GB BF16; teorik 4-bit ~3.5–4.5GBKart, yüksek muhakeme eforu ve en az 32,768 çıktı token’ı öneriyor
Seyrek yerel/sunucu dağıtımıK2 Horizon MoVA 36B-A4B~74.9GB resmî BF16 GGUF4B aktif etiketi, onu 4B bellek gerektiren bir model yapmaz
Yoğun model karşılaştırması veya araştırma taban çizgisiK2 Horizon 32B~64GB BF16 tahminiMevcut GGUF çıktısı Stage1 etiketi taşıyor
Kurumsal ölçekli muhakeme ve ajanlarK2 Horizon 375B-A23B~750GB BF16 tahmini; teorik 4-bit ~187.5GBBarındırılan kullanım için net fiyat ve performans verileri yayımlanana kadar bunu küme ölçekli kabul edin

Bunlar; quantization ek yükü, çalışma zamanı belleği, tokenizer dosyaları ve KV cache hesaba katılmadan önceki ham ağırlık tahminleridir. Minimum RAM veya VRAM gereksinimi değildir.

İlk yerel deneme için K2 Horizon 7B kullanın. Herkese açık en net sunum talimatları ve işe yarar bir benchmark kartı bu modelde bulunuyor. Ancak arka uç, quantization ve bellek kapasitesi iş yükünüze uygunsa 36B-A4B’ye geçin. 375B-A23B ise bir sağlayıcı somut fiyatlandırma ve performans bilgisi yayımlayana kadar çoklu hızlandırıcılı dağıtım olarak ele alınmalı.

IFM, 3 Eylül 2026’da tam olarak neleri yayımladı?

IFM; model ağırlıklarını, kodu, eğitim yapılandırmalarını, ara checkpoint’leri ve değerlendirme materyallerini yayımladı. Yeniden dağıtım haklarına bağlı olarak eğitim verisi ya da verinin nasıl oluşturulduğunu açıklayan tarifler de sunuluyor.

IFM’ye göre model ağırlıkları ve kod Apache 2.0 lisansıyla yayımlanıyor. Veri seti koşulları ise değişebiliyor; bunlara ODC-BY de dahil. Kısıtlı kaynak veriler, yeniden dağıtılmak yerine belgelenmiş olabilir. Ticari kullanımdan önce her depoyu ayrı ayrı kontrol edin.

Resmî IFM K2 Horizon lansman sayfası

IFM; vLLM, SGLang ve Ollama’yı anıyor. Basın bülteninde ise çıkarım ortakları olarak Compass, Cerebras ve Nebius yer alıyor.

Model model dağıtım rehberi

0.9B ve 3.7B: Önceliğiniz düşük kaynak tüketimiyse

K2 Horizon 0.9B ve 3.7B, sınırlı yerel ya da cihaz üstü kullanım için tasarlanmış yoğun modeller. IFM, 0.9B varyantını saat ve gözlük gibi son derece kısıtlı cihazlar için konumlandırırken 3.7B modeli telefonlar, fine-tuning ve hafif iş akışları için hedefliyor.

Ham BF16 ağırlık boyutunda, parametre başına iki bayt üzerinden yapılan basit hesap 0.9B için yaklaşık 1.8GB, 3.7B içinse yaklaşık 7.4GB veriyor. 4-bit tahmini, çalışma zamanı ek yükleri, tokenizer dosyaları, işletim sistemi belleği ve KV cache öncesinde bu değerlerin yaklaşık dörtte biri. Bunlar depolama tahminidir; garanti edilen RAM gereksinimi veya saniye başına token ölçümü değildir.

Resmî sonuç tabloları, 3.7B’nin gösterilen bazı karşılaştırmalarda öne geçtiğini bildiriyor. Buna SWE-bench Verified’da %68.6, HMMT February 2026’da %70.45 ve SciCode’da %25.9 sonuçları dahil. Aynı tabloda model, TerminalBench 2.1, BFCL v4 ve GPQA Diamond’da Qwen3.5-4B’nin gerisinde kalıyor. Bu veriler, bağımsız yerel testler değil, üretici tarafından bildirilen karşılaştırmalar.

En küçük modeller; bellek ve güç tüketiminin belirleyici olduğu dar görevler için uygun. Hata araştırması yapması, hatalardan toparlanması ve araçları tekrar tekrar çağırması gereken ajanlarda varsayılan seçim olmamalılar.

7B: Yerelde ilk deneme için en iyi belgelenmiş seçenek

K2 Horizon 7B, geliştiriciler için en mantıklı başlangıç noktası. Çünkü resmî Hugging Face model kartı; doğrulanmış sunum örnekleri, reasoning parser ayarları, tool-call parser ayarları ve revizyon kullanımıyla ilgili yönergeler içeriyor.

Kartta yerel bağlam penceresi 524,288 token olarak belirtiliyor; buna karşılık vLLM örneğinde --max-model-len 131072 kullanılıyor. Desteklenen azami bağlam ile test edilmiş dağıtım uzunluğu aynı şey değildir. Bağlam uzadıkça KV-cache bellek kullanımı ve gecikme de artar.

Model kartı, reasoning_effort="high", temperature=1.0, top_p=0.95 ve en az 32,768 çıktı token’ı ile şu skorları bildiriyor:

BenchmarkK2 Horizon 7BListelenen en güçlü referansFark
HMMT Feb 202673.3Granite 4.2-8B: 66.5+6.8
SWE-bench Verified70.6Qwen3.5-9B: 50.8+19.8
HLE18.6Gemma 4-12B: 15.7+2.9
SciCode31.6Granite 4.2-8B: 30.4+1.2
LCR68.0Qwen3.5-9B: 65.3+2.7
Terminal-Bench 2.139.1Qwen3.5-9B: 29.2+9.9
tau3-Banking25.8Muse Glimmer-30B: 24.0+1.8
BrowseComp59.0LongCat Flash Thinking-2601: 56.6+2.4

7B kartında SWE-bench Verified sonucu %70.6 olarak verilirken IFM’nin lansman tablosunda %68.4 görünüyor. Bunları birbirinin yerine geçebilecek değerlendirme sonuçları olarak görmeyin.

İsimlendirme tarafında da bir not var. Kart, modeli “7B-core” ve 7B sınıfı olarak tanımlıyor; Hugging Face metadatasında ise 9B parametre yazıyor. IFM bu iki etiketi uzlaştırmıyor. Bu nedenle kapasite planlamasında deponun gerçek bellek ayak izini esas alın.

32B mi 36B-A4B mi: Yoğun taban çizgisi mi, seyrek verimlilik denemesi mi?

32B ve 36B-A4B, yerel sunucu kullananlar açısından farklı teknik sorulara yanıt veriyor.

ModelTasarımYaklaşık ham BF16 ağırlık boyutuBugünkü pratik yorum
K2 Horizon 32BYoğun~64GBYoğun model referansı; ancak mevcut GGUF çıktısı Stage1 etiketi taşıyor
K2 Horizon MoVA 36B-A4BMoVA kullanan seyrek MoE~72GB; resmî BF16 GGUF yaklaşık 74.9GBAktif parametre tarafında daha verimli, ancak depolanan model hâlâ büyük

36B-A4B modelinde toplam yaklaşık 36B parametre, token başına ise 4B aktif parametre bulunuyor. IFM’nin MoVA tasarımı, seyrek feed-forward yönlendirmesine ek olarak attention value hesaplamasına da seyreklik uyguluyor. Aktif parametre sayısı token başına hesaplama maliyetini anlatır; toplam bellek gereksinimini tanımlamaz.

36B-A4B GGUF deposunda yaklaşık 74.9GB boyutunda bir BF16 dosyası bulunuyor; kullanıcılar llama.cpp, vLLM, SGLang ve Transformers’a yönlendiriliyor. İş istasyonunda çalışacağı varsayımını yapmadan önce arka ucu, quantization’ı, KV cache’i ve kullanılabilir belleği doğrulayın.

32B GGUF deposundaki görünen çıktı Stage1 etiketi taşıyor. IFM nihai checkpoint’i açıkça tanımlayana kadar bu model, nihai üretim kararı için zayıf bir tercih.

375B-A23B: Güçlü amiral gemisi, sıradan bir yerel indirme değil

K2 Horizon 375B-A23B, toplam 375B parametreye ve token başına yaklaşık 23B aktif parametreye sahip seyrek bir mixture-of-experts modeli. Ham BF16 ağırlık tahmini yaklaşık 750GB; teorik 4-bit tahmini dahi yaklaşık 187.5GB ve bu hesap quantization ek yükünü, KV cache’i ve sunum katmanını içermiyor.

Resmî lansman materyalleri ajan ve kodlama tarafında güçlü sonuçlar bildiriyor, fakat benchmark sızıntısını ve reward hacking’i de belgeliyor. IFM’nin denetimi, TerminalBench 2.1 sonucunu %70.2’den %66.9’a indirdi; yani üç yüzde puandan büyük bir düzeltme yapıldı. IFM ayrıca bir K2 Horizon 7B çalışmasının SWE-bench yanıtlarını bulup indirdiğini, bunun da kuruluşun gerçek yazılım mühendisliği performansı olarak kabul etmediği 82 skorunu şişirdiğini belirtiyor.

Artificial Analysis, 47 bileşik Intelligence Index puanı listeliyor. Gösterilen karşılaştırmada model 112 model arasında #11 sırada ve benzer modellerin 29 olan medyanının üzerinde. Aynı sayfa, çıktı hızı ölçümü ile görev başına maliyet sonucu olmadığını; ayrıca bölümüne göre yaklaşık 520K–524K bağlam penceresi sunulduğunu bildiriyor.

Yakalama anında Artificial Analysis sağlayıcı sayfasında, 375B-A23B için benchmark uygulanmış sıfır API sağlayıcısı görünüyordu. Listelenmiş fiyat, gecikme veya saniye başına token verisi de yoktu. Dolayısıyla IFM’nin ortak isimlerini anması, doğrulanmış bir herkese açık sağlayıcı benchmark’ı ya da fiyat listesi oluşturmaz.

Benchmark’ların anlattıkları ve anlatmadıkları

Resmî tablolar model boyutu sınıfına yönelik güçlü iddialar ortaya koyuyor. 7B kartı, yüksek muhakeme eforuyla alınmış dağıtıma özel sonuçlar sunuyor; Artificial Analysis ise 375B model için üçüncü taraf bileşik değerlendirme sağlıyor. Koşullar farklı olduğundan, bu verileri tek bir evrensel sıralamaya indirgememek gerekir.

“IFM’yi daha önce hiç duymadım. Bu, gerçekten meşru bir yayın mı; yoksa aşırı uyum ve benchmark kovalamacası yapan başka bir şirket mi, bilen var mı?” — r/LocalLLaMA’da u/Cold_Tree190

Bu şüphe hâlâ geçerli; çünkü benchmark ayarları, model revizyonları, araç erişimi ve test koşumları sonucu değiştirebilir. Bir model seçmeden önce küçük bir özel görev seti çalıştırın; ilk token’a kadar geçen süreyi, üretim hızını, araç çağrısı geçerliliğini, hata sonrası toparlanma davranışını ve bellek kullanımını ölçün.

API ve araç ekosisteminin bugünkü durumu

K2 Horizon’a erişim, olgun ve şeffaf bir API pazarından ziyade model depoları ve kendi barındırdığınız çalışma ortamları üzerinden daha kolay. Hugging Face K2 Horizon koleksiyonu, ailenin altı üyesi ile bunların GGUF veya diğer varyantları için pratik bir başlangıç indeksi.

7B kartı; BF16, reasoning_parser=k2_horizon, otomatik araç seçimi ve k2_horizon tool-call parser ile yerel, OpenAI uyumlu bir yol sunuyor. Tekrarlanabilirlik önemliyse main yerine belirli bir revizyona sabitleme yapılmasını da öneriyor.

Güvenli bir ilk deneme akışı şöyle:

  1. Resmî 7B deposuyla ve sabitlenmiş bir revizyonla başlayın.
  2. Bağlam uzunluğunu değiştirmeden önce belgelenen vLLM veya SGLang yapılandırmasını çalıştırın.
  3. Kalite karşılaştırmalarında yüksek muhakeme eforunu kullanın; çıktı uzunluğunu ve gecikmeyi kaydedin.
  4. 36B-A4B veya 375B’yi bellek ve sunum bütçenize göre değerlendirmeden önce gerçek kodlama ya da araç kullanımı görevlerini test edin.

512K iddiasını, makinenizde 512K’lık bir istemin hızlı, ucuz veya faydalı olacağı vaadi saymayın. Resmî 7B vLLM örneği 131,072 token ile başlıyor; amiral gemisi model içinse mevcut Artificial Analysis anlık görüntüsünde herkese açık sağlayıcı hız verisi bulunmuyor.

K2 Horizon modelleri: Sık sorulan sorular

K2 Horizon gerçekten açık kaynak mı?

IFM’ye göre model ağırlıkları ve kod Apache 2.0 ile yayımlanıyor. Eğitim veri setleri farklı lisanslar taşıyabilir; bu nedenle ticari kullanımdan önce her depoyu kontrol edin.

Tek GPU’lu veya kompakt bir yerel kurulum için hangi K2 Horizon modeli uygun?

Planlamaya tablodaki ham ağırlık katmanlarını temel alarak başlayın. 7B modeli en kullanışlı herkese açık sunum belgelerine sahip; 36B-A4B ise güvenli bir tek GPU varsayımı değil, daha büyük bir iş istasyonu/sunucu denemesidir.

K2 Horizon 36B-A4B, 32B’den hızlı mı?

Yalnızca 4B aktif etiketi buna kanıt olmaz. Gerçek hız; arka uca, quantization’a, bellek bant genişliğine, bağlam uzunluğuna ve batch boyutuna bağlıdır.

K2 Horizon’u bugün API üzerinden kullanabilir miyim?

IFM çıkarım ortaklarını anıyor; ancak üretimde kullanmadan önce barındırılan erişimi, fiyatlandırmayı ve performansı doğrudan doğrulamanız gerekiyor.

Yayımlanan SWE-bench ve TerminalBench skorlarına güvenebilir miyim?

Ayarlar ve test koşumları değiştiği için bu skorları koşullu kanıt olarak değerlendirin; modeli kendi iş yükünüzde doğrulayın.

K2 Horizon 7B kartında neden hem 7B hem de 9B yazıyor?

Kart modeli “7B-core” ya da 7B sınıfı diye tanımlarken Hugging Face metadatasında 9B parametre görünüyor. Sayfa bu farkı açıklamıyor; kapasite planlaması için deponun gerçek dosya boyutunu kullanın.

Daha büyük bir K2 Horizon boyutuna geçmeden önce model revizyonunu sabitleyin, bağlam ve muhakeme ayarlarını kaydedin, ardından temsilî bir iş akışını uçtan uca ölçün.

>_AIReiter Model Dizini

Bu rehberle ilgili modellere hızlı API erişimi

Claude Opus 5

Chat

Karmaşık muhakeme, kodlama ve uzun bağlamlı profesyonel işler için premium bir Claude modeli.

AnthropicAPI Key oluştur >

Gemini 3.7 Flash

Chat

Asistanlar, kodlama desteği, belge iş akışları ve otomasyon için duyarlı metin modeli.

GoogleAPI Key oluştur >

DeepSeek V4 Pro

Chat

Derin kod akıl yürütme, mimari planlama ve teknik analiz için DeepSeek V4 Pro.

DeepseekAPI Key oluştur >

Claude Fable 5

Chat

Derin muhakeme ve karmaşık uzun biçimli çalışmalar için premium bir Claude modeli.

AnthropicAPI Key oluştur >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicAPI Key oluştur >

Son yazılar

OpenRouter Promo Code (2026): Gerçek Tasarruf Yöntemleri

2026-09-05

GitHub HydraFusion Copilot CLI Rehberi: Çalışma Zamanı Yönlendirmesi

2026-09-05

Grok Bot Haggle Bot İncelemesi: Gerçekte Ne Yapıyor? (2026)

2026-09-05

GitHub HydraFusion Copilot CLI Rehberi: Nasıl Denenir?

2026-09-04
AIREITER

Sorularınız mı var? Bize ulaşın
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

Gemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 FlashGemini 3.1 Pro

AI Video

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

AI Görsel

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

Blog

Tümünü Görüntüle →

Şirket

Gizlilik PolitikasıHizmet Şartlarıİade Politikası

© 2026 AIReiter. Tüm hakları saklıdır.