Moonshot, Kimi K3 açık ağırlıklarını modelin API üzerinden kullanıma açılmasından on bir gün sonra, 27 Temmuz 2026'da yayımladı. İndirme bağlantısı herkese açık ve gerçek; ancak 96 safetensors parçasına bölünmüş 1,56 TB'lık paket, çoğu kişinin “açık” ile “çalıştırılabilir” arasındaki farkı fark ettiği nokta oluyor. Pakette neler var, lisans neye izin veriyor ve modeli sunmak için hangi altyapı gerekiyor, bakalım.
Moonshot pakete neleri koydu?
Tam checkpoint, Hugging Face'te moonshotai/Kimi-K3 altında bulunuyor; Çin'deki kullanıcılar için de ModelScope aynası var. Depo toplam 1,56 TB: 96 safetensors parçasının yanı sıra config.json, modelleme ve tokenizer kodu (modeling_kimi_k3.py, encoding_k3.py, 160K kelime dağarcıklı bir tiktoken modeli), görüntü ön işleme dosyaları ve LICENSE yer alıyor. Teknik rapor da aynı anda MoonshotAI GitHub deposuna eklendi.
Model kartındaki üç ayrıntı, manşetlerdeki parametre sayısından daha önemli:
- Toplam 2,8T parametrenin 104B'si token başına aktif. Her token için yönlendirilen 896 uzmandan 16'sı ile 2 paylaşımlı uzman, 93 katman boyunca kullanılıyor. Ağırlıklar yayımlanana kadar bu aktif parametre sayısı açıklanmamıştı.
- Ağırlıkların yerel formatı MXFP4. Moonshot, SFT aşamasından itibaren quantization-aware training uygulamış ve MXFP8 aktivasyonlar kullanmış. Bu, BF16 checkpoint'in sonradan quantize edilmiş hâli değil; yayımlanan sürümün kendisi 4-bit ağırlıklardan oluşuyor.
- Dikkat katmanları 69/24 oranında bölünüyor. 1.048.576 token bağlam penceresinde Kimi Delta Attention katmanları ile Gated MLA katmanları bu dağılımı paylaşıyor.
İlgi çok hızlı yükseldi. İlk commit'in depoya düşmesinden bir gün sonra, 28 Temmuz 2026'da repo commit geçmişinde 6,6 bin beğeniye ulaşmıştı. Topluluk dönüşümleri de gecikmedi: unsloth/Kimi-K3-GGUF aynı akşam oluşturuldu, GrEarl/Kimi-K3-GGUF ise ertesi sabah tam bir Q2_K dönüşümü yüklemişti.
Kimi K3 License, MIT lisansı değil
Önceki Kimi amiral gemisi modelleri Modified MIT lisansıyla gelmişti. K3'te durum farklı. Model, Kimi K3 License adlı bir lisansla yayımlanıyor. Metnin temelinde MIT var: kullanma, kopyalama, değiştirme, birleştirme, yayımlama, dağıtma, alt lisanslama, satma, fine-tuning yapma ve türev çalışma oluşturma hakları tanınıyor. Ancak üzerine eklenmiş, geliştirme planı yapmadan önce okunması gereken iki koşul bulunuyor.
Model-as-a-Service maddesi. Bağlayıcı metin şöyle: "If the Licensee or any of its affiliates operates a Model as a Service business, and the aggregate revenue of the Licensee and its affiliates exceeds 20 million US dollars ... in total over any consecutive 12 months, the Licensee must enter into a separate agreement with Moonshot AI before using the Software or its derivative works for any commercial purpose." Lisans, MaaS'i üçüncü taraflara; girdileri, parametreleri veya eğitim verisini kontrol edebilecekleri şekilde çıkarım ya da fine-tuning erişimi vermek olarak tanımlıyor. MaaS sayılmadığı açıkça belirtilen iki durum ise model yeteneğinin belirli özelliklere gömülü olduğu son kullanıcı ürünleri ve başka bir yerde barındırılan modellere istekleri yalnızca iletmek.
Atıf maddesi. K3 tabanlı ticari bir ürün 100 milyon aylık aktif kullanıcıyı veya aylık 20 milyon USD geliri aşarsa, ürünün arayüzünde "Kimi K3" ifadesi görünür biçimde gösterilmek zorunda.
Bu iki madde, modeli, çıktısını veya yeteneklerini üçüncü taraflara açmayan tamamen dahili kullanım için; ayrıca Moonshot'ın resmî ürünleri ya da sertifikalı çıkarım ortakları üzerinden erişim için geçerli değil. Muafiyetler lafzıyla okunduğunda, K3'ü kurum içi veriyle fine-tuning yapmak Bölüm 4(a)'daki dahili kullanım istisnasına giriyor; onu bir ürün özelliği olarak gömmek de Bölüm 2'de MaaS olmadığı belirtilen kullanım biçimleri arasında sayılıyor. K3 çıkarımını hizmet olarak yeniden satmak, ek maddelerin asıl hedeflediği senaryo; 20 milyon USD eşiği aşıldığında konu lisans yorumundan çıkıp sözleşme görüşmesine dönüşüyor. Ürün yol haritanızı buna bağlamadan önce LICENSE dosyasını kendiniz okuyun; buradaki özet hukuki tavsiye değil, metnin bir yorumudur.
1,56 TB'ın donanım karşılığı
Kimi K3 açık ağırlıklarını herkes indirebilir. Modeli sunmak ise bambaşka bir mesele.
vLLM'nin resmî K3 rehberi gereksinimi doğrudan belirtiyor: en az 8× GB300; gerçek üretim trafiği içinse çok düğümlü kurulum gerekiyor. AMD tarafında ROCm imajıyla en az 8× MI355X veya MI350X listeleniyor. SGLang'in K3 cookbook dokümanı da aynı sınıftaki donanımı hedefliyor.
Gerçekten altyapı kuruyorsanız, rehberdeki operasyon notlarını iki kez okumakta fayda var. Serving, standart vLLM yerine özel vllm/vllm-openai:kimi-k3 imajıyla; AMD'de ise vllm/vllm-openai_rocm:kimi-k3 ile çalışıyor. Düğümler arası trafikte RDMA üzerinde --all2all-backend deepep_v2 veya NVLink üzerinde flashinfer_nvlink_one_sided öneriliyor; KV cache aktarımının RDMA üzerinde kalması için UCX_TLS="rc,cuda_copy" ayarlanmalı. MoE backend önerisi topolojiye göre değişiyor: expert-parallel dağıtımlarda deep_gemm_mega_moe, TP>1 için flashinfer_trtllm. Rehber ayrıca K3'ün zaman zaman kendi parser'ının kabul etmediği bir tool-call formatı ürettiğini belirtiyor. Bu nedenle şema doğrulaması ve yeniden deneme mekanizması daha ilk günden serving katmanında olmalı.
Genelde başvurulan kaçış yolu, yani modeli daha da quantize etmek, burada pek işe yaramıyor. Çünkü MXFP4 zaten parametre başına yaklaşık 4,25 bit demek. 1T sınıfı modelleri iş istasyonunda çalıştırılabilir kılan sıkıştırma payı, siz herhangi bir şey indirmeden önce kullanılmış durumda. Ortaya çıkan ilk topluluk yapımı 2-bit GGUF dönüşümü 94 parçada 928 GB; yani aslında belirleyici engel olmayan bir boyutta %40 tasarruf sağlıyor.
| Yüklenen sürüm | Boyut |
|---|---|
| Resmî MXFP4 safetensors | 1.561 GB |
| Topluluk Q2_K GGUF | 929 GB |
| Token başına aktif parametre | 104B |
1M token bağlam penceresine yaklaşan kullanımlarda KV cache'i de eklediğinizde çalışma seti daha da büyüyor. İlk günün en dikkat çekici self-hosting raporu, resmî MXFP4 ağırlıklarını sıradan Ethernet üzerinde 80× RTX 5090'a dağıtarak çalıştırdığını söyleyen bir ekipten geldi. HBM ve yeniden quantization kullanılmadan, ayarlanmamış tek akışta yaklaşık 20 token/saniye elde edildiği iddia edildi. Bu, tek bir gönderide yer alan ve doğrulanmamış ilk gün iddiası; benchmark değil. Ayrıca tek bir kurulum minimum gereksinimi tanımlamaz. Yine de yönü göstermesi açısından kayda değer: K3'ü tüketici donanımında çalıştırmak için bildirilen en ucuz yol, seksen adet amiral gemisi GPU gerektirdi ve çoğu kişinin yavaş bulacağı bir hız üretti.
Ollama'yı özellikle ayırmak gerekiyor; çünkü insanların ilk denediği seçenek genellikle o oluyor. Kütüphane girdisi mevcut, fakat kimi-k3:cloud adresine çözülüyor; bu da yerel indirme değil, Ollama'nın barındırılan yönlendirmesi. Bugün bu model için dizüstünde veya tek bir iş istasyonunda çalışacak bir yol yok. MXFP4 kolaylık için yapılmış bir quant değil, yerel format olduğundan, K2 serisinde olduğu kadar agresif yeniden quantization için alan da bulunmuyor. llama.cpp desteği hâlâ gelişme aşamasında; varsayım yapmak yerine güncel durumu kontrol edin.
Kimi K3 bugün nerede çalıştırılabilir?
Neredeyse herkes için pratik çözüm barındırılan bir endpoint kullanmak. Açık ağırlık sürümü de bekleneni yaptı ve üçüncü taraf sağlayıcılar bir gün içinde modeli sunmaya başladı. Aşağıdaki fiyatlar 28 Temmuz 2026 itibarıyla listelenen, milyon token başına giriş/çıkış ücretleri.
| Sağlayıcı | Quantization | Bağlam | Fiyat |
|---|---|---|---|
| Moonshot AI | MXFP4 (yerel) | 1M | $3 / $15 |
| Baseten | FP8 | 1M | $3 / $15 |
| Fireworks | belirtilmemiş | 1M | $3 / $15 (ayrıca $4.50 / $22.50 katmanı var) |
| Nebius | FP4 | 8K | $3 / $15 |
Seçim yapmadan önce iki noktayı kontrol edin. İlk olarak, bağlam penceresi ciddi biçimde değişiyor. Nebius aynı liste fiyatını 8K pencerede sunuyor; bu da K3 kullanmanın en büyük nedenini ortadan kaldırıyor. İkinci olarak, quantization seviyesi farklı: Moonshot yerel MXFP4'ü sunuyor, Baseten FP8 çalıştırıyor ve bazı sağlayıcılar hassasiyet bilgisini hiç vermiyor. Uzun soluklu agentic işler için referans hassasiyete ve tam 1M pencereye yakın kalmak, genellikle fiyat farkından daha önemli. Kısa prompt'larda ve yüksek hacimdeyse gecikme ile bölgesel erişilebilirlik ikisinin de önüne geçebilir.
Doğrudan endpoint'lerin ötesinde, OpenRouter bunları tek anahtar altında bir araya getiriyor; çok modelli gateway'ler ise K3'ü diğer açık Çin frontier modelleriyle birlikte yönlendiriyor. Araç zinciriniz bu protokolü zaten kullanıyorsa AIReiter, aynı sınıftaki modelleri Anthropic-compatible API üzerinden sunuyor. Moonshot'ın kendi endpoint'i hem OpenAI hem de Anthropic uyumlu arayüzlere sahip. Tüm hız limiti ve katman ayrıntıları Kimi K3 fiyatlandırma analizinde yer alıyor.
Kendi altyapınız mı, barındırılan endpoint mi?
Önce hesabı yapın. Milyon token başına $3/$15 fiyatla, bir milyar çıkış token'ı $15.000; bir milyar giriş token'ı ise $3.000 tutar. Bunu uygulanabilir en düşük self-hosting seçeneğiyle karşılaştırın: 8× GB300 sınıfı bir düğüm. Bu, veri merkezi ölçeğinde bir sermaye yatırımı ya da hızlandırıcı-saat üzerinden ücretlendirilen bir kiralama; buna ağ bağlantısı, enerji, soğutma ve --all2all-backend ayarını ezbere bilen bir mühendis de ekleniyor. NVIDIA ve büyük bulut sağlayıcıları bu yapılandırma için liste fiyatı açıklamıyor. Bu yüzden kıyaslamayı yaklaşık kurallarla değil, güncel tekliflerle yapın; donanım maliyetinin sabit, API maliyetinin ise kullanımınızla birlikte değişken olduğunu da unutmayın.
Kimi K3 açık ağırlıklarını kendi altyapınızda çalıştırmak yalnızca üç durumda gerçekten anlamlı; bunlar da göründüğünden daha dar senaryolar:
- Air-gapped ya da veri yerleşimi gereksinimleri. Hiçbir üçüncü taraf endpoint'in karşılayamadığı durumlar. En güçlü gerekçe bu ve belirleyici unsur maliyet değil.
- Tescilli verilerle fine-tuning. Lisans buna doğrudan izin veriyor; barındırılan hiçbir endpoint'in vermediği imkân da bu. Eğitim maliyetinin serving maliyetinden ayrı ve ondan daha yüksek olduğunu unutmayın.
- Doygunluk seviyesinde sürekli hacim. Çok düğümlü kümeyi günün her saati meşgul tutabiliyorsanız, sahip olunan donanım token başı fiyatların altına inebilir. Ara sıra yaşanan talep patlamaları buna girmez.
Bunların hiçbiri sizi tanımlamıyorsa endpoint kullanın; ağırlıkları da planınız değil, bir seçenek olarak görün. Açık ağırlıklı bir frontier modelin çoğu ekip için değeri, onu kendilerinin çalıştıracak olması değil. Barındırılan sürümün fiyatının artık, teorik olarak modeli kendilerinin çalıştırabilme ihtimaliyle rekabet etmek zorunda olması.
SSS
Kimi K3 açık kaynak mı?
Kimi K3 açık ağırlıklı bir model. Tam 2,8T checkpoint indirilebilir ve Kimi K3 License; kullanım, değiştirme, dağıtım ve fine-tuning izni veriyor. Ancak eğitim verisi ve eksiksiz eğitim pipeline'ı yayımlanmadı. Ayrıca lisans, Model-as-a-Service işletmecileri için gelire bağlı bir madde içeriyor. Bu nedenle OSI tarzı açık kaynak sayılmaz.
Kimi K3'ü Ollama ile yerelde çalıştırabilir miyim?
Hayır. Ollama'daki kimi-k3 girdisi, barındırılan bir endpoint'e yönlendiren kimi-k3:cloud sürümüdür. Yerel MXFP4 ağırlıkları 1,56 TB, topluluk yapımı 2-bit GGUF ise hâlâ 928 GB olduğundan tüketici donanımında yerel bir yol bulunmuyor.
Kimi K3 ağırlıkları hangi lisans altında?
Kimi K3 License altında. MIT türevi bir lisans olsa da, herhangi bir 12 aylık dönemde geliri $20M'ı aşan bir Model-as-a-Service işletiyorsanız Moonshot ile ayrı anlaşma yapmanızı gerektiriyor. Ayrıca 100M MAU veya aylık $20M gelirin üzerinde arayüzde atıf zorunluluğu getiriyor. Dahili kullanım her iki maddeden de muaf.
Kimi K3'ü indirmeden nerede kullanabilirim?
Moonshot'ın kendi API'si ve Kimi uygulamasının yanı sıra Baseten, Fireworks ve Nebius üzerinden kullanabilirsiniz. Dördü de 28 Temmuz 2026 itibarıyla temel ücret olarak milyon token başına $3/$15 listeliyor; ancak karşılaştırma koşullu. Fireworks ayrıca $4.50/$22.50 katmanı sunuyor, Nebius ise temel fiyatı 1M yerine 8K bağlam penceresiyle veriyor. Modelin ne olduğu ve benchmark sonuçları için Kimi K3 genel bakışına göz atın.