Thinking Machines Inkling: 975B, Açık ve Çalıştırması Zor

Son Güncelleme: 2026-07-16 10:38:06

Thinking Machines Inkling, 15 Temmuz 2026'da yayımlanan, 975 milyar parametreli açık ağırlıklı bir modeldir; token başına yalnızca 41B parametreyi etkinleştiren ve metin, görüntü ve ses girdisi alan seyrek bir uzmanlar karması (sparse mixture-of-experts) olarak inşa edilmiştir. Apache-2.0 lisansı altında sunulur, bu nedenle tam ağırlıkları indirebilir ve bunları ticari olarak ince ayar yapabilirsiniz. Ancak bir sorun var: 4 bitlik bir kuantizasyon bile yaklaşık 600GB VRAM gerektirir, bu yüzden bu, ekiplerin bir küme üzerinde değerlendirdiği bir modeldir; oyun amaçlı bir GPU'da çalıştıracağınız bir şey değildir.

Özellikler ve manşetlerin yanlış aktardıkları

İşte Hugging Face model kartı ve resmi Inkling sayfası tarafından belirtilenler (16 Temmuz 2026 tarihinde erişildi).

ÖzellikInkling
Toplam parametreler975B
Aktif parametrelertoken başına 41B
Mimari66 katmanlı sadece decoder, seyrek MoE (256 uzman, 6 yönlendirilmiş + 2 paylaşılan)
ModalitelerMetin, görsel, ses girdi; metin çıktı (UTF-8)
Eğitim verisi45 trilyon token
LisansApache-2.0
İndirmeHugging Face (thinkingmachines/inkling)

Başlangıç kapsamı etrafında dolaşan üç şeyin düzeltilmesi gerekiyor:

  • Bağlam penceresi. Birkaç yazıda 1M token'lık bir pencere olduğu belirtildi. Resmi Inkling sayfası standart olarak 64K ve Tinker platformu üzerinden çalıştırıldığında 256K listeliyor; Hugging Face kartında ise hiç sayı belirtilmiyor. Doğrulayabileceğiniz değerler olarak 64K/256K'yi ve doğrulanmamış olarak 1M'i kabul edin.
  • Lisans. Bunun Apache-2.0 olduğu doğrulandı; bu, mevcut en izin verici lisanslardan biridir ve ticari kullanıma izin verir. Thinking Machines, fine-tuning güvenliğinin sorumluluğunu size bırakıyor.
  • "Inkling-Small." ~12B etkin parametreye sahip daha küçük bir varyant bazı raporlarda ortaya çıktı, ancak Hugging Face model kartında listelenmiyor. Orada görünene kadar buna göre plan yapmayın.

"975B parametrenin" burada gerçekte ne anlama geldiği

Inkling, her bir token’ı 256 uzmandan 6’sına ve ayrıca 2 ortak uzmana yönlendirir; bu nedenle, toplam havuz 975B olsa da bir anda yalnızca yaklaşık 41B parametre devreye girer. Bu yüzden Thinking Machines, oraya ulaşmak için kabaca üçte bir daha az token harcarken kodlamada Nvidia’nın Nemotron 3 Ultra’sıyla eşleştiğini iddia ediyor: orta boyutlu bir modelin çıkarım maliyetiyle büyük bir modelin kapsamını elde edersiniz.

Inkling ayrıca bir "düşünme çabası" kadranı sunar. Daha zor problemler için bunu yükseltin ve daha yavaş, daha bilinçli yanıtları kabul edin ya da hız için düşürün. Tahmin etmek yerine belirsizliği işaretleyecek şekilde eğitilmiştir; bu da bir tüketici sohbet botundan çok fine-tuning tabanı için daha önemlidir.

Inkling’i gerçekten çalıştırabilir misiniz?

“Open weights” etiketinin işleri karmaşıklaştırdığı yer burası, çünkü open hafif anlamına gelmez. Model kartına ve topluluktan gelen erken tahminlere dayanarak, tam 975B modelini sunmanın kabaca ne gerektirdiği aşağıda verilmiştir (bunlar yaklaşık değerlerdir, garanti değildir):

Approximate VRAM required to run Inkling at different quantization levels
  • BF16 (tam hassasiyet): yalnızca ağırlıklar için yaklaşık 2 TB VRAM gerekir; bu da serving yükünü eklemeden önce 16+ H200 sınıfı GPU ya da 8 GPU’lu bir B300 node demektir.
  • NVFP4 / 4-bit: yaklaşık 600 GB; hâlâ çoklu GPU sunucu kategorisinde (kabaca 4× H200 veya 8× 80 GB kart).
  • 1-2 bit GGUF (llama.cpp / Unsloth quants): birleşik RAM+VRAM’de yaklaşık 280-350 GB; yüksek seviye bir iş istasyonunda veya tam donanımlı bir Mac Studio Ultra’da erişilebilir, ayrıca uzun bağlama doğru ilerledikçe KV cache büyüdüğü için daha yavaştır.

Dürüst değerlendirme: iyi finanse edilmiş bir ekip Inkling’i değerlendirebilir ve ince ayar yapabilir, ancak bugün onu yerel olarak çalıştırmak için tüketici GPU’su üzerinden bir yol yok. Eğer tek bir 24GB karta yüklemeyi uman bağımsız bir geliştiriciyseniz, bu sizin modeliniz değil. Onu Hugging Face’ten thinkingmachines/inkling adresinden indirebilir ya da Thinking Machines’in Tinker platformu üzerinden ince ayar yapabilirsiniz; bu platform ayrıca 256K context’i de açar.

Inkling'in diğer modeller karşısındaki konumu

Thinking Machines, Inkling’in mevcut en güçlü model olmadığını açıkça söylüyor ve model kartı üzerindeki benchmark’lar da bunu doğruluyor: Inkling iyi puan alıyor, ancak akıl yürütme ve kodlama alanlarında kapalı uçlu en ileri modellerin gerisinde kalıyor.

Inkling benchmark scores compared with the best rival on each test
BenchmarkInklingAtıfta bulunulan en iyi rakip
AIME 202697.1%GPT 5.6 Sol, 99.9%
SWE-bench Verified77.6%Claude Fable 5, 95.0%
MMMU Pro73.3%Claude Fable 5, 84.2%
VoiceBench91.4%Gemini 3.1 Pro, 94.3%

*Kaynak: Inkling model kartı ve resmi kıyaslama sayfası, 16 Temmuz 2026 tarihinde erişildi.*

Resmî radar grafiği de aynı hikâyeyi görsel olarak anlatıyor. Inkling, akıl yürütme ve multimodal görevlerde kendi başına iyi bir performans sergiliyor; ancak agentic coding (SWE-bench Pro, Terminal Bench) konusunda GPT 5.6 Sol ve Claude Fable 5’in gerisinde kalıyor.

Official Inkling benchmark radar comparing it with GPT 5.6 Sol and Claude Fable 5

Güçlü olduğu nokta kapsamıdır: doğal audio ve image understanding’i tek bir open model’de sunar; fine-tuning ile azaltabileceğiniz bir coding gap vardır. Kutudan çıktığı haliyle en iyi sınıf agentic coding’e ihtiyacınız varsa, kapalı bir frontier model hâlâ kazanır. Sahip olabileceğiniz open, multimodal bir base model arıyorsanız, Inkling daha ilginç bir seçenektir.

Inkling aslında kimler için

Inkling, üzerine inşa edilecek bir temel, bitmiş bir yardımcı değildir. Thinking Machines, modelin kendisinden değil, fine-tuning platformu Tinker'dan para kazanır; metered API çağrılarından değil, bu yüzden modelin kendisi ücretsizdir ve öneri "bunu alın ve özelleştirin" şeklindedir.

En açık kanıt noktası Bridgewater Associates’tir: Thinking Machines’e göre, modelin finans alanına uyarlanmış bir sürümü, firmanın muhakeme testinde, tescilli bir modelin yaklaşık ondörtte biri maliyetle %84,7 puan aldı. Amaçlanan kullanım budur; bir ekibin belirli bir alana göre yeniden şekillendirdiği yetkin bir genel amaçlı model.

Yani, bir açık modeli özelleştirip sonucu sahiplenmek için gerekli altyapıya ve fine-tuning uzmanlığına sahipseniz ve güvenlik ayarlarından sorumluluk almayı kabul ediyorsanız uygundur. Hazır kullanıma uygun bir chatbot istiyorsanız ya da tüketici donanımından çalışıyorsanız bunu atlayın; çünkü genel amaçlı kapalı modellere ulaşmak daha ucuzdur ve ilk günden daha güçlüdür. Bilinmesi gereken bir uyarı: Inkling’in post-training sürecinde, Moonshot’un Kimi K2.5’i de dahil olmak üzere diğer açık modeller tarafından üretilen veriler kullanıldı ve Thinking Machines, bir sonraki neslinin tamamen kendi kendine eğitilmiş olacağını söylüyor.

Inkling SSS

Inkling ticari olarak kullanmak ücretsiz mi?

Evet. Apache-2.0 altında yayınlanmıştır; bu da ticari kullanım ve değişikliğe izin verir. Dağıtmadan önce gerekli güvenlik ince ayarı için siz sorumlusunuz.

Inkling’i nereden indirebilirim?

Tam ağırlıklar Hugging Face üzerinde thinkingmachines/inkling adresinde bulunuyor. Topluluk tarafından oluşturulan quantized GGUF sürümleri de orada görünüyor.

Inkling gerçekten 1M-token bağlam penceresine sahip mi?

Resmi sayfa varsayılan olarak 64K ve Tinker platformu üzerinden 256K listeliyor. Bazı haberlerde geçen 1M değeri model kartında doğrulanmış değil, bu nedenle 64K/256K etrafında plan yapın.

Inkling mi, DeepSeek mi yoksa Qwen mi, hangisi daha iyi?

Bu, tek bir skora değil, işe bağlıdır. Inkling’in avantajı, tek bir Apache-2.0 modelde yerel multimodal girdi (metin, görsel, ses) sunması ve Tinker ince ayar yoludur; önde gelen Çin açık modelleri ise güçlü genel kullanım ve kodlama seçenekleri olmaya devam ediyor. Karar vermeden önce bunları kendi görevinizde benchmark edin.

Tinker nedir ve ona ihtiyacım var mı?

Tinker, Thinking Machines'in barındırılan fine-tuning platformudur. Açık ağırlıkları çalıştırmak için buna ihtiyacınız yoktur, ancak Inkling'i özelleştirmek için resmi yoldur ve context window'u 256K'ya çıkarır.

---

İlgili okuma