Ling 3.0 Flash: 124B Model, 5.1B Aktif Parametre ve Şimdilik Ücretsiz

Son Güncelleme: 2026-07-24 03:41:12

124 milyar parametreli bir modelden genellikle yavaş ve pahalı bir kullanım beklersiniz. Ling 3.0 Flash bu kalıbı bozuyor: Toplamda 124B parametre taşısa da her token için yaklaşık 5.1B parametreyi çalıştırıyor. Üstelik şu anda ücretsiz kullanılabiliyor.

inclusionAI, ajan odaklı hibrit muhakeme Mixture-of-Experts (MoE) modelini 23 Temmuz 2026'da yayımladı. Kod yazma, araç çağırma, araştırma ve uzun süren görevler modelin hedeflediği kullanım alanları arasında.

Ling 3.0 Flash tam olarak nedir?

Ling 3.0 Flash, Ant Group'un Ling ve Ring model ailelerinin arkasındaki araştırma ekibi inclusionAI tarafından geliştirildi. Ant Group, Alipay'in arkasındaki fintech şirketi. "Flash" adı ise grubun büyük amiral gemisi modellerinin altında konumlanan hızlı ve maliyet odaklı katmanı ifade ediyor.

Model, Mixture-of-Experts mimarisini kullanıyor. Toplam 124B parametresinin yalnızca yaklaşık 5.1B'si herhangi bir token üretilirken devreye giriyor. Bu da çalışma hızı ve maliyet açısından daha küçük bir modele yaklaşmasını sağlıyor.

Aynı zamanda hibrit muhakeme yaklaşımına sahip: Basit istemlere doğrudan yanıt verirken, zor sorularda daha uzun bir düşünme moduna geçiyor. inclusionAI modeli; araç kullanan, web'de gezinen, kod yazıp çalıştıran ve çok sayıda adım boyunca durumu koruyan "üretim ölçekli ajanlar" için tasarlıyor.

Asıl fark: Daha fazla kapasite, daha düşük aktif hesaplama

Ling 2.6 Flash ile karşılaştırıldığında yön değişimi açıkça görülüyor. Toplam parametre sayısı 104B'den 124B'ye çıkarken, token başına etkinleşen parametre sayısı 7.4B'den 5.1B'ye indi.

Ling 2.6 Flash ve Ling 3.0 Flash karşılaştırmasını gösteren çubuk grafik: toplam parametreler 104B'den 124B'ye yükselirken token başına aktif parametreler 7.4B'den 5.1B'ye düşüyor

Daha yüksek toplam parametre sayısı, bilgiyi depolamak için daha geniş bir alan demek. Daha az aktif parametre ise her tokenın üretim maliyetini azaltıyor. Pratikte yaklaşık 5B'lik bir modelin çıkarım maliyetini öderken 124B'lik kapasiteden yararlanıyorsunuz.

Bu özellikle ajan iş yüklerinde önem taşıyor. Bir görev, çok sayıda araç çağrısı boyunca binlerce token ürettiğinde faturayı token başına maliyet belirliyor. Bu nedenle aktif parametreleri azaltmak, başlıktaki model boyutunu büyütmekten daha değerli olabiliyor.

Modelin altyapısında hibrit bir lineer dikkat katmanı bulunuyor. inclusionAI, beş KDA lineer dikkat katmanının ardından bir tam dikkat MLA katmanının geldiği tekrarlayan bir blok tarif ediyor. Lineer dikkat, uzun girdilerin maliyetini düşük tutarken düzenli aralıklarla eklenen tam dikkat katmanı, yalnızca lineer modellerde zayıflayan hassas geri çağırmayı koruyor. Flash'ın 256K yerel bağlamla çalışabilmesi ve 1M'e doğru pay bırakması bunun sonucu. Router'lar bunu tam token sayısı olan 262.144 nedeniyle 262K olarak gösteriyor.

Hangi işler için tasarlandı?

Flash, serbest akışlı sohbetten çok ajan tabanlı işler için ayarlanmış bir model. inclusionAI'nin duyurusunda daha yüksek araç çağırma doğruluğu, uzun vadeli görevlerde daha istikrarlı çalışma ve yaygın ajan "harness" çerçeveleriyle daha iyi uyumluluk öne çıkıyor. Lansman demoları da bunu destekliyor: Blender'da 3D şehir oluşturma, çoklu ajan araştırması, MCP üzerinden Office görevleri ve tarayıcı uygulamaları.

Kodlama tarafında inclusionAI, standart kod üretiminin üzerine mekânsal ve yapısal muhakemeyi de ekliyor. Sahne ızgaraları ve nesnelerin göreli konumları buna örnek.

Benchmark sonuçlarına temkinli yaklaşmak gerekiyor. Model yalnızca birkaç günlük olduğu için dolaşımdaki veriler, inclusionAI'nin kendi iddiaları ile erken dönem topluluk testlerinden oluşuyor; bağımsız değerlendirmelerden değil. inclusionAI, Flash'ın çok daha az aktif parametreyle yaklaşık 1 trilyon parametreli amiral gemisi modeline birçok görevde yetiştiğini veya onu geçtiğini söylüyor. Sonuç tablosunda düşünme modunda 56.63 SWE-Bench Pro puanı yer alıyor. Üçüncü taraflar doğrulayana kadar bunları üretici verisi olarak görmek en doğrusu.

Ling 3.0 Flash ücretsiz nasıl denenir?

En hızlı seçenek OpenRouter. Model, inclusionai/ling-3.0-flash adıyla listeleniyor; lansman fiyatı girişte $0, çıkışta $0 ve 3 Ağustos 2026'ya kadar ücretsiz. Fiyat kontrolü 24 Temmuz 2026'da yapıldı. Model ayrıca ZenMux üzerinde de ücretsiz. Her iki servis de OpenAI uyumlu API sunuyor.

En basit istek örneği:

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "inclusionai/ling-3.0-flash",
    "messages": [{"role": "user", "content": "Write a Python function to parse a CSV."}]
  }'
Ling-3.0-flash için OpenRouter model sayfası; 5.1B aktif parametreli 124B MoE modeli, 262K bağlam ve 23 Temmuz 2026 yayın tarihi gösteriliyor

Halihazırda chat/completions ile konuşan tüm istemcilerde temel URL'yi, anahtarı ve model dizgesini değiştirmeniz yeterli. Bir model router kullanarak da hiçbir şeyi yeniden yazmadan Ling 3.0 Flash'ı mevcut modelinizle aynı istemler üzerinde A/B testine tabi tutabilirsiniz.

Yalnız iki noktayı hesaba katın. Ücretsiz dönem promosyon niteliğinde; ağustosun ilk günlerinden sonra kullanıma göre fiyatlandırma beklenmeli. Karşılaştırma için, önceki Ling 2.6 Flash modelinin fiyatı 1 milyon token başına girişte yaklaşık $0.01, çıkışta $0.03. Ayrıca lansmanda modeli tek bir sağlayıcı sunuyordu; dolayısıyla aktarım hızı ve erişilebilirlik bu tek altyapıya bağlı.

Ağırlıkları indirilebiliyor mu?

"Ling 3.0 flash download" ve "Ling 3.0 flash github" aramalarında karşılaşılan engel tam olarak bu. Lansmanda modelin ağırlıkları yayımlanmadı. Flash şimdilik yalnızca API üzerinden erişilebiliyor.

Bu, önceki sürümden farklı bir durum. Ling 2.6 Flash açık ağırlıklarla Hugging Face'te yayımlandı ve bugün yerel olarak çalıştırılabiliyor. Flash 3.0 için henüz böyle bir seçenek yok.

Kendi donanımınızda barındırmak veya quantize etmek istiyorsanız inclusionAI Hugging Face sayfasını takip edin. 2.6 ağırlıkları burada bulunuyor; ekip aynı yaklaşımı sürdürürse 3.0 sürümü de buraya gelir. O zamana kadar yukarıdaki API router'ları modele erişmenin tek yolu.

Ling 3.0 Flash ve Ling 2.6 Flash karşılaştırması

Ling 3.0 FlashLing 2.6 Flash
Yayın tarihi23 Temmuz 202621 Nisan 2026
Toplam parametre124B104B
Token başına aktif~5.1B~7.4B
Bağlam penceresi256K yerel (router'larda 262K)256K (router'larda 262K)
Açık ağırlıklarLansmanda yokEvet (Hugging Face)
Lansman fiyatı3 Ağustos 2026'ya kadar ücretsiz1M başına giriş ~ $0.01 / çıkış $0.03
Odak noktasıHibrit muhakemeli ajanlar, araç kullanımı, kodlamaAjanlar için hızlı instruct modeli

Kısaca 3.0 Flash, daha fazla kapasite ve hibrit muhakeme modu karşılığında aktif hesaplamayı azaltıyor; ayrıca API öncelikli dağıtıma geçiyor. Yerel ve çevrimdışı çalışacak ağırlıklara özellikle ihtiyacınız varsa, indirebileceğiniz sürüm hâlâ 2.6 Flash.

Sık sorulan sorular

Ling 3.0 Flash ücretsiz mi?

Evet, şimdilik ücretsiz. OpenRouter'da 3 Ağustos 2026'ya kadar, ZenMux'ta ise ücretsiz erişilebiliyor. Bu dönem sona erdiğinde kullanıma göre fiyatlandırma beklenmeli.

Ling 3.0 Flash açık kaynak mı? İndirebilir veya GitHub'da bulabilir miyim?

Lansmanda hayır. Herhangi bir ağırlık yayımlanmadığı için model yalnızca API üzerinden kullanılabiliyor; indirilecek bir dosya veya repo yok. OpenRouter'ı (inclusionai/ling-3.0-flash) ya da ZenMux'u kullanabilirsiniz. Eski Ling 2.6 Flash, Hugging Face'te açık olarak yer alıyor; 3.0 ağırlıkları yayımlanırsa büyük ihtimalle orada görünür.

Ling 3.0 Flash Çin menşeli bir model mi?

Evet. Model, Alipay'in arkasındaki Çinli fintech şirketi Ant Group ile bağlantılı yapay zekâ araştırma grubu inclusionAI tarafından geliştirildi.

Ling 3.0 Flash ne kadar büyük?

Model, MoE tasarımı sayesinde toplamda 124B parametreye sahip ve token başına yaklaşık 5.1B parametreyi etkinleştiriyor. Yerel bağlam penceresi 256K; inclusionAI bunun 1M'e doğru ölçeklenebileceğini belirtiyor.

Ling 3.0 Flash mı Ling 2.6 Flash mı: Hangisini kullanmalıyım?

API üzerinden hibrit muhakemeli ajan işleri ve daha düşük token başı maliyet için 3.0 Flash'ı seçin. İndirip yerel olarak çalıştırabileceğiniz ağırlıklara ihtiyacınız varsa, 3.0 henüz açık olmadığından 2.6 Flash daha uygun seçim.

İlgili okumalar