AIREITER

Prime Inference Fiyatlandırması ve API Rehberi (2026)

Son Güncelleme: 2026-10-03 07:25:12

Prime Inference artık kullanılabilir durumda: OpenAI uyumlu yapısı ve sürekli çalışan ajan trafiğine göre tasarlanmış altyapısıyla yalnızca gelecekte çıkacak bir ürün değil. Ancak fiyat tarafında tablo henüz tamamen şeffaf değil. Prime Intellect’in lansman yazısı sunum altyapısını ayrıntılı biçimde anlatıyor, fakat model bazındaki eksiksiz ücret listesine ulaşmak şimdilik geleneksel bir resmî fiyatlandırma sayfasından çok güncel fiyat dizinleri üzerinden mümkün.

Prime Intellect'in Prime Inference lansman sayfası

Prime Inference kullanıma açıldı, ancak fiyatlar farklı kaynaklara dağılmış durumda

Prime Intellect, Prime Inference’i 2 Ekim 2026’da resmen kullanıma sundu. Ürün; değişken talep için sunucusuz uç noktalar, sürekli çalışan iş yükleri içinse rezerve kapasite sunuyor. Ayrıca genel API ile alttaki model filosu birbirinden ayrılıyor. Böylece kapasite başka bir noktaya taşındığında veya bir arıza yaşandığında istemci uç noktasını değiştirmek gerekmiyor.

Bu bir bekleme listesi duyurusu değil, üretime hazır bir sürüm. Prime Intellect, ilk herkese açık dağıtımı olan GLM-5.3’ü 22 Eylül’de OpenRouter üzerinde kullanıma açtığını belirtiyor. Doğrudan bağlantı kurmak isteyenler ise OpenAI uyumlu SDK’ları https://api.pinference.ai/api/v1 adresine yönlendirebilir.

Fiyatlandırma tarafındaki durum net: Resmî lansman sayfası birleşik faturalandırma ve ekip bazında kullanım takibi vaat ediyor, ancak eksiksiz bir ücret tablosu yayınlamıyor. Bu nedenle harcama taahhüdünde bulunmadan önce güncel model fiyatlarını kimlik doğrulaması yapılmış kontrol panelinden veya models uç noktasından doğrulamak gerekiyor. Herkese açık dizinler faydalı birer anlık görüntü sunuyor; sözleşme niteliğinde fiyat teklifi sayılmamalı.

Prime Inference şu anda ne kadara mal oluyor?

Prime Inference fiyatları modele ve kullanıma göre değişiyor. Girdi ve çıktı token’ları ayrı ayrı ücretlendiriliyor. Çıktı maliyeti girdinin birkaç katına çıkabildiği için, özellikle uzun yanıtlar üreten kodlama ajanlarında veya akıl yürütme iş yüklerinde düşük görünen girdi fiyatı yanıltıcı olabilir.

Aşağıdaki tablo, 3 Ekim 2026’da endpoints.run üzerindeki Prime Intellect kataloğundan alınan anlık görüntüdür. Bu katalogda 64 uç nokta listeleniyordu. Satın alma kararı vermeden önce her bir fiyatı Prime Intellect üzerinden doğrulayın.

Model kimliğiGirdi / 1 milyon tokenÇıktı / 1 milyon tokenListelenen bağlamEn uygun kullanım
meta-llama/Llama-3.2-1B-Instruct$0.03$0.2060KSınıflandırma ve basit veri çıkarma
qwen/qwen3.7-flash$0.03$0.131MDüşük maliyetli, uzun bağlamlı genel işler
z-ai/glm-5.3-flash$0.15$0.501MDaha hızlı ajan ve araç iş akışları
qwen/qwen3-coder-next$0.30$1.50262KKodlama ve araç kullanımı
deepseek/deepseek-v4.1-flash$0.30$1.201MUzun bağlamlı akıl yürütme ve görüntü işleme
z-ai/glm-5.3$1.40$4.401MÜst seviye GLM ajan iş yükleri
deepseek/deepseek-v4-pro$1.91$3.831MDaha gelişmiş akıl yürütme
moonshotai/kimi-k3$3.45$17.251MPremium uzun bağlamlı görevler

İkinci bir dizin olan Compute Prices ise aynı tarihte 111 model gösteriyordu. Bu listede Llama 3.2 1B için milyon girdi token’ı başına tam $0.027 gibi düşük bir fiyat yer alıyordu. Kataloglardaki sayıların uyuşmaması, bu dizinlerden herhangi birini sabit bir envanter olarak kabul etmek yerine canlı API’yi sorgulamak gerektiğini gösteriyor. Listeler farklı ad alanlarını, ağ geçidi modellerini içerebilir veya farklı zamanlarda güncellenmiş olabilir.

Gerçekçi üç maliyet hesabı

Token maliyeti şu formülle tahmin edilebilir:

(girdi token’ları ÷ 1,000,000 × girdi ücreti) + (çıktı token’ları ÷ 1,000,000 × çıktı ücreti)

Aylık iş yüküModel ve token hacmiTahmini token faturası
Hafif destek botuQwen3.7 Flash; 50M girdi + 10M çıktı$2.80
Kodlama ajanıQwen3 Coder Next; 100M girdi + 40M çıktı$90.00
Çıktı ağırlıklı üst seviye ajanGLM-5.3; 200M girdi + 100M çıktı$720.00

Bu hesaplamalar yalnızca listelenen token ücretlerini kapsıyor. Rezerve kapasite sözleşmeleri, sandbox çalıştırma, eğitim, değerlendirmeler veya GPU kiralama dahil değil. Prime Intellect bu hizmetleri ayrı olarak sunduğu için uçtan uca bir ajan faturasında çıkarım token’larının dışında başka kalemler de bulunabilir.

Uzun bağlam desteği, her isteğin bir milyon token tüketeceği anlamına gelmiyor. Faturalandırma, gerçekten işlenen token’lara göre yapılıyor. Ancak bir ajan 140K token’lık geçmişi tekrar tekrar gönderirse, ön ek önbellekleme veya uygulama tarafındaki bağlam yönetimi bu tekrarları azaltmadığı sürece girdi maliyetleri hızla birikebilir.

API kurulumu tek bir uç nokta değişikliğiyle tamamlanıyor

Prime Inference, OpenAI uyumlu bir uç nokta sunuyor. Bu nedenle mevcut bir OpenAI SDK entegrasyonunda genellikle yalnızca temel URL’yi, API anahtarını ve model kimliğini değiştirmeniz yeterli. Prime Intellect’in lansman yazısında temel URL https://api.pinference.ai/api/v1 olarak veriliyor.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_PRIME_API_KEY",
    base_url="https://api.pinference.ai/api/v1",
)

response = client.chat.completions.create(
    model="z-ai/glm-5.3",
    messages=[
        {"role": "user", "content": "Write a haiku about KV caches."}
    ],
    stream=False,
)

print(response.choices[0].message.content)

Aynı isteğin cURL karşılığı şöyle:

curl https://api.pinference.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $PRIME_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "z-ai/glm-5.3",
    "messages": [
      {"role": "user", "content": "Write a haiku about KV caches."}
    ]
  }'

Prime Intellect bir CLI seçeneği de belgeliyor: prime aracını kurun, prime login ile kimlik doğrulaması yapın ve ardından prime inference chat komutunu çalıştırın. Dağıtıma geçmeden önce güncel model listesini alın ve model kimliğini birebir kopyalayın; dizinlerdeki adlandırma ön ekleri değişiklik gösterebiliyor.

Lansman mimarisi ajan iş yüklerini nasıl etkiliyor?

Prime Inference’ın farkını en çok uzun istemlerde, aynı oturumların tekrar tekrar çağrıldığı senaryolarda ve araç çağrılarının kesintisiz çalışması gereken iş akışlarında görmek mümkün. Prime Intellect’e göre tipik bir iç ajan turu, 140K token’lık isteme yaklaşık 6K token ekliyor. Bu da önbelleğin korunmasını ve yönlendirmeyi ham üretim hızının en az onun kadar önemli hâle getiriyor.

Resmî lansman raporu, GB200 NVL72 donanımındaki GLM-5.3 dağıtımından birkaç somut ölçüm paylaşıyor:

  • Prefill ve decode çalışanlarının ayrılması, Prime Intellect testlerinde p90 token’lar arası gecikmeyi yaklaşık %40 azalttı.
  • Kullanıcı başına uçtan uca saniyede 100 token hedefinde, test edilen 1:4 prefill/decode topolojisi, her prefill grubu başına 101 token/saniye hızında 66 oturumu destekledi.
  • GPU başına prefill bütçesinin 8K’dan 4K token’a indirilmesi, medyan kuyruk beklemesini 550 ms’den 110 ms’ye düşürdü ve ilk token’a kadar geçen medyan süreyi yaklaşık %20 azalttı.
  • NVFP4 sıkıştırması, aynı bellek bütçesinde çözücü başına önbellek kapasitesini 1.09 milyon token’dan 1.63 milyon token’a çıkardı; bu da yaklaşık %50 artış anlamına geliyor.
  • Blok öncelikli önbellek yerleşimi, ayrı bir TP8 karşılaştırmasında aktarım tanımlayıcılarının sayısını yaklaşık 10 kat, ortalama aktarım süresini ise 146 ms’den 78 ms’ye indirdi.

Bu rakamlar tüm iş yükleri için geçerli evrensel gecikme garantileri değil; belirli iş yüklerine ve yapılandırmalara ait. Yine de Prime Intellect’in hangi darboğazlara odaklandığını açıkça gösteriyorlar: tekrarlanan oturumlarda önbelleğin yeniden kullanılması, kabul gecikmesi, prefill/decode etkileşimi ve önbellek aktarım maliyeti.

Araç kullanımı ayrıca test edilmeli. Prime Intellect, bildirilmeyen araçların sessizce atıldığı veya bağımsız değişkenlerin yanlış türlerde gönderildiği durumlarla karşılaştığını; bunun üzerine GLM sunum yoluna kısıtlı kod çözme ve şema testleri eklediğini belirtiyor. Şirket, araç çağrısı hata oranının neredeyse sıfıra indiğini söylüyor. Ancak üretim trafiğini taşımadan önce iç içe şemalarınızı, null kabul eden bağımsız değişkenleri, akışlı çağrıları ve hatalı istekleri kendi testlerinizle yeniden çalıştırmalısınız.

Sunucusuz mu, rezerve kapasite mi? Kararı trafik yapısına göre verin

Çoğu ekip için mantıklı başlangıç noktası sunucusuz yapı. Böylece belirsiz talep, token ücretlerine dönüşüyor. Rezerve kapasite ise sürekli yüksek eşzamanlılık, öngörülebilir gecikme veya özel dağıtım ihtiyacı ortaya çıktığında ve boşta kapasite maliyetinden kaçınmak ikinci plana düştüğünde anlam kazanıyor.

İş yüküBaşlangıç için daha uygun seçenekNedeni
Prototip veya aralıklı çalışan sohbet botuSunucusuzBoşta GPU kapasitesi ayırmaya gerek yok
Dalgalı değerlendirme işleriŞimdilik sunucusuzToplu ve asenkron düşük fiyatlı çıkarım, mevcut lansman özelliği olarak değil, yol haritasında yer alıyor
Sürekli yüksek eşzamanlılığa sahip ajan servisiRezerve kapasite teklifiKapasite planlaması, nominal token ücretlerinden daha önemli olabilir
İnce ayarlı veya LoRA modeliÖnce kullanılabilirliği doğrulayınİnce ayarlı modeller için tek tıklamayla özel dağıtım, lansman yazısında yol haritası çalışması olarak tanımlanıyor
Sıkı sözleşmeli SLA veya bölge gereksinimiSatış ekibiyle görüşmeHerkese açık lansman materyallerinde evrensel bir sözleşme, bölge matrisi veya standart rezerve kapasite fiyatı belirtilmiyor

“Rezerve” seçeneğinin otomatik olarak daha ucuz olduğunu varsaymayın. Boşta geçen süreleri ve yoğun dönemler için ayrılan kapasite payını da hesaba katarak, teklif edilen kapasite maliyetini temsili eşzamanlılıkta ölçülen sunucusuz harcamayla karşılaştırın.

Prime Intellect’in hâlâ net biçimde yayınlamadığı bilgiler

Prime Inference altyapı tarafında alışılmadık ölçüde ayrıntılı bilgiler sunuyor. Buna karşın herkese açık ve dizinlenmiş materyallerde satın alma açısından önemli bazı noktalar hâlâ net değil:

  • eksiksiz resmî model bazlı ücret listesi;
  • her model için önbelleğe alınmış girdi ve akıl yürütme token’larının faturalandırma kuralları;
  • herkese açık hız ve eşzamanlılık limitleri;
  • bölge bazında veri işleme haritası;
  • çıkarım istekleri için standart veri saklama koşulları;
  • evrensel ve resmî bir SLA ile telafi koşulları;
  • rezerve kapasite için asgari süreler ve fiyatlar;
  • katalogdaki hangi kayıtların doğrudan Prime tarafından barındırıldığı, hangilerinin ağ geçidi üzerinden yönlendirildiği.

Bu bilgilerin bilinmemesi, hizmetin desteklenmediği anlamına gelmiyor. Yalnızca bu maddelerin OpenAI uyumluluğundan hareketle varsayılmaması; kontrol paneli, dokümantasyon, model uç noktası, sözleşme veya satış ekibinin yanıtı üzerinden teyit edilmesi gerektiğini gösteriyor.

Prime Inference SSS

Prime Inference resmen kullanıma açık mı?

Evet. Prime Intellect, herkese açık sürümü 2 Ekim 2026’da duyurdu ve API temel URL’si, CLI komutu ile sunucusuz/rezerve ürün ayrımını yayınladı.

Prime Inference’ın ücretsiz bir paketi var mı?

Herkese açık lansman yazısında ücretsiz Prime Inference kredilerinden söz edilmiyor. Prime Intellect’in eğitim yığını içinde ücretsiz veya sıfır fiyatlı seçenekler bulunuyor; ancak bunlar çıkarım için ücretsiz paket olarak değerlendirilmemeli.

Prime Inference, OpenAI SDK ile uyumlu mu?

Evet. OpenAI uyumlu temel URL’yi https://api.pinference.ai/api/v1 olarak ayarlayın, bir Prime API anahtarı sağlayın ve o anda kullanılabilen bir model kimliği kullanın.

Prime Inference araç çağrısını destekliyor mu?

GLM-5.3 sunum yolu araç çağrısını destekliyor. Prime Intellect ayrıca argüman şemaları için gramer zorlaması ve regresyon testleri kullandığını belirtiyor. Modellerin yetenekleri farklı olduğu için desteği yine de model bazında kontrol etmek gerekir.

Kaç model kullanılabiliyor?

Herkese açık dizinlerde 3 Ekim 2026’da 64 ve 111 kayıt gösteriliyordu. Sayılar farklı olduğu için bir hesap için gerçekten kullanılabilen envanterin güvenilir kaynağı canlı Prime model uç noktası veya kontrol panelidir.

Prime Inference, GPU kiralamaktan daha ucuz mu?

Değişken trafik için sunucusuz yapı genellikle daha kolay gerekçelendirilebilir. Kullanımın yüksek ve istikrarlı olduğu durumlarda kiralanan veya rezerve edilen GPU’lar daha ekonomik hâle gelebilir. Sonuç yalnızca token fiyatına değil; ölçülen token hacmine, eşzamanlılığa, gecikme hedeflerine ve boşta kalan kapasiteye bağlı.

Beş dakikalık devam/etme kontrolü

Prime Inference; açık model erişimine, uzun bağlamlı ajan sunumuna veya Prime Intellect’in eğitim yığınından üretime geçiş yoluna ihtiyaç duyan ekipler için test edilmeye değer. Ancak yalnızca herkese açık bir ücret listesine bakarak doğrudan satın alma kararı vermek için henüz yeterince şeffaf değil.

  1. Canlı model listesini sorgulayın; girdi, çıktı, önbellek ve akıl yürütme ücretlerini tam olarak kaydedin.
  2. Gerçek kullanımınızı yansıtan uzun bir konuşmayı yeniden çalıştırın; ilk token gecikmesini, üretim hızını ve toplam faturalandırılan token sayısını ölçün.
  3. Uygulamanın gerçek araç şemalarını akışlı ve akışsız modlarda çalıştırın.
  4. İş yükü hassassa veri saklama, bölge, hız limiti, SLA ve rezerve kapasite koşullarını isteyin.
  5. Rezerve kapasite teklifiyle karşılaştırma yapmadan önce normal ve yoğun trafik sırasında ölçülen sunucusuz harcamayı görün.

Kararı belirleyen denge açık: Prime Inference güven veren bir sunum mühendisliği ve düşük sürtünmeli bir API sunuyor. Buna karşılık fiyatları ve sözleşme koşullarını doğrulamak için lansman sayfasının tek başına sağladığından bir adım fazlası gerekiyor.