AIREITER

LLM API neden bu kadar pahalı? Mesele birim fiyat değil, hacim

Son Güncelleme: 2026-10-01 01:51:07

Bir Claude Code kullanıcısı, Max planıyla bir ayda yaptığı işi API liste fiyatları üzerinden hesapladı ve 200 dolarlık fatura karşısında 7.470 dolarlık bir tutarla karşılaştı. Sorun, token başına fiyatın anormal derecede yüksek olması değil. Abonelikte fark etmeden uygulanan bir tavan, ölçümlendirilmiş API erişiminde ortadan kalkıyor; ayrıca ajan tabanlı iş akışları, sohbet kutusuna yazan bir insanın göndereceğinden çok daha fazla token’ı tekrar tekrar iletiyor.

Geliştiricilerin karşılaştığı fiyat farkı

Paylaşılan oranlar hem yüksek hem de birbirine oldukça yakın. Claude Code oturum kayıtlarını inceleyen bir r/ClaudeAI başlığı, bir aylık Max kullanımını 200 dolarlık aboneliğe karşı yaklaşık 7.470 dolarlık API liste fiyatı olarak hesapladı. Daha küçük bir abonelik ve API karşılaştırması başlığında ise 200 dolarlık plan kullanan biri, aynı iş yükünün aylık maliyetini 5.000–20.000 dolar aralığında tahmin etti.

Bunlar denetlenmiş kullanıcı ölçümleri değil. Ancak her iki örnekte de token tüketimini asıl büyüten senaryo aynı: bir deponun üzerinde döngüye giren bir ajan.

"Şirketim için Claude Code üzerinden kurumsal API planı kullanıyorum. Büyük projelerde normal şekilde kod yazarken bile tek bir oturumda API maliyetlerine rahatlıkla 100–200 dolar harcayabileceğinizi bizzat söyleyebilirim." — u/andywidjaja, r/ClaudeAI

Ücretli planla API anahtarı aynı ürün değil

Anthropic bu ayrımı açıkça ifade ediyor. 16 Mart 2026’da güncellenen yardım merkezi makalesinde Claude planlarıyla Claude Console’u “farklı amaçlar için tasarlanmış ayrı ürünler” olarak tanımlıyor ve ücretli aboneliğin “Claude API veya Console erişimini kapsamadığını” belirtiyor. OpenAI de aynı ayrımı yapıyor; ChatGPT ile API platformunun faturalandırmasını ayrı sistemler üzerinden yürütüyor.

İki tarafın gerçekte ne sattığına bakmak, tabloyu daha anlaşılır kılıyor:

Ücretli sohbet planıAPI anahtarı
Satılan birimBir insan kullanıcının koltuğuToken kapasitesi
SınırHareketli 5 saatlik pencere ve haftalık limitlerPakete dahil kota yok; hız ve harcama limitleri yine geçerli
Sunum şekliWeb, masaüstü ve mobil uygulamalarKendi kodunuz
Fiyat yapısıSabit aylık ücretDeğişken, token başına
Kendi ürününüzü çalıştırmaSatış amacı bu değilAsıl kullanım amacı bu

Claude’un fiyatlandırma sayfasında Pro planı aylık ödemede 20 dolar, yıllık ödemede ise aylık 17 dolar (peşin 200 dolar) olarak listeleniyor. Max planı da beş saatlik oturum başına Pro kullanımının 5 veya 20 katı seçenekleriyle aylık 100 dolardan başlıyor. Anthropic bu kademeler için mesaj sayısı yayımlamıyor; çünkü tüketim, konuşmanın uzunluğuna, modele ve kullanılan özelliklere göre değişiyor. Dolayısıyla karşılaştırmada bir tarafta ölçülmüş, diğer tarafta ise ölçülmemiş bir miktar var.

Free, Pro ve Max kademelerini gösteren Claude plan fiyatlandırma sayfası

Aynı sayfada dikkat çeken bir ayrıntı daha var: Claude Enterprise, kullanıcı başına aylık 20 dolarlık ücretin yanında API fiyatları üzerinden ücretlendirilen kullanım sunuyor. Yani yoğun kullanan müşteriler sonunda yine sayaçlı modele dönüyor.

Abonelik ücretiniz liste fiyatıyla kaç token ediyor?

Plan ücretini token’a çevirdiğinizde fark somutlaşıyor. Aşağıdaki değerler, 1 milyon token (MTok) başına resmî fiyatlar. Veriler Claude platform fiyatlandırma belgeleri ile OpenAI API fiyatlandırma sayfasından alınmış ve 1 Ekim 2026’da kontrol edilmiştir.

Claude ve OpenAI modellerinde milyon token başına giriş ve çıkış liste fiyatları
ModelGirişÇıkışÖnbellek okumaBatch (giriş/çıkış)
Claude Fable 5.1$10$50$0.25$5 / $25
Claude Opus 5.5$4$20$0.20$2 / $10
Claude Sonnet 5.5$2$10$0.20$1 / $5
Claude Haiku 4.5$1$5$0.10$0.50 / $2.50
GPT-6 Astra$10$50$1.00$5 / $25
GPT-6.1 Sol$2$10$0.10$1 / $5
GPT-6 Luna$0.10$0.50$0.01$0.05 / $0.25
Yirmi dolarlık API kredisiyle modellere göre kaç milyon çıkış token’ı alınabildiği

Sohbet benzeri bir iş yükünde, birkaç bin kelimelik bağlam ve birkaç yüz kelimelik yanıt için 20 dolarlık Sonnet 5.5 kredisi yaklaşık 10 milyon giriş token’ı veya 2 milyon çıkış token’ını karşılar. Kendi hesabınızı API yanıtındaki dört alan üzerinden yapabilirsiniz: (fresh input × input rate) + (cached input × cache-read rate) + (cache writes × write rate) + (output × output rate). Bunun üzerine batch, uzun bağlam ve bölge çarpanları eklenebilir. Her uç nokta için bu dört değeri bir hafta boyunca kaydederseniz, ortaya çıkan aylık rakamı tek bir kullanıcı koltuğunun maliyetiyle karşılaştırabilirsiniz.

Token’lar gerçekte nerede harcanıyor?

Beklenmedik token maliyetlerinin dört yaygın kaynağı doğrudan fiyat tablosunda görünmüyor. Son üç başlık, LLM Cost Lab’in fiyat tablosu dışında kalan maliyetler analizinde ayrıntılı biçimde ele alınıyor.

  1. Her turda yeniden gönderilen konuşma geçmişi. İstek tabanlı sohbet entegrasyonlarında istemci, geçmişi yeniden gönderir. Böylece 20. tur, beraberinde 1’den 19’a kadar olan turları da taşır. Her tur benzer miktarda bağlam eklediğinde giriş hacmi, konuşma uzunluğunun karesiyle yaklaşık aynı hızda büyür. Bu yüzden söz konusu analiz, 20 turluk bir oturumun maliyetini bağımsız çağrılar için ayrılan 0,063 dolara karşı 0,163 dolar olarak hesaplıyor; fark 2,6 kat.
  2. Her çağrıyla çarpılan sistem istemi. 1 milyon istekte kullanılan 2.000 token’lık bir sistem istemi, kullanıcı tek kelime yazmadan önce 2 milyar giriş token’ı demektir.
  3. Görmediğiniz akıl yürütme token’ları. Gizli düşünme izlerini çıkış olarak ücretlendiren modellerde bu token’lar, görünen yanıttan birkaç kat daha uzun olabilir. Bu nedenle faturayı yalnızca dönen karakter sayısına göre izlemek gerçek tüketimi olduğundan düşük gösterir.
  4. Araç sonuçları, tekrar denemeler ve çöpe atılan üretimler. Model ürettiyse ücretini ödersiniz. Buna JSON doğrulayıcınızın reddettiği yanıt ve aynı anda çalıştırıp sonrasında attığınız paralel çağrı da dahil.

Ucuz token’lar bile faturanın çoğunluğunu oluşturabilir. Kullanım panosuna bakanların kafasını karıştıran nokta da bu. 7.470 dolarlık örneğin yer aldığı başlıkta bir yorumcu, en ucuz token türü olmasına rağmen önbellek okumalarının toplamın yüzde 48’ini oluşturduğuna dikkat çekti.

"API’deki en ucuz token türü zaten bu. Liste fiyatlarını uyguladıktan sonra bile hâlâ baskın olması, gerçek iş yükünün büyük ölçüde her turda bağlamı yeniden okumaktan oluştuğunu gösteriyor." — u/YoanEdwin, r/ClaudeAI

Şimdi 150 bin token’lık depo bağlamı taşıyan bir ajan turuna Opus 5.5 fiyatlarını uygulayalım. Tablo, maliyetin nasıl oluştuğunu net biçimde gösteriyor:

Opus 5.5, 60 turluk oturum, tur başına 150 bin bağlam + 2 bin çıkış token’ıMaliyet
Tur başına taze giriş, önbellek isabeti yok (150 bin @ $4)$0.60
Taze giriş yerine tur başına önbellek okuma (150 bin @ $0.20)$0.03
Tur başına çıkış (2 bin @ $20)$0.04
Oturum başına bir adet 1 saatlik önbellek yazımı (150 bin @ $8)$1.20
Oturum toplamı, önbelleksiz$38.40
Oturum toplamı, önbellekli$5.40

22 iş günü boyunca günde iki önbellekli oturum, yaklaşık 238 dolar tutar ve 200 dolarlık planı şimdiden aşar. Önbelleksiz kullanımda aynı ayın maliyeti 1.600 doları geçer. Değişen oran değil, token sayısıdır.

İki değil, üç farklı kullanım katmanı var

Çoğu karşılaştırma plan ile API arasında kalıyor. Oysa üçüncü bir katman daha var ve kullanıcılar kotası bittiğinde bununla karşılaşıyor: abonelik ürünü içinde satılan ek kullanım kredileri.

r/codex kullanıcılarının paylaşımlarına göre bu katman, ham API fiyatlarının bile üzerine çıkabiliyor. Bir Pro kullanıcısı, satın alınan yaklaşık 40 dolarlık kredilerle yaklaşık 16 milyon token tükettiğini, aynı hacmin liste API fiyatlarıyla yaklaşık 12 dolara mal olacağını hesapladı.

"Evet, kredi fiyatlandırması açgözlülüğün sınırında. API maliyeti yaklaşık 2 dolar olacakken tek bir açılış sayfası için 50 dolar istemek saçmalık." — u/AbjectBug5885, r/codex

Bunlar evrensel fiyatlar değil, kullanıcı tahminleri. Ek kredi fiyatları satıcıya ve plana göre değişiyor. Ancak yukarıdaki Codex örneklerinde ek kredi katmanı, eşdeğer liste API harcamasının yaklaşık 3 katına denk geliyor. İkinci hafta üst üste kredi satın almadan önce kendi kullanımınızda bu hesabı yapmakta fayda var.

Faturayı değiştiren beş hamle

Bu hamlelerin her biri resmî bir fiyatla bağlantılı; dolayısıyla hesabı önce sağlayıcının fiyatlandırma sayfasıyla doğrulamak mümkün.

  1. Yazma maliyetini hesaba katarak istem önbellekleme. Anthropic’in fiyatlandırma belgelerine göre 5 dakikalık önbellek yazımı, temel giriş fiyatının 1,25 katı; 1 saatlik yazım ise 2 katı. Okuma maliyeti temel fiyatın 0,1 katı (Opus 5.5’te 0,05, Fable 5.1’de 0,025). 5 dakikalık yazım kendini bir okumadan, 1 saatlik yazım ise iki okumadan sonra amorti ediyor. Bir kez yazıp hiç okumazsanız önbellek kullanmamak daha ucuz olur. Önbelleği etkinleştirmek kadar içeriğin sırası da önemli: sabit içerik önce, kullanıcıya özgü değişkenler en sonda olmalı; aksi hâlde ön ek eşleşmeyi bırakır. İsabet oranını analiz etmek için bu istem önbellekleme rehberine bakabilirsiniz.
  2. Bekleyebilecek işleri batch’e taşıyın. Her iki sağlayıcı da asenkron işleme için liste fiyatlarını yüzde 50 düşürüyor. Opus 5.5’in fiyatı 2/10 dolara, Sonnet 5.5’in fiyatı 1/5 dolara iniyor. Ancak diğer modellerde kapsam aynı değil: LLM Cost Lab, takip ettiği 83 modelin yalnızca 26’sında indirimli batch kademesi bulunduğunu belirtiyor. Mimariyi buna göre kurmadan önce kullandığınız modelde bu seçeneğin olduğundan emin olun. İşleyişi batch API fiyatlandırma rehberimizde bulabilirsiniz.
  3. Göreve göre model seçin. Sınıflandırma, yönlendirme ve bilgi getirme kararları çoğu zaman en üst seviye bir model gerektirmez. On token üreten adımlarda Haiku 4.5’in 1/5 dolarlık fiyatıyla Fable 5.1’in 10/50 dolarlık fiyatı arasında 10 kat fark var.
  4. Yalnızca max_tokens değil, çıktının kendisini de sınırlayın. Yukarıdaki tablonun neredeyse her satırında çıkış token’ları girişin 5 katı fiyatlanıyor. Ön metni yasaklayan bir şema, yapısal açıdan küçük bir ek yük karşılığında aksi hâlde ücret ödeyeceğiniz gereksiz açıklamaları ortadan kaldırır. max_tokens ise biçimlendirme aracından çok güvenlik sınırı olarak kullanılmalı; çünkü kesilen bir yanıt ikinci bir ücretli denemeyi gerektirebilir.
  5. Üzerine eklenen çarpanları takip edin. OpenAI’nin uzun bağlam kademesi kısa bağlam giriş fiyatlarını ikiye katlıyor; Fast mode ise standart fiyatı bir kez daha ikiye katlıyor. Anthropic, ABD’ye sabitlenmiş çıkarım için 1,1 kat ücret alıyor. Ayrıca fiyatlandırma belgelerinde Claude 4.7 ve sonraki sürümlerin aynı metin için yaklaşık yüzde 30 daha fazla token üreten yeni bir tokenizer kullandığı belirtiliyor. İsteminiz değişmedi; sayaç değişti.

Bu listenin dışında kalan yapısal bir seçenek daha var: programatik trafiği her sağlayıcıyla ayrı bir faturalandırma ilişkisi kurmak yerine tek bir ölçümlendirilmiş uç nokta üzerinden yönlendirmek. AIReiter’ın Claude API uç noktası bunun için tasarlanmış durumda. Liste fiyatlarıyla 40 milyon Sonnet sınıfı giriş token’ı ve 8 milyon çıkış token’ından oluşan bir aylık taşma kullanımının maliyeti 80 + 80 dolar. İkinci bir kullanıcı koltuğuyla karşılaştırma yapmak yaklaşık bir dakika sürer.

Hangisini satın almalısınız?

DurumunuzAlınNedeni
Sohbet, araştırma ve bir uygulamada ara sıra kod kullanımıYalnızca ücretli planSabit harcama, pakete dahil uygulamalar ve plan limitlerinin oldukça altında kullanım
Tek makinede bireysel ajan tabanlı kodlamaÖnce plan, taşan kullanım için ölçümlendirilmiş anahtarPlan kullanımın çoğunu karşılar; anahtar ise haftalık sıfırlamayı bekleme sorununu ortadan kaldırır
Başkalarının kullanacağı bir ürün yayımlamakYalnızca APIBir kullanıcı koltuğu tek bir insanı karşılar; kullanıcılarınızın kendi token kapasitesine ihtiyacı vardır
Dönemsel toplu işler: değerlendirme, geriden doldurma ve sınıflandırmaBatch kademeli APIListe fiyatında yüzde 50 indirim, gecikmenin önemi yok
Çoğu hafta ek kredi satın alıyorsanızTaşan kullanımı bir API anahtarıyla karşılaştırarak fiyatlayınRaporlanan kredi fiyatları, liste API fiyatlarının üzerindeydi

Sık sorulan sorular

Ücretli ChatGPT veya Claude planı API kredisi içeriyor mu?

Hayır. Anthropic’in yardım merkezi, ücretli Claude planının “Claude API veya Console erişimini kapsamadığını” açıkça belirtiyor. OpenAI de ChatGPT ile API platformunu ayrı sistemler üzerinden faturalandırıyor. İkisi için ödeme yapmak, iki ayrı kalem anlamına geliyor.

Görmediğim akıl yürütme token’ları için de ücret öder miyim?

Düşünme veya genişletilmiş akıl yürütme özelliği sunan modellerde evet. Bu token’lar çıkış fiyatı üzerinden ücretlendirilir ancak yanıt gövdesinde görünmez. Bu yüzden usage nesnesini kontrol etmelisiniz.

Her turda konuşmanın tamamı için mi ödeme yapıyorum?

Önbellek isabeti tekrarlanan ön eki karşılamıyorsa evet. Sunucu taraflı bir durum özelliği bulunmadığında istemciniz, modelin görmesini istediğiniz geçmişi yeniden gönderir. Bu geçmiş, modelin giriş fiyatı üzerinden taze giriş olarak veya ön ek eşleştiğinde önbellek okuma fiyatıyla ücretlendirilir.

Başarısız olan veya tekrar denenen bir istek de ücretli mi?

LLM Cost Lab’in faturalandırma analizine göre modele ulaşan ve yanıt döndüren bir istek, uygulamanız şema hatası ya da istemci zaman aşımı sonrasında sonucu çöpe atsa bile ücretlendirilir. Üretim başlamadan önce reddedilen istekler bunun istisnasıdır.

Henüz çözülemeyen tercih

Planlar harcamayı sınırlar ancak erişimi kotalara böler; ölçümlendirilmiş API anahtarları ise bu ikisini tersine çevirir. Plan kotaları için yayımlanmış bir token karşılığı bulunmadığından, “Benim için hangisi daha ucuz?” sorusunun yanıtını bulmanın yolu, bir hafta boyunca kendi trafiğinizi ölçmek ve yukarıdaki tablo üzerinden fiyatlamaktır.

İlgili yazılar: 2026’nın en ucuz LLM API’si · Claude API fiyatlandırma rehberi