Gemini 3.8 Flash için 1 milyon giriş tokenı başına $0.75 fiyatı ilk bakışta cazip görünüyor. Ancak bu, yalnızca tanıtım dönemi fiyatı. Google’ın yayımladığı tabloda standart fiyatların 1 Ocak 2027 itibarıyla iki katına çıkacağı belirtiliyor; düşünme tokenları ve yeniden denemeler de kabul edilen görev başına maliyeti yukarı taşıyabiliyor. Bütçeyi bugünkü token etiketine göre değil, ocak fiyatlarına ve gerçek başarı oranınıza göre kurun.
Agent geliştirenler için asıl fiyat sorusu
Bakmanız gereken metrik API çağrısı başına maliyet değil. Esas ölçü, başarılı görev başına maliyet: tüm model ve araç harcamalarının kabul testini geçen çalıştırma sayısına bölünmüş hâli.
Gemini 3.8 Flash; ek düşünme kapasitesinin yeniden denemeleri azalttığı veya kabul edilen sonuç oranını yükselttiği zor, çok adımlı işler için anlamlı bir tercih. Sabit formatlı her veri çıkarma akışı ya da basit sınıflandırma rotası için varsayılan seçenek olması gerekmiyor.
“if you're picking flash for agent loops, price the jan bill, not today's api page.” — Vraj (@vraj_ai), 3 Eylül 2026
1 Ocak 2027 sonrası Gemini 3.8 Flash API ücretleri
Google’ın Gemini API fiyatlandırma dokümantasyonu ile model dokümantasyonu, tanıtım fiyatlarının 31 Aralık 2026'ya kadar geçerli olduğunu gösteriyor. Standart fiyatlar ise 1 Ocak 2027'de başlıyor.
| Faturalandırma modu | 31 Aralık 2026'ya kadar giriş | 31 Aralık 2026'ya kadar çıkış | 1 Ocak 2027'den itibaren giriş | 1 Ocak 2027'den itibaren çıkış |
|---|---|---|---|---|
| Standard | $0.75 / 1M | $3.75 / 1M | $1.50 / 1M | $7.50 / 1M |
| Batch | $0.375 / 1M | $1.875 / 1M | $0.75 / 1M | $3.75 / 1M |
| Flex | $0.375 / 1M | $1.875 / 1M | $0.75 / 1M | $3.75 / 1M |
| Priority | $1.35 / 1M | $6.75 / 1M | $2.70 / 1M | $13.50 / 1M |
| Önbelleğe alınmış giriş | $0.075 / 1M | — | $0.15 / 1M | — |
Bunlar token ücretleri; eksiksiz bir agent faturası değiller. Dokümante edilen grounding, önbellek depolama, harici araçlar, barındırma ve sağlayıcı ücretleri ek maliyet doğurabilir. Çıkış faturalandırmasına yalnızca kullanıcıya gösterilen yanıt değil, düşünme tokenları da dahildir.
Gecikmeye toleranslı işler için bütçeyi düşürmenin en kullanışlı yolu Batch. İş yükü uygunsa ve kullanılan API yüzeyi gerçekten Batch ücretini uyguluyorsa, değişiklikten sonra Batch fiyatı bugünkü Standard fiyatına eşit olacak.
Başarılı görev başına maliyet nasıl hesaplanır?
Tek bir token çarpımı yerine dört katmanlı hesap kullanın:
- Deneme başına model maliyeti =
(giriş tokenları × giriş ücreti) + (çıkış tokenları × çıkış ücreti). - Deneme maliyeti = model maliyeti + araç, grounding, depolama ve altyapı ücretleri.
- Beklenen başarılı görev maliyeti = deneme maliyeti ÷ başarı olasılığı.
- Gözlenen başarılı görev maliyeti = toplam harcama ÷ kabul edilen görevler.
Bir agent döngüsünde tüm model turlarını ve yeniden denemeleri hesaba katın. Bir çalıştırma yanıt vermeden önce üç çağrı yapıyorsa, giriş ve çıkış tokenları bu üç çağrının toplamıdır. Düşünme tokenlarını çıkış kullanımına dahil edin; Google, Gemini yanıtlarında promptTokenCount, thoughtsTokenCount ve candidatesTokenCount gibi kullanım alanları sunuyor.
Örnek hesap: 20.000 giriş ve 5.000 çıkış tokenı
Bir tam denemenin 20.000 giriş tokenı ve 5.000 çıkış tokenı kullandığını varsayalım. Bu örnekte araç ücretlerini hesaba katmıyoruz.
| Dönem | Hesaplama | Deneme başına maliyet | %70 başarıda başarılı görev başına maliyet |
|---|---|---|---|
| 31 Aralık 2026'ya kadar | 0.02 × $0.75 + 0.005 × $3.75 | $0.03375 | $0.0482 |
| 1 Ocak 2027'den itibaren | 0.02 × $1.50 + 0.005 × $7.50 | $0.06750 | $0.0964 |
Token kullanımı ve başarı olasılığı sabit kaldığında fiyat değişikliği maliyeti ikiye katlıyor. Agent bazı başarısızlıklardan sonra bir kez yeniden deniyorsa, başarısız denemeler de token tükettiği için gerçek ortalama bu basit tahminin üstüne çıkar.
Payda kritik önem taşır. Çağrı başına $0.05 maliyetli ancak çalıştırmaların yalnızca yarısında başarılı olan bir agent, araç ücretleri hariç kabul edilen görev başına $0.10'a mal olur. Çağrı başına $0.08 maliyetli ve %90 başarı oranına sahip bir agent ise kabul edilen görev başına yaklaşık $0.0889 maliyet üretir.
Cevabı değiştiren üç bütçe senaryosu
Sabit yapılı veri çıkarma
Kararlı bir şemaya sahip PDF'den JSON'a akışında kabul testi genellikle nettir: zorunlu alanlar bulunur, türler doğrulanır ve fazladan açıklama metni gelmez. low düşünme seviyesiyle başlayın ve görevin testi geçip geçmediğini ölçün. Doğrulama zaten başarılıyken high efor için ödeme yapmak, paydayı büyütmeden maliyet ekler.
Google’ın model dokümantasyonu, Gemini 3.8 Flash için low, medium ve high düşünme seviyelerini tanımlıyor; minimal desteklenmiyor. Düşünme seviyesini uygulama genelindeki tek bir varsayılan yerine rota bazlı maliyet ayarı olarak ele alın.
Uzun bağlamlı agent işleri
Bir kodlama veya araştırma agentı, büyük bir bağlamı birden çok turda yeniden kullanabilir; ardından ek düşünme ve araç çağrıları üretebilir. Bu senaryoda önbelleğe alınmış giriş, daha az yeniden deneme ve daha yüksek başarı oranı, nominal çıkış ücretinden daha belirleyici olabilir.
Uzun süren görevlerde bağlamın yeniden oynatılmasını yeni girişten ayrı kaydedin. 1 milyon tokenlık bağlam penceresi, bu tokenların ücretsiz olduğu anlamına gelmez. Rota etkileşimliyse Standard veya Priority uygun olabilir; iş gece boyunca çalışabiliyorsa Batch ya da Flex'i zaman gereksinimiyle birlikte karşılaştırın.
Yeniden denemesi yoğun otomasyon
Bir rotanın 1 Ocak sonrası deneme başına $0.0675 maliyete sahip olduğunu ve %70 başarıya ulaştığını varsayalım. Yeniden denemelerin birbirinden bağımsız olduğunu ve yeniden deneme sınırı bulunmadığını kabul edersek, başarı başına beklenen deneme sayısı yaklaşık 1 ÷ 0.70 = 1.43; kabul edilen görev başına model maliyeti ise yaklaşık $0.0964 olur.
Hatalar pahalı tarayıcı işlemlerini, arama çağrılarını veya insan incelemesini tetikliyorsa bu maliyetleri de paydaya ekleyin. Bir agent token açısından ucuz, operasyonel açıdan ise pahalı olabilir.
Gemini 3.8 Flash hangi durumlarda yüksek maliyetini hak eder?
Ek düşünme kapasitesi sonucu değiştiriyorsa Gemini 3.8 Flash kullanın: daha az reddedilen yama, daha az başarısız araç dizisi, daha iyi çok adımlı doğrulama veya zor görevlerde daha yüksek kabul oranı gibi. Tekrarlayan dönüşümler, yönlendirme, veri çıkarma ve düşük eforda kabul testini zaten geçen diğer işler için daha ucuz bir rota tutun.
Artificial Analysis tarafından raporlanan ve Apidog tarafından özetlenen bağımsız veriler, yüksek düşünme yapılandırmasında Gemini 3.8 Flash için benchmark görevi başına yaklaşık $0.58; Gemini 3.7 Flash için ise yaklaşık $0.40 maliyet gösteriyor. Intelligence Index skoru da 59'a karşı 56. Bunlar belirli benchmark'lara ait rakamlar, evrensel bir fatura tahmini değil; iş yükünüz için fiyat teklifi olarak değil, token tüketiminin ekonomiyi değiştirebildiğinin kanıtı olarak değerlendirin.
Topluluk paylaşımları da aynı yöne işaret ediyor. Jan (@jan_volad), bir Gemini 3.8 Flash karşılaştırmasında yaklaşık 120 milyon çıkış tokenı kullanıldığını; rakiplerde bu sayının 29–35 milyon olduğunu bildirdi ve harmanlanmış görev maliyetini $0.58 olarak aktardı. Bu, bağımsız denetimden geçmiş bir üretim faturası değil, kullanıcı gözlemi. Gönderi, düşük milyon-token ücretinin tasarrufu neden olduğundan fazla gösterebildiğini açıklaması açısından yararlı.
Pratik bir yönlendirme kuralı şöyle olabilir:
- Zor agent görevi: Gemini 3.8 Flash'ı
mediumveyahighseviyesinde test edin; kabul edilen görev maliyetini ölçün. - Rutin görev: önce
lowseviyesini deneyin; rotayı yalnızca kalite kontrolünden geçiyorsa koruyun. - Gecikmeye toleranslı toplu işler: 1 Ocak sonrasında Batch'i Standard ile karşılaştırın.
- Kalitesi belirsiz tüm rotalar: başarı olasılığını ölçmeden token ücretini optimize etmeye çalışmayın.
Gemini 3.8 Flash fiyatlandırması: Sık sorulan sorular
Batch her zaman daha mı ucuz?
Yayımlanan fiyat tablosunda Batch daha ucuz, ancak ertelenmiş işlemeyi tolere edebilen iş yükleri için tasarlanmış durumda. Anında yanıt vermesi gereken etkileşimli bir agent için doğrudan alternatif değildir.
Başarılı agent görevi başına maliyeti nasıl hesaplarım?
İlgili çalışma aralığındaki model, araç, grounding ve altyapı ücretlerini toplayın; ardından bunu kabul testinizi geçen çalıştırma sayısına bölün. Tahmin için deneme başına beklenen maliyeti tahmini başarı olasılığına bölün ve beklenen yeniden denemeleri dahil edin.
Pratik sonuç: Modeli değil, rotayı bütçeleyin
Giriş, düşünme, görünür çıkış, araç turları, yeniden denemeler, gecikme, harcama ve kabul durumunu rota bazında kaydedin. İlgili düşünme seviyelerini test edin; ardından hem aralık hem de ocak fiyat tablolarıyla projeksiyon yapın.
Karar basit: ek düşünmenin başarılı sonuç getirdiği yerlerde Gemini 3.8 Flash kullanın, zaten başarılı olan işler için daha düşük efor seçin ve uygun toplu işleri Batch'e taşıyın. Ocak 2027 fiyat değişikliği yayımlanan tabloda şu anda planlanmış görünüyor; modelin ekonomik olup olmadığını ise her başarılı sonucun arkasındaki tokenlar ve başarısızlıklar belirler.