Yüksek hacimli, basit AI işlerinde maliyet hızla büyüyebilir. Gemini 3.5 Flash-Lite tam bu noktaya oynuyor: 1 milyon giriş tokenı için $0.30, çıkış tokenı içinse $2.50. Yaptığım kısa karşılaştırmada aynı görevlerde Gemini 3.6 Flash'tan %94 daha ucuza geldi, yanıtları daha hızlı akıttı ve doğru sonuçlar verdi. Ancak bu model derin muhakeme için değil, hacim ve hız için optimize edilmiş. İş yükünüz çoğunlukla düz ve yüksek adetliyse ilk bakmanız gereken model bu.
Gemini 3.5 Flash-Lite ne sunuyor?
Flash-Lite, Gemini'nin hızlı model ailesindeki en alt seviye. Çağrı başına maliyetin ve gecikmenin ham model zekâsından daha önemli olduğu, yüksek hacimli ve basit işler için tasarlanmış. Öne çıkan noktalar şöyle:
- Fiyatlandırma: 1 milyon token başına $0.30 giriş / $2.50 çıkış.
- Bağlam penceresi: Daha büyük Flash modelleriyle aynı, 1M token.
- Hız: Google, saniyede yaklaşık 350 çıkış tokenı ürettiğini belirtiyor.
- Zekâ seviyesi: Artificial Analysis Index puanı 36; daha pahalı 3.6 Flash'ta bu değer 50. Ödün verilen nokta burada.
3.6 Flash ve güvenlik odaklı 3.5 Flash Cyber ile birlikte piyasaya çıktı, fakat bambaşka bir kullanım alanını hedefliyor: büyük ölçekte sınıflandırma, veri çıkarma, yönlendirme, etiketleme ve basit sohbet.
Gemini ailesinin en ucuz seçeneği
Serinin geri kalanıyla kıyaslandığında Flash-Lite belirgin biçimde daha ucuz. Rakamların tamamı Google'ın resmi fiyatlandırma sayfasından alınmıştır:
| Model | 1M giriş | 1M çıkış |
|---|---|---|
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 |
| Gemini 3.6 Flash | $1.50 | $7.50 |
| Gemini 3.5 Flash (önceki) | $1.50 | $9.00 |
Bu, 3.6 Flash'a kıyasla girişte 5 kat, çıkışta 3 kat daha düşük fiyat demek. Üstelik modellerin pratikte tükettiği token sayısı hesaba katıldığında gerçek maliyet farkı daha da açılıyor.
3.6 Flash ile aynı görevlerde denedim
22 Temmuz 2026'da OpenRouter üzerinden, temperature değeri 0 iken iki modele de aynı üç istemi gönderdim: bir kodlama görevi, bir muhakeme problemi ve JSON çıkarma görevi.
| Metrik (3 görev, temp 0) | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash |
|---|---|---|
| Giriş tokenı | 147 | 148 |
| Çıkış tokenı | 543 | 3,058 |
| Toplam maliyet | $0.0014 | $0.023 |
| İlk tokene kadar ortalama süre | 1.2 sn | 4.5 sn |
| Üretim hızı | 400 tok/sn üzeri | — |
| Doğru yanıtlar | 3 / 3 | 3 / 3 |
Flash-Lite %94 daha düşük maliyetle üç görevin tamamını doğru yanıtladı; buna çok adımlı tren zamanlama problemi de dahil. Aradaki farkı iki unsur yaratıyor. İlk olarak model saniyede 400'ün üzerinde token akıttı; bu, belirtilen 350 tokenlik hızın üzerinde. 3.6 Flash gibi yanıt üretmeden önce "düşünmek" için beklemediğinden ilk tokene de daha erken ulaşıyor. İkinci olarak çok daha kısa yanıt veriyor: 3.6 Flash birkaç bin token üretirken Flash-Lite birkaç yüz tokenda kalıyor. Bunun sebebi, 3.6 Flash'ın ücretlendirilen gizli muhakeme tokenlarına ciddi miktarda harcama yapması. Basit işlerde bu muhakeme fazladan yükten ibaret kalıyor.
Günlük kullanımda tepki süresi farkı da kolayca hissediliyor. Flash-Lite ilk tokenı ortalama 1.2 saniyede gönderirken 3.6 Flash'ta bu süre 4.5 saniye. Sohbette veya yüksek hacimli bir işlem hattında sonuç olarak daha çevik hissettiriyor.
Burada iki önemli not var. İlk olarak, bu test temperature 0 ile yapılan tek bir çalışmaydı; modeller çalıştırmadan çalıştırmaya değişkenlik gösterebilir. Bu nedenle kesin rakamları bir benchmark değil, gösterge olarak değerlendirmek gerekir. İkinci olarak üç görev de kolaydı. Intelligence Index farkı, yani 36'ya karşı 50, gerçek ve daha zor problemlerde kendini gösteriyor. Karmaşık çok adımlı ajanlarda, incelikli kodlama işlerinde veya dikkatli muhakeme isteyen herhangi bir görevde Flash-Lite'ın sınırlı düşünme bütçesi tasarruf olmaktan çıkıp sınır hâline gelebilir.
Flash-Lite ne zaman mantıklı, ne zaman değil?
- Gemini 3.5 Flash-Lite'ı tercih edin: Yüksek hacimli, gecikmeye duyarlı ve düşük karmaşıklıktaki işler için. Sınıflandırma, varlık çıkarma, yönlendirme ve önceliklendirme, etiketleme, kısa metin özetleme ve basit sohbet buna dahil. Bu fiyat seviyesinde, 3.6 Flash ile maliyet açısından rahatsız edici olabilecek ölçeklerde çalıştırabilirsiniz.
- Gerektiğinde 3.6 Flash'a geçin: Görev gerçek muhakeme gerektiriyorsa; örneğin ajan tabanlı kodlama, bilgisayar kullanımı, çok adımlı iş akışları veya yanlış yanıtın maliyetli olduğu senaryolarda. Bu katmanın benchmark'ları ve fiyatlandırması için kapsamlı Gemini 3.6 Flash rehberine bakabilirsiniz.
Yaygın yaklaşım, iki modeli birlikte kullanmak: Ucuz ve basit çağrıların büyük bölümünü Flash-Lite'a yönlendirmek, yalnızca zor vakaları 3.6 Flash'a yükseltmek. İki model de 1M token bağlam penceresini ve aynı API'yi kullandığından geçiş, model ID'sinde tek satırlık değişiklikle yapılabiliyor.
Gemini 3.5 Flash-Lite'a nasıl erişilir?
Model, Gemini API ve Google AI Studio'da gemini-3.5-flash-lite kimliğiyle kullanıma açık. Denemeler için AI Studio içinde ücretsiz bir katman da bulunuyor. Bir toplayıcı üzerinden çalışıyorsanız OpenRouter ve AIReiter, modeli Google'ın liste fiyatıyla sunuyor. Tek bir anahtar altında Gemini veya Claude modellerini birlikte kullanıyorsanız bu pratik olabilir.
Sık sorulan sorular
Gemini 3.5 Flash-Lite ne kadar?
1 milyon giriş tokenı için $0.30, 1 milyon çıkış tokenı için $2.50. Gemini serisindeki en ucuz katman bu.
Gemini 3.5 Flash-Lite ücretsiz mi?
Prototip geliştirme için Google AI Studio'da ücretsiz bir katman var. Üretim kullanımı ise yukarıdaki kullandıkça öde fiyatlandırmasına tabi.
Gemini 3.5 Flash-Lite ne kadar hızlı?
Google, modeli saniyede yaklaşık 350 çıkış tokenı olarak derecelendiriyor. Akış testimde 400 token/saniyenin üzerine çıktı ve ilk token yaklaşık 1.2 saniyede geldi.
Flash-Lite yeterli mi, yoksa 3.6 Flash mı kullanmalıyım?
Basit ve yüksek hacimli görevlerde Flash-Lite doğru sonuç veriyor ve çok daha ucuz. Muhakeme ağırlıklı veya ajan tabanlı işler içinse 3.6 Flash'ın daha yüksek zekâ seviyesi, yani 36'ya karşı 50 Index puanı, ek maliyete değer.
