Gemini 3.5 Flash-Lite ve Gemini 3.1 Pro: İkisini de Test Ettim

Son Güncelleme: 2026-07-23 03:15:26

Google'ın en ucuz 3.5 nesli modeli, girdi token başına 6,7 kat pahalı bir Pro modelinin yerini tutabilir mi? 23 Temmuz 2026'da aynı dört istemi gemini-3.5-flash-lite ve gemini-3.1-pro-preview ile, aynı OpenAI uyumlu API rotasında denedim. Doğrulukta beraberlik vardı; ancak fatura 25 kat farklı çıktı. Flash-Lite'ın yaptığı tek hata ise üretim hatlarını bozabilecek türdendi. Orta segment Flash'ı da değerlendiriyorsanız, karşılaştırması Gemini 3.5 Flash vs Gemini 3.1 Pro yazımızda.

Dört aynı istemde sonuç ne oldu?

İstemler tamamen aynıydı, API rotası aynıydı ve tüm yanıtları programatik olarak puanladım: kod görevi için 8 yerel test vakası, çıkarma görevi için de katı bir şema kullandım.

GörevFlash-Lite3.1 ProKazanan
Python ISO-8601 süre ayrıştırıcısı (8 test vakası)8/8, 3,7 sn.8/8, 38,2 sn.Doğrulukta beraberlik
Dağınık bir e-postadan katı JSON çıkarmaAlanlar doğru, Markdown kod bloğuna sarılmış, 1,0 sn.Doğru, yalın JSON, 9,8 sn.Pro
Yüzde mantık tuzağı (yanıt: 50)Doğru, 1,8 sn.Doğru, 10,6 sn.Beraberlik
İçine 3 hata yerleştirilmiş kod incelemesi3 hatanın 2'sini ve yerleştirilmemiş bir sorunu buldu, 3,7 sn.3 hatanın 2'sini ve yerleştirilmemiş bir sorunu buldu, 30,2 sn.Beraberlik
Dört aynı istemde Gemini 3.5 Flash-Lite ve Gemini 3.1 Pro gecikme karşılaştırması

İki model de eksiksiz doğru bir süre ayrıştırıcısı üretti. Kod incelemesinde ikisi de SQL injection'ı, değiştirilebilir varsayılan argüman önbelleğini ve verimsiz filtrelemeyi yakaladı. Ayrıca ikisi de bilerek yerleştirdiğim aynı naive-datetime zaman dilimi hatasını kaçırdı. Bu dört günlük görevde doğrulukları aynıydı.

İki önemli not var. Bu çalışma, aşağıdaki 30 çağrılık denemeyle birlikte bir nokta ölçümü; kapsamlı bir benchmark paketi değil. Ayrıca Pro'ya yapılan çağrılardan biri, zararsız kod inceleme istemine hatalı bir ret yanıtı verdi ve yeniden denemek gerekti. Bunun modelden değil aktarma katmanındaki gürültüden kaynaklanmış olması mümkün, ancak her durumda yeniden deneme payı bırakmak gerek.

Flash-Lite'ın sınırı nerede?

Biçim kurallarındaki küçük ama kritik aksama

Çıkarma isteminde "YALNIZCA JSON nesnesini döndür" yazıyordu. Pro yalın JSON döndürdü. Flash-Lite ise doğru veriyi ``json kod bloğuna sararak verdi; bu da aşağı akıştaki json.loads()` çağrısının, ayıklama adımı eklenene kadar çökmesi anlamına geliyor.

Tek bir hata rastlantı olabilir diye bunu ayrıca ölçtüm: 10 farklı destek e-postasında, model başına 30 çıkarma çağrısı yaptım; yalın JSON uyumluluğunu ve şema geçerliliğini programatik olarak puanladım. Flash-Lite 30 çağrının 29'unu, yani %96,7'sini geçti; yalnızca bir yanıt kod bloğuna sarılmıştı. 3.1 Pro ise 30'da 30 yaptı. Tek başarısızlıktaki sorun içerik doğruluğu değildi: alanlar doğruydu, paketleme yanlıştı.

Biçim disiplininin, Google'ın bu model için öne çıkardığı kullanım alanlarından biri olması dikkat çekici. Resmî Flash-Lite sayfası, modeli "düşük gecikmeli ve yüksek verimli agentic görevler için en iyi" seçenek olarak konumlandırıyor. %3,3'lük hata oranı kabul edilebilir görünebilir; fakat bunu zincirleme etkisiyle düşünmek gerek: iş başına modele 20 kez çağrı yapan bir agent döngüsünde, tüm çalıştırmaların yaklaşık yarısında en az bir hatalı yanıt görülür (1 − 0.967²⁰ ≈ 0.49). Yapılandırılmış çıktı işlerini Flash-Lite'a yönlendirecekseniz, doğrulayıcı ve tek yeniden deneme kullanın. %3,3 başarısızlık oranında bir yeniden deneme, çağrı başına kalan riski yaklaşık %0,1'e indiriyor; benim çalıştırmalarımda her hata içerikte değil, paketlemedeydi.

Pro'nun hâlâ üstün olduğu alanlar

Yukarıdaki dört görev Flash-Lite'ın rahat çalıştığı türden: kısa bağlam, net tanım ve tek seferlik yanıt. Çıkışından sonraki haftada topluluktan gelen raporlar sınırı oldukça tutarlı çiziyor. Uzun belgelerle çalışan r/GeminiAI kullanıcıları, daha küçük Gemini modellerinin dağıldığı durumlarda Pro'nun karakter ve olay örgüsü tutarlılığını koruduğunu bildiriyor. Bağımsız endeks verileri de aynı yönde: Artificial Analysis, Intelligence Index'te 3.1 Pro'ya 46, Flash-Lite'a ise 36 puan veriyor. Fark, kodlama ya da çıkarma yerine çok adımlı muhakeme değerlendirmelerinde yoğunlaşıyor. Aynı takipçi, izlediği 152 model arasında Flash-Lite'ı çıktı hızı bakımından 2., zekâ bakımından ise 13. sıraya koyuyor. Bu profil, genel amaçlı ikameden çok uzmanlaşmış bir modeli işaret ediyor.

Gemini 3.5 Flash-Lite için Intelligence Index 36, saniyede 426,8 çıktı token'ı ve milyon token başına $0.30 ile $2.50 fiyatını gösteren Artificial Analysis puan kartı

Daha zor görevimde kendi gözlemim de bu tavana işaret etti: zaman dilimi hatasını iki model de bulamadı. Flash-Lite'ın Pro ile aynı sonucu vermesi, Flash-Lite'ın Pro olduğu anlamına gelmiyor. İkisinin de kör noktaları olduğu anlamına geliyor; Pro'nun marjinal olarak daha derin muhakemesi için 25 kat ödeme yapmanın riskini de siz üstleniyorsunuz.

Pratik ayrım şu: modelin görev ortasında planı yeniden kurması, 50k+ kelime boyunca tutarlılığı koruması veya hata maliyeti yüksek yargı kararları vermesi gereken işler hâlâ Pro'yu haklı çıkarıyor. Şablon gibi tekrarlanan görevler ise çıkarmıyor.

Asıl maliyet farkı: 4,8 değil 25 kat

Fiyat sayfalarına bakıldığında Pro'nun çıktı maliyeti Flash-Lite'tan 4,8 kat yüksek görünüyor: milyon token başına $12'ye karşı $2.50. Dört görevde ölçtüğüm gerçek harcama ise Flash-Lite için yaklaşık $0.005, Pro için $0.13; yani 25 kat fark oldu. Lite toplamda kabaca 570 girdi ve 2.020 çıktı token'ı faturalandırırken Pro, liste fiyatlarından 1.700 girdi ve 10.386 çıktı token'ına ulaştı.

Çarpanı yaratan şey düşünme token'ları. Gemini 3.1 Pro yanıt vermeden önce muhakeme yürütüyor ve Google bu muhakemeyi çıktı olarak faturalandırıyor. Ayrıştırıcı görevinde Pro 5.125 çıktı token'ı üretti; bunların 4.811'i, yani %94'ü düşünme token'ıydı. Flash-Lite ise aynı isteme toplam 819 token'la yanıt verdi. Dört görevin tamamında, Pro'nun bana faturalandırdığı her şeyin %84'ünü düşünme oluşturdu.

Gemini 3.1 Pro'nun düşünme token'ı yükünü gösteren, görev başına faturalandırılan çıktı token'ları

30 çağrılık çıkarma denemesi farkı daraltmak yerine açtı; çünkü kısa çıktılar düşünme ek yükü oranını en üst düzeye çıkarıyor. Flash-Lite 30 çağrının tamamını 1.899 çıktı token'ı ve toplam yaklaşık $0.006 ile tamamladı. Pro ise 29.468 çıktı token'ı faturalandırdı; bunun 27.636'sı, yani %94'ü düşünmeydi. Toplam maliyet yaklaşık $0.38, bu iş yükünde 65 kat fark etti. Bunu ayda bir milyon çıkarma çağrısına ölçeklediğinizde, $190'lık bir kalemle $12.500'lük bir kalem arasındaki fark ortaya çıkıyor.

Bu, küçük örneklemime özgü bir durum değil. Tessl kodlama benchmark'ını geliştiren ekip, yaklaşık 3.300 coding-agent görevini çalıştırdı ve daha yüksek liste fiyatına rağmen Gemini 3.1 Pro'nun, yoğun muhakeme kullanan Gemini 3.5 Flash'tan daha ucuza geldiğini buldu. Mekanizma aynı, sonuç ters yönde. Artificial Analysis'ın çalıştırma maliyeti endeksi de bu tersine dönüşü gösteriyor. Buradan çıkarılacak kural şu: modelleri token fiyat listesine göre değil, tamamlanan görev başına ölçülmüş maliyetle karşılaştırın.

23 Temmuz 2026 itibarıyla teknik özellikler ve fiyatlar

Google'ın resmî Gemini API fiyatlandırma sayfasından alınan veriler:

Gemini 3.5 Flash-LiteGemini 3.1 Pro (≤200k bağlam)
1M token başına girdi$0.30$2.00 (200k üzerinde $4.00)
1M token başına çıktı (düşünme dahil)$2.50$12.00 (200k üzerinde $18.00)
Batch katmanı$0.15 / $1.25$1.00 / $6.00
Bağlam önbelleğe alma$0.03$0.20
Bağlam penceresi1M girdi / 64k çıktı1M girdi / 32k çıktı
Çıktı hızı (Artificial Analysis)426.8 tok/sn.112.2 tok/sn.
DurumGA, gemini-3.5-flash-litePreview, gemini-3.1-pro-preview
Temmuz 2026 tarihli Gemini 3.5 Flash-Lite resmî Gemini API fiyatlandırma tablosu

Burada iki ayrıntının altını çizmek gerek. Flash-Lite, selefine göre bir fiyat *artışı* aldı: 3.1 Flash-Lite $0.25/$1.50 fiyatındaydı; dolayısıyla çıktı tarafında artış %67. Google'ın gerekçesi yetenek artışı. DeepMind model sayfasında yayımlanan rakamlar, 3.5 Flash-Lite'ın 3.1 Flash-Lite'a kıyasla SWE-Bench Pro'da %38,3'ten %54,2'ye, Terminal-bench 2.1'de ise %31'den %54'e çıktığını gösteriyor. Çıktı limitlerindeki asimetri de önemli: Flash-Lite 64k çıktı token'ına izin veriyor, Pro ise 32k ile sınırlı. Bu nedenle çok uzun tek seferlik üretimler, ilk bakışta ters görünse de ucuz modelin alanı.

İlk kullanıcıların görüşleri

Doğrulama sırasında model henüz iki günlük olduğu için tartışma hacmi sınırlıydı. Buna rağmen X'teki ilk üretim raporları üç gruba ayrılıyor:

  • Fiyat eleştirileri: "Why is 3.5 flash lite 50% more expensive. It is so sneaky," diye @samarthg1911 23 Temmuz'da yazdı. Fiyat artışı en sık dile getirilen şikâyet.
  • Pipeline kazanımları: ML mühendisi @mrdbourke, modeli "very fast and excellent at vision" olarak tanımladı ve bazı pipeline'larında, çıktı fiyatı bunun 3,6 katı olan Gemini 3.5 Flash'ın yerini aldığını söyledi. İçerik araçları çalıştıran başka bir ekip de modelin, internet argosunu ayrıştırmada 3.1 Flash-Lite'a göre "significant step up" olduğunu belirtti.
  • Gerileme bildirimleri: Bir mühendisin dahili değerlendirmeleri tam tersine ulaştı: "3.5 flash lite is a real downgrade." Ekip 3.1 Flash-Lite'ta kalmayı seçti.

Birbiriyle çelişen ilk incelemeler genellikle modelin gücünün iş yüküne bağlı olduğunu gösterir. Verilerim de bunu destekliyor: kendi kulvarında çok başarılı, sınırlarında ise sessizce özensizleşebiliyor.

Hangi görevi hangi modele yönlendirmeli?

Gemini 3.5 Flash-Lite ile Gemini 3.1 Pro arasında seçim yapmak, tek bir modeli tercih etmek zorunda olduğunuz anlamına gelmiyor. Ölçülen sonuçlar ve topluluktaki hata raporlarına göre benim kullanacağım dağılım şöyle olurdu:

Flash-Lite'a yönlendirin ($0.30/$2.50):

  • Yapılandırılmış veri çıkarma, sınıflandırma ve etiketleme; JSON doğrulayıcı ve tek yeniden denemeyle
  • Şablon düzeyinde kod üretimi: ayrıştırıcılar, dönüştürücüler, CRUD iskeletleri
  • Yüksek frekanslı agent adımları: tool-call biçimlendirme, özetleyip aktarma, yönlendirme kararları
  • İlk kullanıcı övgülerinin en yoğun olduğu, görsel ağırlıklı yüksek hacimli işlemler
  • 3.1 Flash-Lite kullanacağınız her şey; aynı katman artık SWE-Bench Pro'da 16 puan daha yüksek skor alıyor

3.1 Pro'da tutun ($2/$12):

  • On binlerce kelime boyunca tutarlılığın çıktının kendisi olduğu uzun belge işleri; bu topluluk bildirimi, burada test edilmedi
  • Bir tool call beklenmeyen sonuç döndürdüğünde planını yeniden kurması gereken agent görevleri
  • Tek bir yanlış yanıtın maliyetinin, aylık fiyat farkından yüksek olduğu yargı kararları
  • 200k bağlamın üzerindeki işler; burada iki katına çıkan $4/$18 fiyatını hesaba katarak

Tek model seçmekten daha iyi çalışan yaklaşım şu: varsayılan olarak Flash-Lite'a yönlendirin ve somut tetikleyicilerde Pro'ya yükseltin. Örneğin bir yeniden denemeden sonra şema doğrulamasının hâlâ başarısız olması, tool call'ın hata ya da beklenmeyen bir biçim döndürmesi, girdinin sizin rahat bağlam sınırınızı aşması veya görevin baştan yüksek riskli olarak etiketlenmesi bu tetikleyiciler olabilir. Ölçülen 25 katlık maliyet farkında, yükseltme oranını yaklaşık %15 civarında tutmak, her şeyi Pro'da çalıştırmaya göre harcamayı yaklaşık %80 azaltır: Pro'nun 25 katına karşı Lite maliyetinin 4,6 katı (0.85 + 0.15 × 25).

İki model de nasıl çağrılır?

Flash-Lite, Gemini API, Google AI Studio ve Gemini uygulamasında gemini-3.5-flash-lite adıyla GA durumda. 3.1 Pro ise gemini-3.1-pro-preview adıyla preview aşamasında kalıyor. İki model de OpenAI uyumlu aktarma platformları üzerinden erişilebilir. AIReiter'ın Google model kataloğu, Gemini serisini diğer sağlayıcılarla birlikte listeliyor; yukarıdaki karşılaştırmayı iki ayrı SDK arasında geçiş yapmadan bu şekilde yaptım. Testi tekrarlarsanız, uç noktanızın her çağrı için bildirdiği düşünme token'ı sayısını kaydedin: OpenAI uyumlu rotalarda usage.completion_tokens_details.reasoning_tokens, yerel Gemini API'de ise thoughtsTokenCount. 25 katlık farkın saklandığı yer bu tek alan.

SSS

Gemini 3.5 Flash-Lite, Gemini 3.1 Pro'dan daha mı iyi?

Hayır. Dört görevlik nokta testimde Pro ile aynı sonucu verdi; kod üretimi, çıkarma, mantık ve kod inceleme görevlerinde 8 kat daha hızlı yanıtlayıp 25 kat daha az faturalandırdı. Ancak uzun bağlamda tutarlılık, dinamik yeniden planlama ve muhakeme derinliğinde Pro önde kalıyor. Artificial Analysis endeksinde skorlar 46'ya karşı 36.

Gemini Flash mı, Flash-Lite mı daha iyi?

Flash ($1.50/$9.00) bir muhakeme modeli ve agentic benchmark'larda daha yüksek skor alıyor. Flash-Lite ($0.30/$2.50) ayarlanabilir düşünme seviyelerini destekliyor; ancak benim 34 çağrımın tamamında sıfır düşünme token'ı kullandı, bu yüzden yaklaşık bir saniyede yanıt veriyor. Yüksek hacimli çıkarma, sınıflandırma ve görsel pipeline'larında Flash-Lite'ın 5-6 katlık fiyat avantajı genellikle ağır basar. Çok adımlı agent muhakemesinde ise Flash için ödeme yapın.

Gemini 3.5 Flash-Lite neden pahalandı?

Google, büyük yayımlanmış yetenek artışlarıyla birlikte katmanın 3.1 Flash-Lite fiyatını $0.25/$1.50'den $0.30/$2.50'ye çıkardı; çıktı tarafındaki artış %67. SWE-Bench Pro %38,3'ten %54,2'ye, Terminal-bench ise %31'den %54'e yükseldi. Daha az deneme gerektiren bir model için token başına daha fazla ödeme yapıyorsunuz.

Gemini 3.5 Pro var mı?

23 Temmuz 2026 itibarıyla yok. 3.5 neslinde Flash-Lite, Flash ve Live Translate katmanları ile daha yeni 3.6 Flash bulunuyor. Pro serisinin en güncel sürümü hâlâ preview aşamasındaki 3.1 Pro.

İlgili yazılar