Gemini 3.5 Flash vs Gemini 3.1 Pro: Tam Karşılaştırma

Son Güncelleme: 2026-07-15 02:21:15

Gemini 3.5 Flash, Gemini 3.1 Pro’ya göre saniye başına 2.6 kat daha fazla çıktı token’ı üretir, token başına %25 daha ucuza mal olur ve Artificial Analysis’in Intelligence Index’inde Pro’yu az farkla geride bırakır (50’ye karşı 46). Gemini 3.1 Pro, ARC-AGI-2’de hâlâ 5 puan öndedir (77.1%’e karşı 72.1%), ayrıca 128k token sınırını aştığınızda Flash’in uzun bağlamlı geri getirme puanı %84.9’dan %77.3’e düşer. Hangi modelin kullanılacağı göreve bağlıdır: Flash, iş hacmi ve araç çağırma gecikmesi için optimize edilmiştir; Pro, çok adımlı akıl yürütme derinliği için optimize edilmiştir; toplu karşılaştırmalar ise bu iki önceliği tek bir puanda birleştirir ve iş yükünüzün gerçekte hangisine ihtiyaç duyduğunu gizler.

Benchmark skor kartı: her modelin gerçekten öne çıktığı yer

Gemini 3.5 Flash vs Gemini 3.1 Pro benchmark comparison chart
MetrikGemini 3.5 FlashGemini 3.1 ProKazanan
Intelligence Index (Artificial Analysis)5046Flash
ARC-AGI-2, soyut akıl yürütme (BenchLM)72.1%77.1%Pro
128k bağlamda MRCR v2 (nxcode)77.3% (daha kısa bağlamda %84.9'dan düşüş)aynı uzunlukta kamuya açık olarak rapor edilmediYetersiz veri
Çok modlu ortalama skor (BenchLM)83.882.6Flash
Çıkış hızı (BenchLM)284.2 tok/s109 tok/sFlash (2.6x)
GDPval-AA Elo, gerçek dünya ajan görevleri (apiyi)16561314Flash

Flash, verim ve genel amaçlı görev işleme ölçen metriklerde öne çıkıyor. Pro, ARC-AGI-2 muhakeme derinliğinde açık ve belgelenmiş bir üstünlüğe sahip; uzun bağlamlı geri getirmede, Flash’in 128k token sonrasında belgelenmiş bir gerilemesi var, ancak Pro’nun eşdeğer skoru herkese açık değil, bu nedenle bunu Pro için bir zafer yerine sonuçsuz olarak değerlendirin. Bu ayrım, tek bir toplu Intelligence Index sayısından daha kullanışlı olan, tam olarak hangi tür görevi çalıştırdığınıza karşılık geliyor.

BenchLM'nin kendi karşılaştırmasından bir metodoloji uyarısı: her iki modelin de yayınlanmış sonuçlarının bulunduğu yaklaşık 34 benchmark içinde, yalnızca 3 kategori doğrudan karşılaştırılabilir — Pro'nun 14 benchmarkta, Flash'ın 17 benchmarkta münhasır sonuçları var ve thinking-budget ayarları her zaman ikisi arasında eşleştirilmiş değil. Yukarıdaki tabloyu yönelim açısından güvenilir kabul edin; ARC-AGI-2 ve MRCR v2 farkları güvenilecek kadar büyük, ancak ortak bir metriktaki 1-2 puanlık farkı belirleyici olarak okumamak gerekir.

Flash'in liderliğinin zayıfladığı yer

ARC-AGI-2 farkı (5 puan), BenchLM'nin karşılaştırmasında iki model arasında bulunan en büyük tek kategori farkıdır. ARC-AGI-2, özellikle örüntü eşleştirme kestirmelerine direnmek için tasarlanmıştır; bu nedenle oradaki 5 puanlık fark, daha geleneksel bir ölçütteki benzer bir farka kıyasla akıl yürütme derinliği hakkında daha güçlü bir işarettir. nxcode'un MRCR v2 sonucu aynı yönde ikinci bir veri noktası ekliyor: bağlam 128k token'a doğru büyüdükçe Flash'ın kendi geri getirme doğruluğu %84,9'dan %77,3'e düşüyor. Pro'nun aynı uzunluktaki puanı kamuya açık olarak raporlanmadığından, bu Pro için belgelenmiş bir bire bir kayıp değildir — ancak Flash için belgelenmiş bir gerilemedir ve Pro'nun benchmark tablosunda bu görünmüyor.

Anekdot niteliğinde not, benchmark kanıtı değil: Kullanıcılara zor görevler için hangi modeli tercih ettiklerini soran bir Reddit r/GeminiAI başlığı, yorumcuların Flash’ın Pro’yu "uzun bağlam ve soyut [akıl yürütme] dışında her şeyde" geçtiğini söylemesine yol açtı. Bu, bir avuç görüşten ibaret, veri değil — ama tesadüfen benchmark’ların gösterdiği aynı iki istisnayı tarif ediyor; bu da kendi başına bir şeyin kanıtı olmaktan ziyade hafifçe yararlı bir tutarlılık kontrolü.

Fiyatlandırma ve önbellekleme: gerçek maliyet tablosu

Temel fiyatlandırma, ilk bakışta göründüğünden daha fazla fiyat avantajını daraltır:

  • Gemini 3.5 Flash: $1.50 / million giriş tokeni, $9 / million çıkış tokeni
  • Gemini 3.1 Pro: $2 / million giriş tokeni, $12 / million çıkış tokeni

Bu, kağıt üzerinde %25 indirim; Flash’ın daha önce eski Pro modellerine karşı sahip olduğu 4-8 katlık fark değil. Daha büyük kaldıraç ise önbelleklemedir:

  • Flash cache yazmaları ücretsizdir; önbelleğe alınmış girdi maliyeti 0,15$/milyon token'dır
  • Pro cache yazmaları 0,38$/milyon token tutar; önbelleğe alınmış girdi maliyeti 0,50$/milyon token'dır — Flash'ın önbelleğe alınmış girdi oranının 3 katından fazladır

Aynı system prompt’u veya belge bağlamını birden çok tur boyunca yeniden gönderen her türlü iş akışı için — chat agent’ları, kalıcı bir codebase bağlamına sahip coding assistant’lar, çok turlu support bot’ları — bu caching açığı hızla birikir. Tek bir request farkı neredeyse göstermez; bin turluk bir agent oturumu gösterir.

Fark da sabit değil. apiyi'nin fiyatlandırma dökümü, yaklaşık 200 bin tokenlık bağlamın ötesinde iki model arasındaki fiyat farkının %25-50’ye kadar sıkıştığını belirtiyor; çünkü bu ölçekte her iki modelin de token başına ekonomisi yakınsar. İş yükünüz kısa ve tekrarlayan çağrılar yerine büyük ölçüde çok uzun tek seferlik belgelere dayanıyorsa, Flash için fiyatlandırma argümanı zayıflar.

Somut bir örnek: günde 1M önbelleğe alınmış giriş tokenı gönderen ve 500K çıkış tokenı üreten bir destek-botu iş akışı. Flash’ta bu, önbellek yazımı için $0 artı $0.15 x 1 (önbelleğe alınmış giriş) + $9 x 0.5 (çıkış) = günde $4.65 eder. Pro’da aynı iş yükü $0.38 (önbellek yazımı, tek seferlik) + $0.50 x 1 (önbelleğe alınmış giriş) + $12 x 0.5 (çıkış) = ilk gün yaklaşık $6.88 tutar; ilk yazımdan sonra ise günde $6.50’ye oturur. Bir ayda bu, yaklaşık $140 ile $195 arasındaki fark demektir — Pro’nun gerçekten gerektiğinde sunduğu daha derin muhakemeyi hesaba katmadan önce.

Ajan döngüleri: Flash neden hızda kazanır, ancak her zaman güvenilirlikte değil

nxcode'un agent-loop benchmark'ı 8 adımlı bir agent loop çalıştırdı ve Flash'ın tüm diziyi yaklaşık 25 saniyede tamamladığını, Pro'nun ise 100 saniyesine karşılık kaydetti — bu, her ek adımla bileşik olarak büyüyen 4 katlık bir fark. Gerçek dünya knowledge-work agent görevleri etrafında oluşturulmuş bir benchmark olan GDPval-AA'da, Flash'ın Elo skoru (1656), Pro'nunkini (1314) 342 puanla geçiyor; bu, tüm benchmark tablosundaki tek en büyük fark.

Uyarı şudur: bu hız ve skor avantajı, agent döngüsünün sorunsuz çalıştığı varsayımına dayanır. Akıl yürütme ve uzun bağlam görevlerinde ortaya çıkan aynı ARC-AGI-2 ve MRCR v2 farkları, bir araç çağrısı döngünün ortasında beklenmedik bir şey döndürdüğünde ve agentın yeniden planlama yapması gerektiğinde Flash’in de daha az toleranslı olmasının makul bir gerekçesidir — bu, yukarıdaki akıl yürütme derinliği verilerinden çıkarılan bir sonuçtur, ayrı bir benchmark iddiası değildir. Eğer agentınız denetimli çalışıyorsa ve adımlar arasında bir insan çıktıyı kontrol ediyorsa, Flash’in hızı neredeyse bedava bir kazançtır. Eğer onlarca adım boyunca, döngüde insan olmadan denetimsiz çalışıyorsa, ikisi için de başarısızlık oranı verilerini biri yayımlayana kadar Pro’nun akıl yürütme marjı daha güvenli tercihtir.

Hangisini kullanmalısınız: göreve dayalı bir karar matrisi

Görev türüÖnerilen modelNeden
Günlük kodlama (testler, PR incelemesi, diller arası çeviri)FlashHız ve maliyet avantajı öne çıkar, muhakeme derinliği darboğaz değildir
Derin yeniden düzenlemeler, yeni algoritma tasarımıProARC-AGI-2 farkı çok adımlı mantıksal akıl yürütmede doğrudan ortaya çıkar
Uzun belge arama (sözleşmeler, 128k token ötesi araştırma korpusları)ProFlash'in bu uzunlukta belgelenmiş bir MRCR v2 gerilemesi var; Pro'nunki yayımlanmış değil ama daha güvenli varsayılan, bilinen zayıf noktası olmayan modeldir
Yüksek hacimli toplu üretimFlashÜcretsiz önbellek yazmaları ve 2.6x iş hacmi en çok ölçekte önemlidir
İnsan tarafından çıktısı kontrol edilen denetimli ajan iş akışlarıFlashDenetimsiz güvenilirlik riski olmadan hız avantajı
Denetimsiz, yüksek riskli ajan zincirleriProMuhakeme derinliği marjı, ara döngü hatalarını yakalayan bir insan olmadan daha güvenli tercihtir
Aynı bağlamı yeniden kullanan sık çok turlu çağrılarFlashÖnbelleğe alınmış girdi fiyatlandırması yaklaşık olarak Pro'nun üçte biridir

Yukarıdaki matrisin çoğunu basit bir varsayılan kural kapsar: üç koşuldan biri doğru değilse istekleri Flash'a gönderin — bağlam 128k token'ı aşıyorsa ve geri getirme doğruluğu önemliyse, görev soyut/çok adımlı akıl yürütmeyse (yeni algoritmalar, hukuki veya araştırma sentezi) ya da ajan bir avuç adımdan uzun süre denetimsiz çalışıyorsa. Bu üçünden herhangi biri tercihi Pro'ya kaydırır; hiçbiri yoksa, Flash'in hızı ve önbellek fiyatlandırması onu daha ucuz varsayılan yapar.

SSS

Gemini 3.5 Flash, 3.1 Pro'dan daha mı iyi?

Hız, maliyet ve genel amaçlı benchmark’larda evet. Soyut akıl yürütmede (ARC-AGI-2), Gemini 3.1 Pro hâlâ 5 puanla önde. 128k token’ın ötesindeki uzun bağlamlı geri getirmede, Flash için belgelenmiş bir gerileme var ve Pro’nun eşdeğer skoru yayımlanmadı; bu yüzden o karşılaştırmayı doğrulanmış bir Pro zaferi yerine çözümlenmemiş olarak değerlendirin. Hangisinin “daha iyi” olduğu, görevinizin bu kategorilerden hangisine girdiğine bağlıdır.

Gemini 3.5 Flash, 3.1 Pro’dan ne kadar daha ucuz?

Temel giriş/çıkış fiyatlandırmasında yaklaşık %25 daha ucuzdur ($1.50/$9, milyon token başına $2/$12 yerine). Daha büyük tasarruflar önbelleklemede ortaya çıkar: Flash’ın önbellek yazmaları ücretsizdir ve önbelleğe alınmış giriş, Pro’nun oranının yaklaşık üçte biri kadardır; bu da en çok çok turlu veya yüksek hacimli iş yükleri için önemlidir.

Gemini 3.5 Flash kodlama için iyi mi?

Evet, günlük işler için — test oluşturma, PR incelemesi, kodu diller arasında çevirme. Derin refaktörler veya yeni algoritma tasarımı için, Pro'nun soyut akıl yürütme benchmark'larındaki avantajı genellikle çıktı kalitesinde kendini gösterir.

Gemini 3.5 Flash uzun bağlamı iyi işler mi?

Daha kısa bağlam uzunluklarında, evet — MRCR v2 geri getirme doğruluğu %84,9 seviyesinde kalıyor. 128k token'ın ötesinde bu oran %77,3'e düşüyor; bu da çok belgeli sözleşme incelemesi gibi görevler için anlamlı bir fark. Gemini 3.1 Pro'nun aynı uzunluktaki skoru henüz yayımlanmadı, bu nedenle bunu doğrulanmış bir Pro avantajı yerine bilinen bir Flash sınırlaması olarak değerlendirin.

Özet

Gemini 3.5 Flash, çoğu günlük ve yüksek hacimli iş için daha iyi varsayılan seçenektir — daha hızlıdır, cache konusunda daha ekonomiktir ve genel benchmark’larda yeterince yakındır; bu yüzden ödün neredeyse hiç fark yaratmaz. Gemini 3.1 Pro, soyut akıl yürütme ve denetimsiz agent zincirlerinde daha yüksek maliyetini hak eder; 128k token’ı aşan uzun belgelerde ise Flash’in kendi verileri bir zayıf noktaya işaret eder, ancak Pro bunu doğrulamaz ya da çürütmez, bu yüzden herhangi birine karar vermeden önce bunu kendiniz test etmeye değer görmelisiniz.

Bu karşılaştırma, doğrudan API testiyle değil, kamuya açık benchmark verilerinden (Artificial Analysis, BenchLM, nxcode ve apiyi) oluşturulmuştur. Gemini 3.1 Pro, Flash’ın hız odağından farklı olarak akıl yürütme odaklı bir konumlandırmayla kullanıma sunuldu. Bu yazının kaleme alındığı tarihte Gemini 3.5 Pro henüz yayınlanmamıştı — haberler Temmuz 2026 çıkışını işaret ediyor — bu yüzden bunu, Pro’nun bir sonraki sürümü geldiğinde hem modellerin hem de bu karşılaştırmanın yeniden gözden geçirilmesi gerekecek bir anlık durum olarak değerlendirin.

İlgili okuma