DeepSeek V4.1 Flash'ta neler değişti?
V4.1 Flash, V4 Flash'ın yeniden ayarlanmış hali değil, yepyeni bir model ailesidir. DeepSeek mimariyi sıfırdan yeniden oluşturdu ve 45 trilyon çok modlu (multimodal) token üzerinde sıfırdan eğitti; Flash katmanı artık çoğu ajan kıyaslama testinde V4 Pro'yu geride bırakıyor.
Nedensel encoder-decoder MoE
20 katmanlı bir encoder ve 20 katmanlı bir decoder'a bölünmüş 552B parametreli bir uzmanlar karması (MoE). İsteminizi okurken yalnızca 8B parametre, yanıtı yazarken ise 16B parametre aktiftir; bu büyüklükteki bir modelin Flash fiyat aralığında kalmasının nedeni de budur.
V4 Pro'nun üzerinde ajanik kodlama
DeepSeek, Terminal-Bench 2.1'i V4 Flash için 82,7 ve V4 Pro için 87,9'a kıyasla 90,6; DeepSWE'yi 54,4 ve 62,7'ye kıyasla 74,2 ve Codeforces'ı 3471 olarak bildiriyor. Terminal-Bench 3.0'da ise sıçrama 7,6'dan 30,0'a çıkıyor.
Görüntü sonradan eklenmedi, yerel olarak eğitildi
Yeni bir DeepSeek-ViT encoder'ı, ilk ön eğitim adımından itibaren metin modeliyle birlikte eğitildi. V4 Flash yalnızca metin tabanlıydı ve görüntü varyantı deneysel bir çalışmaydı. Ekran görüntüleri, grafikler ve fotoğraflar istemle aynı istek içinde gönderilebilir.
1M bağlam için dörtte bir boyutunda KV önbelleği
Sıkıştırılmış seyrek dikkat (sparse attention) ve FP4 KV depolaması, genel önbelleği token başına yaklaşık 890 bayta düşürerek V4 Flash'ın yaklaşık dörtte birine indirir. 1M tokenlik bir pencerenin Flash maliyetinde ve bağımsız testlerde saniyede 214 token hızında çalışmasını sağlayan şey budur.
DeepSeek V4.1 Flash ile V4 Flash Karşılaştırması
DeepSeek tarafında geçiş sizin için zaten yapıldı: resmi kimlik artık deepseek-flash oldu ve hâlâ deepseek-v4-flash belirten istekler V4.1 tarafından sunuluyor. AIReiter'da ise bu ikisi ayrı modeller olarak kalır, böylece istediğinizi sabitleyebilirsiniz.
Daha az aktif parametre, daha yüksek skorlar
V4 Flash her tokende 13B parametreyi etkinleştirir. V4.1 Flash ise ön doldurmada (prefill) 8B ve kod çözmede (decode) 16B parametreyi etkinleştirir ve yine de DeepSeek'in yayınladığı tüm ajan kıyaslamalarında onu geçer. Daha küçük prefill sayısını bir gerileme olarak değerlendirmeyin.
Düşünme modu artık her zaman açık
V4 Flash ayrık düşünme modları sunuyordu. V4.1 Flash sürekli bir akıl yürütme çabası kullanır ve varsayılan olarak yüksek ayardadır. Bu rotada, düşünme modu devre dışı bırakılmış olarak gönderilen bir istek bile akıl yürütme döndürür; max_tokens bütçenizi buna göre belirleyin.
Görsel girişi temel modelin bir parçasıdır
Ekran görüntülerini V4 Flash'ın yanı sıra ayrı bir görüntü uç noktasına yönlendiriyorsanız, V4.1 Flash her ikisini de tek bir çağrıda halleder. Görselleri standart içerik dizisinde base64 data URI'leri olarak gönderin; bu rota uzak görsel URL'lerini çekmez.
Çıktı liste fiyatı iki katına çıktı, önbellek çıkmadı
Resmi çıktı fiyatı milyon token başına 0,28 dolardan 0,60 dolara yükseldi. Önbellek isabetli girdi fiyatı ise 0,003 dolar civarında kaldı. Uzun ve sabit bir ön eke ve kısa yanıtlara sahip iş yükleri eskisiyle neredeyse aynı maliyettedir; uzun yanıtlı üretimler ise daha maliyetlidir.
V4 Flash'ı şu durumlarda kullanmaya devam edin
Sabitlenmiş bir değerlendirme paketi, araç döngülerinde reasoning_content işleyemeyen bir istemci veya token başına katı bir çıktı bütçesi henüz geçişe hazır değilse. Aksi takdirde, yeni çalışmalarınıza V4.1 Flash ile başlayın.
DeepSeek V4.1 Flash API fiyatlandırması
Tüm gün tek ve sabit tarife
Üç token satırının her biri, DeepSeek yoğun olmayan saatler (off-peak) tarifesinin yaklaşık dörtte üçü oranında faturalandırılır. Bu rotada yoğun saat aralığı yoktur; bu nedenle Pekin mesai saatlerinde çalışan bir işlem, gece çalışan bir işlemle aynı ücreti öder. Canlı rakamlar oyun alanının (playground) üzerinde yer almaktadır.
Tasarrufun asıl fark yarattığı yer
Resmi yoğun saat tarifesine kıyasla AIReiter fiyatı yaklaşık %38'dir. Yoğun olmayan saatlere kıyasla ise yaklaşık %75'tir. Trafiğiniz çoğunlukla DeepSeek'in yoğun saatlerine denk gelen Avrupa veya ABD gündüz saatlerindeyse, fark başlıktakinden çok daha büyüktür.
Akıl yürütme token'ları çıktı olarak ücretlendirilir
Bu rotada düşünme modu kapatılamaz ve V4.1 Flash yüksek çaba seviyesinde oldukça ayrıntılı çıktılar verir. Bağımsız testler, aynı görev setinde karşılaştırılabilir modellerin yaklaşık iki katı çıktı tokeni kaydetti. max_tokens değerini akıl yürütme artı yanıtı kapsayacak şekilde ayarlayın.
Önbellek isabetleri en ucuz kalemdir
Önbellek isabeti (cache-hit) sağlayan bir girdi belirtecinin maliyeti, önbellek ıskalama (cache-miss) belirtecinin yaklaşık %2'sidir. Her adımda aynı sistem istemini ve araç şemasını yeniden gönderen aracı (agent) döngülerinde önbellek okumaları faturanın büyük kısmını oluşturur ve V4.1 Flash'ın en uygun maliyetli olduğu alan burasıdır.
DeepSeek V4.1 Flash ne zaman kullanılmalı — ve ne zaman kullanılmamalı
Kodlama ve terminal aracıları için kullanın
Çoklu dosya düzenlemeleri, test-düzeltme döngüleri, CI günlük triyajı ve bilgisayar kullanımı görevleri, V4 Flash ve V4 Pro'ya göre yayınlanan kazanımların en yüksek olduğu alanlardır. Uzun araç izleri (tool traces), parçalamaya gerek kalmadan 1M penceresine sığar.
Ekran görüntüleri ve grafikler için kullanın
Bir kullanıcı arayüzü görüntüsünden OCR yapma, bir grafiği okuma veya oluşturulmuş bir sayfayı denetleme işlemleri, kod sorusuyla doğrudan aynı istek içine dahil edilebilir. İkinci bir model yok, ikinci bir fatura yok.
V4 Pro'yu yalnızca uyumluluk için kullanın
DeepSeek, V4.1 Flash yayınlandıktan sonra V4 Pro'yu daha yüksek puan aldığı için değil, müşteriler talep ettiği için sunmaya devam etti. Bir sözleşme veya dondurulmuş bir değerlendirme (eval) gerektiriyorsa Pro'da kalın.
Ansiklopedi olarak kullanmayın
Temel model, SimpleQA-Verified testinde V4 Pro'nun yaklaşık 13 puan gerisinde kalmaktadır. Bilgi getirme (retrieval) olmadan olgu araması yapmak için modeli kendi belgelerinizle destekleyin veya bilgi çağırma (recall) için optimize edilmiş bir model seçin.
Fiyat açısından GLM-5.3 Flash ile karşılaştırın
GLM-5.3 Flash, AIReiter'daki diğer çok modlu (multimodal) flash modelidir ve çıktı tarafında daha uygun fiyatlıdır. Görev bir aracı döngüsü veya depo (repository) çalışması olduğunda V4.1 Flash'ı seçin; yüksek hacimli veri çıkarma ve sınıflandırma için GLM-5.3 Flash'ı tercih edin.
DeepSeek V4.1 Flash API'sini çağırın
Bu sayfadaki oyun alanı ve API aynı model kimliğini paylaşır. İstemcilerin bozulmasına neden olan tek entegrasyon kuralı, araç döngüleri içinde akıl yürütmenin (reasoning) nasıl işlendiğidir.
Oyun alanında (playground) gerçek bir aracı görevi gönderin
Farklar (diff) ve bir soruyla birlikte başarısız bir günlüğü yapıştırın. Akıl yürütmeyi de içeren çıktı belirteçlerini izleyin ve entegrasyonu tamamlamadan önce yanıt kalitesini doğrulayın. Görsel girdisi API üzerinden kullanılabilir.
POST /api/v1/chat/completions
Use model "deepseek-v4-1-flash", an AIReiter API key, and the standard Chat Completions body. Streaming works. The same id is also accepted on /api/v1/messages if your stack speaks Anthropic Messages.
Araçlar mevcut olduğunda reasoning_content değerini gidiş-dönüş iletin
İstek bir tools dizisi içerdiğinde, önceki her asistan adımının araç çağrısı yapmayan adımlar da dahil olmak üzere reasoning_content değerini geri taşıması gerekir. Bunu atlamak HTTP 400 hatası döndürür. Bu kural V4'te bazı aracı çerçevelerinin (framework) bozulmasına yol açmıştı ve halen geçerlidir.
Görselleri content dizisine ekleyin (API)
Base64 data URI içeren bir image_url parçası kullanın. PNG, JPEG, GIF ve WebP kabul edilir. Bu rotada uzak görsel URL'leri getirilmez, bu nedenle baytları satır içine (inline) yerleştirin. Görsel, sorunun konusundan ziyade bağlamı olduğunda metin kısmını başta tutun.
DeepSeek V4.1 Flash API soruları
Model id'si, fiyatlandırma, V4 Flash geçişi, görsel girdisi ve hata döndüren akıl yürütme kuralı.
/ 01DeepSeek V4.1 Flash API model kimliği nedir?
AIReiter'da deepseek-v4-1-flash kullanın. Dahili anahtar chat-deepseek-v4-1-flash'tır. Doğrudan DeepSeek üzerinde resmi kimlik deepseek-flash olup, eski deepseek-v4-flash kimliği de artık V4.1 Flash tarafından sunulmaktadır.
/ 02DeepSeek V4.1 Flash nasıl fiyatlandırılır?
DeepSeek, yoğun olmayan saatlerde milyon belirteç başına $0,15 girdi, $0,60 çıktı ve $0,003 önbellek isabeti girdisi listeler; hafta içi yoğun saatlerde bu üçü de iki katına çıkar. AIReiter, yoğun olmayan liste fiyatının yaklaşık %25, yoğun saat liste fiyatının ise %62 altında olmak üzere her saatte tek bir sabit tarife uygular. Güncel rota fiyatları oyun alanının üzerinde gösterilmektedir.
/ 03V4.1 Flash, V4 Pro'dan daha mı iyi?
DeepSeek'in yayımladığı ajan ve kodlama kıyaslama testlerine göre evet: Terminal-Bench 2.1'de 87.9'a karşı 90.6 ve DeepSWE'de 62.7'ye karşı 74.2. V4 Pro, GPQA Diamond'da ve bilgi hatırlamada hâlâ önde. DeepSeek'in kendisi de artık yeni kullanıcıları Flash'a yönlendiriyor.
/ 04V4 Flash'tan farkı nedir?
13B yerine 8B ila 16B aktif parametreye sahip yeni bir encoder-decoder mimarisi, yerel görsel girdisi, her zaman açık akıl yürütme (reasoning), 1M penceresi için dörtte bir boyutunda KV cache ve tüm ajan kıyaslama testlerinde büyük kazanımlar. Resmi çıktı liste fiyatı da $0.28'den $0.60'a yükseldi.
/ 05Düşünme özelliğini kapatabilir miyim?
Bu rotada hayır. Düşünme devre dışı bırakılarak gönderilen istekler yine de reasoning_content döndürür ve reasoning_effort iletilmez. Bunun yerine maliyeti max_tokens ve net bir prompt ile kontrol edin.
/ 06Görselleri kabul ediyor mu?
Evet, API üzerinden. Görme (Vision) yeteneği V4.1 Flash'ta yereldir ve bu rotada doğrulanmıştır. Bir image_url parçası içinde base64 data URI olarak PNG, JPEG, GIF veya WebP gönderin; uzak URL'ler getirilmez. Bu sayfadaki playground şimdilik yalnızca metin tabanlıdır.
/ 07Araç çağırma (tool-calling) döngüm neden HTTP 400 hatası alıyor?
Daha önceki bir asistan mesajından reasoning_content alanını çıkardınız. Bir tools dizisi mevcut olduğunda DeepSeek, araç çağrısı içermeyen turlar da dahil olmak üzere önceki her asistan turunda reasoning alanını zorunlu tutar. Bunu saklayın ve değiştirmeden geri gönderin.
/ 08Hangi bağlam ve çıktı sınırları geçerlidir?
DeepSeek, 1M tokenlik bir bağlam penceresi ve maksimum 384K çıktı belirtmektedir. Playground varsayılan olarak 8192 çıktı tokeni kullanır; uzun ajan çalıştırmaları için bunu artırın ve reasoning tokenlerinin de buna dahil olduğunu unutmayın.
/ 09Hangi endpoint'i çağırmalıyım?
POST https://aireiter.com/api/v1/chat/completions bu model için birincil sözleşmedir. POST https://aireiter.com/api/v1/messages da Anthropic tarzı istemciler için aynı id ile çalışır.
/ 10Entegre etmeden önce deneyebilir miyim?
Evet. Bu sayfadaki playground, API ile aynı model id'sini ve rotasını çalıştırır; bu nedenle burada gördüğünüz token sayıları ve davranışlar, API'nin döndürdükleriyle aynıdır.