Was sich in DeepSeek V4.1 Flash geändert hat
V4.1 Flash ist eine neue Modellfamilie, kein Re-Tuning von V4 Flash. DeepSeek hat die Architektur von Grund auf neu entwickelt und mit 45 Billionen multimodalen Tokens trainiert. Damit übertrifft die Flash-Stufe nun V4 Pro in den meisten Agenten-Benchmarks.
Kausales Encoder-Decoder-MoE
Ein 552B Mixture-of-Experts, aufgeteilt in einen 20-Layer-Encoder und einen 20-Layer-Decoder. Beim Lesen Ihres Prompts sind nur 8B Parameter aktiv und 16B beim Generieren der Antwort – deshalb bleibt ein Modell dieser Größe in der günstigen Flash-Preiskategorie.
Agentic Coding über V4-Pro-Niveau
DeepSeek berichtet von 90,6 bei Terminal-Bench 2.1 im Vergleich zu 82,7 bei V4 Flash und 87,9 bei V4 Pro, 74,2 bei DeepSWE im Vergleich zu 54,4 und 62,7 sowie einem Codeforces-Score von 3471. Auf Terminal-Bench 3.0 liegt der Sprung bei 7,6 auf 30,0.
Vision direkt mittrainiert, nicht nachträglich aufgesetzt
Ein neuer DeepSeek-ViT-Encoder wurde von Beginn des Pre-Trainings an gemeinsam mit dem Textmodell trainiert. V4 Flash war rein textbasiert und seine Vision-Variante experimentell. Screenshots, Diagramme und Fotos werden nun in derselben Anfrage wie der Prompt übergeben.
Ein Viertel des KV-Cache-Bedarfs für 1M Kontext
Compressed Sparse Attention und FP4-KV-Speicherung reduzieren den globalen Cache auf etwa 890 Bytes pro Token – rund ein Viertel von V4 Flash. Genau das ermöglicht ein 1M-Token-Kontextfenster zu Flash-Kosten und mit 214 Tokens pro Sekunde in unabhängigen Tests.
DeepSeek V4.1 Flash vs. V4 Flash
Bei DeepSeek erfolgte die Migration bereits automatisch: Die offizielle ID lautet nun deepseek-flash, und Anfragen mit deepseek-v4-flash werden von V4.1 beantwortet. Auf AIReiter bleiben beide separate Modelle, sodass Sie jedes gezielt festlegen können.
Weniger aktive Parameter, höhere Scores
V4 Flash aktiviert 13B Parameter bei jedem Token. V4.1 Flash aktiviert 8B beim Prefill und 16B beim Decode – und übertrifft es dennoch in jedem von DeepSeek veröffentlichten Agenten-Benchmark. Die geringere Prefill-Zahl ist keineswegs ein Downgrade.
Thinking ist jetzt immer aktiv
V4 Flash bot diskrete Thinking-Modi. V4.1 Flash nutzt kontinuierlichen Reasoning Effort mit dem Standardwert „high“. Auf dieser Route liefert selbst eine Anfrage mit deaktiviertem Thinking weiterhin Reasoning-Tokens; planen Sie max_tokens entsprechend ein.
Bildeingabe ist Teil des Basismodells
Falls Sie Screenshots bisher an einen separaten Vision-Endpunkt neben V4 Flash weitergeleitet haben: V4.1 Flash verarbeitet beides in einem Aufruf. Senden Sie Bilder als Base64-Data-URIs im standardmäßigen Content-Array; diese Route ruft keine externen Bild-URLs ab.
Listenpreis für Output verdoppelt, Cache unverändert
Der offizielle Output-Preis stieg von 0,28 $ auf 0,60 $ pro Million Tokens. Cache-Hit-Input bleibt bei etwa 0,003 $. Workloads mit langem, stabilem Präfix und kurzen Antworten kosten ungefähr so viel wie zuvor; textintensive Generierungen kosten mehr.
Wann Sie bei V4 Flash bleiben sollten
Eine fest definierte Evaluation-Suite, ein Client, der reasoning_content in Tool-Loops nicht verarbeiten kann, oder ein striktes Token-Budget für den Output sprechen gegen eine Umstellung. Andernfalls sollten Sie neue Projekte direkt auf V4.1 Flash starten.
DeepSeek V4.1 Flash API-Preise
Ein einheitlicher Tarif, rund um die Uhr
Die drei Token-Positionen werden jeweils mit etwa drei Vierteln des DeepSeek-Off-Peak-Tarifs abgerechnet. Auf dieser Route gibt es kein Spitzenzeitenfenster; ein Job während der Pekinger Bürozeiten kostet also genauso viel wie nachts. Die aktuellen Preise finden Sie oberhalb des Playgrounds.
Wo die Ersparnis wirklich spürbar wird
Gegenüber dem offiziellen Spitzenzeittarif liegt der AIReiter-Preis bei ca. 38 %. Gegenüber Off-Peak bei ca. 75 %. Wenn Ihr Datenverkehr hauptsächlich tagsüber in Europa oder den USA anfällt – also während der DeepSeek-Spitzenzeit –, ist der Preisunterschied noch größer als die Schlagzeile vermuten lässt.
Reasoning-Tokens werden als Output abgerechnet
Thinking kann auf dieser Route nicht deaktiviert werden, und V4.1 Flash ist bei hoher Reasoning-Stufe sehr ausführlich. Unabhängige Tests verzeichneten bei denselben Aufgaben etwa doppelt so viele Output-Tokens wie vergleichbare Modelle. Setzen Sie max_tokens für Reasoning plus Antwort an.
Cache-Hits sind der günstigste Posten
Ein Cache-Hit-Input-Token kostet etwa 2 % eines Cache-Miss-Tokens. Bei Agent-Schleifen, die bei jedem Durchlauf denselben System-Prompt und dasselbe Tool-Schema erneut senden, dominieren Cache-Lesevorgänge die Rechnung und machen V4.1 Flash besonders günstig.
Wann DeepSeek V4.1 Flash eingesetzt werden sollte – und wann nicht
Nutzung für Coding- und Terminal-Agents
Bei Multi-File-Edits, Test-Fix-Schleifen, CI-Log-Triage und Computer-Use-Aufgaben sind die publizierten Zuwächse gegenüber V4 Flash und V4 Pro am größten. Lange Tool-Traces passen ohne Chunking in das 1M-Fenster.
Nutzung für Screenshots und Diagramme
OCR aus einem UI-Screenshot, das Auslesen eines Diagramms oder die Prüfung einer gerenderten Seite können direkt in derselben Anfrage wie die Code-Frage übermittelt werden. Kein zweites Modell, keine zweite Rechnung.
V4 Pro nur für Kompatibilität verwenden
DeepSeek hat V4 Pro nach dem Release von V4.1 Flash weiter betrieben, weil Kunden danach gefragt haben – nicht, weil es besser abschneidet. Bleiben Sie bei Pro, wenn ein Vertrag oder eine fixierte Evaluation dies erfordert.
Nicht als Enzyklopädie verwenden
Das Basismodell liegt bei SimpleQA-Verified rund 13 Punkte hinter V4 Pro. Für die Faktenabfrage ohne Retrieval sollten Sie das Modell mit eigenen Dokumenten fundieren oder ein für Recall optimiertes Modell wählen.
Preisvergleich mit GLM-5.3 Flash
GLM-5.3 Flash ist das andere multimodale Flash-Modell auf AIReiter und ist beim Output günstiger gelistet. Wählen Sie V4.1 Flash, wenn es sich um eine Agent-Schleife oder Repository-Arbeiten handelt; wählen Sie GLM-5.3 Flash für umfangreiche Extraktionen und Klassifizierungen.
Die DeepSeek V4.1 Flash API aufrufen
Der Playground auf dieser Seite und die API teilen sich dieselbe Modell-ID. Die einzige Integrationsregel, die bei Clients zu Fehlern führt, ist die Handhabung von Reasoning innerhalb von Tool-Schleifen.
Echte Agent-Aufgabe im Playground testen
Fügen Sie ein fehlerhaftes Log mit dem Diff und einer Frage ein. Beobachten Sie die Output-Tokens (einschließlich Reasoning) und prüfen Sie die Antwortqualität, bevor Sie es fest integrieren. Bildeingabe ist über die API verfügbar.
POST /api/v1/chat/completions
Verwenden Sie das Modell "deepseek-v4-1-flash", einen AIReiter API-Key und den standardmäßigen Chat-Completions-Body. Streaming wird unterstützt. Dieselbe ID wird auch unter /api/v1/messages akzeptiert, falls Ihr Stack Anthropic Messages verwendet.
reasoning_content bei Verwendung von Tools zurücksenden (Round-Trip)
Sobald die Anfrage ein tools-Array enthält, muss jeder vorherige Assistant-Turn seinen reasoning_content zurückführen – auch Turns, die keinen Tool-Call ausgeführt haben. Wird dieser weggelassen, wird HTTP 400 zurückgegeben. Diese Regel hat bei V4 mehrere Agent-Frameworks beeinträchtigt und gilt nach wie vor.
Bilder im content-Array anhängen (API)
Verwenden Sie einen image_url-Part mit einer Base64-Data-URI. PNG, JPEG, GIF und WebP werden akzeptiert. Remote-Bild-URLs werden auf dieser Route nicht abgerufen; binden Sie die Bytes daher inline ein. Platzieren Sie den Textteil an erster Stelle, wenn das Bild lediglich Kontext für eine Frage ist und nicht deren eigentlicher Gegenstand.
Fragen zur DeepSeek V4.1 Flash API
Modell-ID, Preise, die Migration von V4 Flash, Bildeingabe und die Reasoning-Regel, die Fehler verursacht.
/ 01Wie lautet die API-Modell-ID für DeepSeek V4.1 Flash?
Verwenden Sie auf AIReiter deepseek-v4-1-flash. Der interne Key lautet chat-deepseek-v4-1-flash. Direkt bei DeepSeek ist die offizielle ID deepseek-flash, und die ältere ID deepseek-v4-flash wird nun ebenfalls von V4.1 Flash bedient.
/ 02Wie gestalten sich die Preise für DeepSeek V4.1 Flash?
DeepSeek führt 0,15 $ Input, 0,60 $ Output und 0,003 $ Cache-Hit-Input pro Million Tokens in den Nebenzeiten auf, wobei sich alle drei Preise zu Spitzenzeiten an Wochentagen verdoppeln. AIReiter berechnet zu jeder Zeit einen einheitlichen Pauschaltarif, der etwa 25 % unter dem Nebenzeit- und 62 % unter dem Spitzenzeittarif liegt. Die aktuellen Routenpreise werden über dem Playground angezeigt.
/ 03Ist V4.1 Flash besser als V4 Pro?
Bei den von DeepSeek veröffentlichten Agent- und Coding-Benchmarks ja: Terminal-Bench 2.1 liegt bei 90,6 gegenüber 87,9 und DeepSWE bei 74,2 gegenüber 62,7. V4 Pro führt weiterhin bei GPQA Diamond und beim Knowledge Recall. DeepSeek selbst leitet neue Nutzer mittlerweile zu Flash weiter.
/ 04Was ist der Unterschied zu V4 Flash?
Eine neue Encoder-Decoder-Architektur mit 8B bis 16B aktiven Parametern statt 13B, native Bildeingabe, Always-on-Reasoning, ein KV-Cache in Viertelgröße für das 1M-Fenster und deutliche Zuwächse bei jedem Agent-Benchmark. Der offizielle Listenpreis für den Output stieg zudem von 0,28 $ auf 0,60 $.
/ 05Kann ich das Thinking deaktivieren?
Nicht auf dieser Route. Anfragen, bei denen Thinking deaktiviert ist, geben dennoch reasoning_content zurück, und reasoning_effort wird nicht weitergeleitet. Steuern Sie die Kosten stattdessen über max_tokens und einen präzisen Prompt.
/ 06Werden Bilder akzeptiert?
Ja, über die API. Vision ist in V4.1 Flash nativ integriert und wurde auf dieser Route verifiziert. Senden Sie PNG, JPEG, GIF oder WebP als Base64-Data-URI in einem image_url-Part; Remote-URLs werden nicht abgerufen. Der Playground auf dieser Seite ist derzeit nur für Text ausgelegt.
/ 07Warum erhält meine Tool-Calling-Schleife einen HTTP 400?
Sie haben reasoning_content aus einer früheren Assistant-Nachricht ausgelassen. Wenn ein tools-Array vorhanden ist, verlangt DeepSeek das Reasoning-Feld in jedem vorherigen Assistant-Turn – selbst in Turns ohne Tool-Call. Speichern Sie es und senden Sie es unverändert zurück.
/ 08Welche Limits gelten für Kontext und Output?
DeepSeek dokumentiert ein Kontextfenster von 1M Token und maximal 384K Output-Token. Der Playground ist standardmäßig auf 8192 Output-Token eingestellt; erhöhen Sie diesen Wert für längere Agent-Ausführungen und beachten Sie, dass Reasoning-Token darauf angerechnet werden.
/ 09Welchen Endpunkt sollte ich aufrufen?
POST https://aireiter.com/api/v1/chat/completions ist der primäre Endpunkt für dieses Modell. POST https://aireiter.com/api/v1/messages funktioniert mit derselben ID ebenfalls für Clients im Anthropic-Stil.
/ 10Kann ich es vor der Integration ausprobieren?
Ja. Der Playground auf dieser Seite nutzt dieselbe Modell-ID und Route wie die API. Die hier sichtbare Token-Anzahl und das Verhalten entsprechen also genau dem, was die API zurückgibt.