AIREITER
DeepseekText Chat

DeepSeek V4.1 Flash

DeepSeek V4.1 Flash API unter DeepSeek-Listenpreis, ohne Spitzenzeiten-Aufschlag. 1M Kontext, native Bildeingabe, Spitzenwerte für Agentic Coding. Jetzt testen oder API aufrufen.

EingabeOffiziell $0.15 pro 1 Mio. TokensAIReiter $0.1127 pro 1 Mio. TokensAusgabeOffiziell $0.60 pro 1 Mio. TokensAIReiter $0.4507 pro 1 Mio. TokensCache-LesenOffiziell $0.003 pro 1 Mio. TokensAIReiter $0.0022 pro 1 Mio. Tokens
Mit API ausführen

EINGABE

AUSGABE

Example
Generated in
9.3 seconds
Eingabe-Token
184
Ausgabe-Token
1471
Tokens per second
158.17 tokens / second
Time to first token
-

Modelldetails

Verwenden Sie denselben Modellschlüssel im Playground, in API-Anfragen und in internen Workflows.

Modell-ID
deepseek-v4-1-flash
Anbieter
Deepseek
Protokoll
OpenAI Chat Completions · Anthropic Messages
Kontextfenster
1,000,000 Token
Maximale Ausgabe
384,000 Token
Eingabe-Token
11.27 Credits / 1 Mio. Token
Ausgabe-Token
45.07 Credits / 1 Mio. Token
Cache-Lesen
0.225 Credits / 1 Mio. Token
Cache-Schreiben
-

Was sich in DeepSeek V4.1 Flash geändert hat

V4.1 Flash ist eine neue Modellfamilie, kein Re-Tuning von V4 Flash. DeepSeek hat die Architektur von Grund auf neu entwickelt und mit 45 Billionen multimodalen Tokens trainiert. Damit übertrifft die Flash-Stufe nun V4 Pro in den meisten Agenten-Benchmarks.

Kausales Encoder-Decoder-MoE

Ein 552B Mixture-of-Experts, aufgeteilt in einen 20-Layer-Encoder und einen 20-Layer-Decoder. Beim Lesen Ihres Prompts sind nur 8B Parameter aktiv und 16B beim Generieren der Antwort – deshalb bleibt ein Modell dieser Größe in der günstigen Flash-Preiskategorie.

Agentic Coding über V4-Pro-Niveau

DeepSeek berichtet von 90,6 bei Terminal-Bench 2.1 im Vergleich zu 82,7 bei V4 Flash und 87,9 bei V4 Pro, 74,2 bei DeepSWE im Vergleich zu 54,4 und 62,7 sowie einem Codeforces-Score von 3471. Auf Terminal-Bench 3.0 liegt der Sprung bei 7,6 auf 30,0.

Vision direkt mittrainiert, nicht nachträglich aufgesetzt

Ein neuer DeepSeek-ViT-Encoder wurde von Beginn des Pre-Trainings an gemeinsam mit dem Textmodell trainiert. V4 Flash war rein textbasiert und seine Vision-Variante experimentell. Screenshots, Diagramme und Fotos werden nun in derselben Anfrage wie der Prompt übergeben.

Ein Viertel des KV-Cache-Bedarfs für 1M Kontext

Compressed Sparse Attention und FP4-KV-Speicherung reduzieren den globalen Cache auf etwa 890 Bytes pro Token – rund ein Viertel von V4 Flash. Genau das ermöglicht ein 1M-Token-Kontextfenster zu Flash-Kosten und mit 214 Tokens pro Sekunde in unabhängigen Tests.

DeepSeek V4.1 Flash vs. V4 Flash

Bei DeepSeek erfolgte die Migration bereits automatisch: Die offizielle ID lautet nun deepseek-flash, und Anfragen mit deepseek-v4-flash werden von V4.1 beantwortet. Auf AIReiter bleiben beide separate Modelle, sodass Sie jedes gezielt festlegen können.

Weniger aktive Parameter, höhere Scores

V4 Flash aktiviert 13B Parameter bei jedem Token. V4.1 Flash aktiviert 8B beim Prefill und 16B beim Decode – und übertrifft es dennoch in jedem von DeepSeek veröffentlichten Agenten-Benchmark. Die geringere Prefill-Zahl ist keineswegs ein Downgrade.

Thinking ist jetzt immer aktiv

V4 Flash bot diskrete Thinking-Modi. V4.1 Flash nutzt kontinuierlichen Reasoning Effort mit dem Standardwert „high“. Auf dieser Route liefert selbst eine Anfrage mit deaktiviertem Thinking weiterhin Reasoning-Tokens; planen Sie max_tokens entsprechend ein.

Bildeingabe ist Teil des Basismodells

Falls Sie Screenshots bisher an einen separaten Vision-Endpunkt neben V4 Flash weitergeleitet haben: V4.1 Flash verarbeitet beides in einem Aufruf. Senden Sie Bilder als Base64-Data-URIs im standardmäßigen Content-Array; diese Route ruft keine externen Bild-URLs ab.

Listenpreis für Output verdoppelt, Cache unverändert

Der offizielle Output-Preis stieg von 0,28 $ auf 0,60 $ pro Million Tokens. Cache-Hit-Input bleibt bei etwa 0,003 $. Workloads mit langem, stabilem Präfix und kurzen Antworten kosten ungefähr so viel wie zuvor; textintensive Generierungen kosten mehr.

Wann Sie bei V4 Flash bleiben sollten

Eine fest definierte Evaluation-Suite, ein Client, der reasoning_content in Tool-Loops nicht verarbeiten kann, oder ein striktes Token-Budget für den Output sprechen gegen eine Umstellung. Andernfalls sollten Sie neue Projekte direkt auf V4.1 Flash starten.

DeepSeek V4.1 Flash API-Preise

DeepSeek führt 0,15 $ Input, 0,60 $ Output und 0,003 $ Cache-Hit-Input pro Million Tokens außerhalb der Spitzenzeiten auf und verdoppelt alle drei an Wochentagen von 01:00 bis 04:00 sowie 06:00 bis 10:00 UTC. AIReiter berechnet rund um die Uhr einen einheitlichen Pauschaltarif: ca. 25 % unter dem Nebenzeit- und 62 % unter dem Spitzenzeittarif.
01

Ein einheitlicher Tarif, rund um die Uhr

Die drei Token-Positionen werden jeweils mit etwa drei Vierteln des DeepSeek-Off-Peak-Tarifs abgerechnet. Auf dieser Route gibt es kein Spitzenzeitenfenster; ein Job während der Pekinger Bürozeiten kostet also genauso viel wie nachts. Die aktuellen Preise finden Sie oberhalb des Playgrounds.

02

Wo die Ersparnis wirklich spürbar wird

Gegenüber dem offiziellen Spitzenzeittarif liegt der AIReiter-Preis bei ca. 38 %. Gegenüber Off-Peak bei ca. 75 %. Wenn Ihr Datenverkehr hauptsächlich tagsüber in Europa oder den USA anfällt – also während der DeepSeek-Spitzenzeit –, ist der Preisunterschied noch größer als die Schlagzeile vermuten lässt.

03

Reasoning-Tokens werden als Output abgerechnet

Thinking kann auf dieser Route nicht deaktiviert werden, und V4.1 Flash ist bei hoher Reasoning-Stufe sehr ausführlich. Unabhängige Tests verzeichneten bei denselben Aufgaben etwa doppelt so viele Output-Tokens wie vergleichbare Modelle. Setzen Sie max_tokens für Reasoning plus Antwort an.

04

Cache-Hits sind der günstigste Posten

Ein Cache-Hit-Input-Token kostet etwa 2 % eines Cache-Miss-Tokens. Bei Agent-Schleifen, die bei jedem Durchlauf denselben System-Prompt und dasselbe Tool-Schema erneut senden, dominieren Cache-Lesevorgänge die Rechnung und machen V4.1 Flash besonders günstig.

Wann DeepSeek V4.1 Flash eingesetzt werden sollte – und wann nicht

DeepSeek positioniert Flash nun in puncto Qualität, Kosten und Geschwindigkeit vor V4 Pro. Die verbleibenden Gründe, ein anderes Modell zu wählen, liegen im Wissens-Recall und in der Client-Kompatibilität, nicht in der reinen Leistungsfähigkeit.
01

Nutzung für Coding- und Terminal-Agents

Bei Multi-File-Edits, Test-Fix-Schleifen, CI-Log-Triage und Computer-Use-Aufgaben sind die publizierten Zuwächse gegenüber V4 Flash und V4 Pro am größten. Lange Tool-Traces passen ohne Chunking in das 1M-Fenster.

02

Nutzung für Screenshots und Diagramme

OCR aus einem UI-Screenshot, das Auslesen eines Diagramms oder die Prüfung einer gerenderten Seite können direkt in derselben Anfrage wie die Code-Frage übermittelt werden. Kein zweites Modell, keine zweite Rechnung.

03

V4 Pro nur für Kompatibilität verwenden

DeepSeek hat V4 Pro nach dem Release von V4.1 Flash weiter betrieben, weil Kunden danach gefragt haben – nicht, weil es besser abschneidet. Bleiben Sie bei Pro, wenn ein Vertrag oder eine fixierte Evaluation dies erfordert.

04

Nicht als Enzyklopädie verwenden

Das Basismodell liegt bei SimpleQA-Verified rund 13 Punkte hinter V4 Pro. Für die Faktenabfrage ohne Retrieval sollten Sie das Modell mit eigenen Dokumenten fundieren oder ein für Recall optimiertes Modell wählen.

05

Preisvergleich mit GLM-5.3 Flash

GLM-5.3 Flash ist das andere multimodale Flash-Modell auf AIReiter und ist beim Output günstiger gelistet. Wählen Sie V4.1 Flash, wenn es sich um eine Agent-Schleife oder Repository-Arbeiten handelt; wählen Sie GLM-5.3 Flash für umfangreiche Extraktionen und Klassifizierungen.

Die DeepSeek V4.1 Flash API aufrufen

Der Playground auf dieser Seite und die API teilen sich dieselbe Modell-ID. Die einzige Integrationsregel, die bei Clients zu Fehlern führt, ist die Handhabung von Reasoning innerhalb von Tool-Schleifen.

01

Echte Agent-Aufgabe im Playground testen

Fügen Sie ein fehlerhaftes Log mit dem Diff und einer Frage ein. Beobachten Sie die Output-Tokens (einschließlich Reasoning) und prüfen Sie die Antwortqualität, bevor Sie es fest integrieren. Bildeingabe ist über die API verfügbar.

02

POST /api/v1/chat/completions

Verwenden Sie das Modell "deepseek-v4-1-flash", einen AIReiter API-Key und den standardmäßigen Chat-Completions-Body. Streaming wird unterstützt. Dieselbe ID wird auch unter /api/v1/messages akzeptiert, falls Ihr Stack Anthropic Messages verwendet.

03

reasoning_content bei Verwendung von Tools zurücksenden (Round-Trip)

Sobald die Anfrage ein tools-Array enthält, muss jeder vorherige Assistant-Turn seinen reasoning_content zurückführen – auch Turns, die keinen Tool-Call ausgeführt haben. Wird dieser weggelassen, wird HTTP 400 zurückgegeben. Diese Regel hat bei V4 mehrere Agent-Frameworks beeinträchtigt und gilt nach wie vor.

04

Bilder im content-Array anhängen (API)

Verwenden Sie einen image_url-Part mit einer Base64-Data-URI. PNG, JPEG, GIF und WebP werden akzeptiert. Remote-Bild-URLs werden auf dieser Route nicht abgerufen; binden Sie die Bytes daher inline ein. Platzieren Sie den Textteil an erster Stelle, wenn das Bild lediglich Kontext für eine Frage ist und nicht deren eigentlicher Gegenstand.

Fragen zur DeepSeek V4.1 Flash API

Modell-ID, Preise, die Migration von V4 Flash, Bildeingabe und die Reasoning-Regel, die Fehler verursacht.

/ 01

Wie lautet die API-Modell-ID für DeepSeek V4.1 Flash?

Verwenden Sie auf AIReiter deepseek-v4-1-flash. Der interne Key lautet chat-deepseek-v4-1-flash. Direkt bei DeepSeek ist die offizielle ID deepseek-flash, und die ältere ID deepseek-v4-flash wird nun ebenfalls von V4.1 Flash bedient.

/ 02

Wie gestalten sich die Preise für DeepSeek V4.1 Flash?

DeepSeek führt 0,15 $ Input, 0,60 $ Output und 0,003 $ Cache-Hit-Input pro Million Tokens in den Nebenzeiten auf, wobei sich alle drei Preise zu Spitzenzeiten an Wochentagen verdoppeln. AIReiter berechnet zu jeder Zeit einen einheitlichen Pauschaltarif, der etwa 25 % unter dem Nebenzeit- und 62 % unter dem Spitzenzeittarif liegt. Die aktuellen Routenpreise werden über dem Playground angezeigt.

/ 03

Ist V4.1 Flash besser als V4 Pro?

Bei den von DeepSeek veröffentlichten Agent- und Coding-Benchmarks ja: Terminal-Bench 2.1 liegt bei 90,6 gegenüber 87,9 und DeepSWE bei 74,2 gegenüber 62,7. V4 Pro führt weiterhin bei GPQA Diamond und beim Knowledge Recall. DeepSeek selbst leitet neue Nutzer mittlerweile zu Flash weiter.

/ 04

Was ist der Unterschied zu V4 Flash?

Eine neue Encoder-Decoder-Architektur mit 8B bis 16B aktiven Parametern statt 13B, native Bildeingabe, Always-on-Reasoning, ein KV-Cache in Viertelgröße für das 1M-Fenster und deutliche Zuwächse bei jedem Agent-Benchmark. Der offizielle Listenpreis für den Output stieg zudem von 0,28 $ auf 0,60 $.

/ 05

Kann ich das Thinking deaktivieren?

Nicht auf dieser Route. Anfragen, bei denen Thinking deaktiviert ist, geben dennoch reasoning_content zurück, und reasoning_effort wird nicht weitergeleitet. Steuern Sie die Kosten stattdessen über max_tokens und einen präzisen Prompt.

/ 06

Werden Bilder akzeptiert?

Ja, über die API. Vision ist in V4.1 Flash nativ integriert und wurde auf dieser Route verifiziert. Senden Sie PNG, JPEG, GIF oder WebP als Base64-Data-URI in einem image_url-Part; Remote-URLs werden nicht abgerufen. Der Playground auf dieser Seite ist derzeit nur für Text ausgelegt.

/ 07

Warum erhält meine Tool-Calling-Schleife einen HTTP 400?

Sie haben reasoning_content aus einer früheren Assistant-Nachricht ausgelassen. Wenn ein tools-Array vorhanden ist, verlangt DeepSeek das Reasoning-Feld in jedem vorherigen Assistant-Turn – selbst in Turns ohne Tool-Call. Speichern Sie es und senden Sie es unverändert zurück.

/ 08

Welche Limits gelten für Kontext und Output?

DeepSeek dokumentiert ein Kontextfenster von 1M Token und maximal 384K Output-Token. Der Playground ist standardmäßig auf 8192 Output-Token eingestellt; erhöhen Sie diesen Wert für längere Agent-Ausführungen und beachten Sie, dass Reasoning-Token darauf angerechnet werden.

/ 09

Welchen Endpunkt sollte ich aufrufen?

POST https://aireiter.com/api/v1/chat/completions ist der primäre Endpunkt für dieses Modell. POST https://aireiter.com/api/v1/messages funktioniert mit derselben ID ebenfalls für Clients im Anthropic-Stil.

/ 10

Kann ich es vor der Integration ausprobieren?

Ja. Der Playground auf dieser Seite nutzt dieselbe Modell-ID und Route wie die API. Die hier sichtbare Token-Anzahl und das Verhalten entsprechen also genau dem, was die API zurückgibt.