AIREITER

DeepSeek V4 Flash Vision Exp API-Leitfaden: Limits und Beispiele

Zuletzt aktualisiert: 2026-08-21 11:46:52

Mit dem deepseek-v4-flash-vision-exp-Endpoint bekommt die V4-Flash-Reihe Unterstützung für Bildeingaben. Das entscheidende Detail steckt jedoch im Namen: experimental. Die bisher veröffentlichten Startdaten belegen keine Produktionsreife. Wer das Modell einsetzen möchte, sollte deshalb zunächst einen protokollierten Pilotbetrieb mit Fallback aufsetzen, statt es direkt zum Standard-Backend zu machen.

DeepSeek Vision API-Leitfaden mit der offiziellen Dokumentation zur Bildeingabe

Die API-Entscheidung in 30 Sekunden

DeepSeek V4 Flash Vision Exp passt gut zu bestehenden V4-Flash-Workflows, die zusätzlich Screenshots, Diagramme, Dokumente oder andere Bilder per API auswerten müssen. Bei visuellen Entscheidungen mit Identitätsbezug oder hohem Risiko sollte jedoch immer ein Fallback bereitstehen und die konkrete Aufgabe separat validiert werden.

SituationGeeignete EingabemethodeWarum
Kleines lokales Bild für eine einmalige AnfrageBase64-Daten-URLKein öffentliches Hosting erforderlich
Bild ist bereits öffentlich erreichbarExterne URLKleiner Request-Payload
Großes Bild oder wiederholte NutzungFiles API mit file_idUpload lässt sich wiederverwenden; pro referenziertem Bild sind bis zu 64 MiB möglich
Für eine grobe Aufgabe soll der Detailgrad sinkendetail: "low"Skaliert das Bild vor der Inferenz auf 512 x 512 herunter

Der exakte Modellname lautet deepseek-v4-flash-vision-exp. DeepSeek führt das Modell als experimentell und nennt den 21. August 2026 als Verfügbarkeit auf der API-Plattform – nachzulesen im offiziellen Changelog. Laut Release-Hinweis entspricht die Leistung bei reinen Textaufgaben V4 Flash; bei Agenten-Benchmarks, die visuelles Verständnis voraussetzen, soll es zudem deutliche Verbesserungen geben.

Ein Bild per Chat Completions senden

Beim OpenAI-kompatiblen Chat-Completions-Format stehen Text und Bild gemeinsam in einem content-Array innerhalb einer user-Nachricht. Der offizielle Vision-Leitfaden beschreibt das genaue Verhalten für dieses Modell. Wer ein Bild an das normale deepseek-v4-flash schickt, erhält einen 400-Fehler.

import base64
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

with open("chart.png", "rb") as image_file:
    encoded = base64.b64encode(image_file.read()).decode("utf-8")

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Extract the three trends from this chart."},
                {
                    "type": "image_url",
                    "image_url": {
                        "url": f"data:image/png;base64,{encoded}",
                        "detail": "original",
                    },
                },
            ],
        }
    ],
)

print(response.choices[0].message.content)

Bilder werden bei Chat Completions in user-Nachrichten unterstützt. Bild und Anweisung sollten im selben Content-Array stehen, damit das Modell visuellen Kontext und konkrete Aufgabe gemeinsam erhält.

Den passenden Bild-Transport wählen

Base64 für kleine lokale Dateien

Für ein lokales Bild, das nur einmal verarbeitet wird, ist Base64 der unkomplizierteste Weg. Öffentliches Hosting entfällt. Allerdings zählt die kodierte Datei zum Limit von 48 MiB für den Request-Body, während das Ausgangsbild höchstens 32 MiB groß sein darf.

Das eignet sich für einzelne Uploads von Nutzern oder Workern, nicht für Bilder, die in einer ganzen Batch-Verarbeitung mehrfach verwendet werden.

Öffentliche URL für gehostete Assets

Öffentliche http- oder https-URLs halten den Request klein. Sie müssen erreichbar sein, dürfen höchstens 8.192 Zeichen lang sein, innerhalb von 60 Sekunden heruntergeladen werden können und maximal 32 MiB umfassen. Private, abgelaufene oder nur intern erreichbare URLs können bereits beim Abruf durch DeepSeek scheitern.

Files API für Wiederverwendung und größere Dateien

Das Bild wird zunächst über die Files API hochgeladen. Anschließend verweist die Vision-Anfrage auf die zurückgegebene ID:

{
  "type": "file",
  "file_id": "file-api-xxxxxxxxxxxxxxxx"
}

Eine referenzierte Datei darf pro Bild bis zu 64 MiB groß sein. Außerdem müssen dieselben Bytes nicht bei jeder Anfrage erneut übertragen werden. Dafür kommt ein zusätzlicher Upload- und Lifecycle-Schritt hinzu. Die zurückgegebene ID sollte zusammen mit dem Schlüssel gespeichert werden, der sie erstellt hat – sie ist kein öffentlich teilbarer Link.

Die Files API ist besonders praktisch, wenn eine Datei größer als 32 MiB ist, der Request die Grenze von 48 MiB überschreiten könnte oder mehrere Agenten-Schritte dasselbe Bild untersuchen sollen.

Den visuellen Detailgrad vor der Abrechnung festlegen

Das Feld detail steht für image_url-Eingaben und Bildteile der Responses API zur Verfügung. Das folgende Verhalten entspricht dem offiziellen Vision-Leitfaden von DeepSeek.

WertDokumentiertes VerhaltenGeeignet, wenn
lowSkaliert auf 512 x 512 herunterLayout, grobe Szene oder eine grobe Klassifizierung ausreichen
highBehält das Originalbild beiKleiner Text oder feine Details wichtig sind
originalBehält das Originalbild beiDie Verarbeitung ausdrücklich mit voller Detailstufe erfolgen soll
autoEntspricht derzeit originalDas aktuelle Standardverhalten akzeptabel ist

DeepSeek skaliert Bilder vor der Inferenz. Laut Vision-Leitfaden ist jedes Bild auf 384 Bild-Token begrenzt; mehrere Bilder werden unabhängig voneinander gezählt. Ein sehr großes Ausgangsbild verbraucht nach der Skalierung daher nicht zwingend proportional mehr Bild-Token. Große Dateien können trotzdem an Upload- oder Request-Größenlimits scheitern.

Auf der offiziellen Seite zu Modellen und Preisen wird deepseek-v4-flash-vision-exp mit denselben Tokenpreisen wie V4 Flash geführt: $0.007 pro 1M gecachte Input-Token und $0.22 pro 1M Input-Token bei Cache-Misses außerhalb der Spitzenzeiten; zu Spitzenzeiten sind es $0.014 beziehungsweise $0.44. Für Output werden außerhalb der Spitzenzeiten $0.66 und zu Spitzenzeiten $1.32 berechnet. Bild-Token zählen als Input-Token. Bildanzahl und Detailstufe gehören deshalb in jede realistische Kostenkalkulation.

Limits, die in der Praxis API-Fehler auslösen

BeschränkungLimit oder Verhalten
Unterstützte FormateJPEG, PNG, GIF, WebP
Maximale Request-Größe48 MiB
Maximales Base64- oder URL-Bild32 MiB
Maximales Bild per Files-API-file_id64 MiB
Maximale Bildanzahl pro Request600
Gesamtgröße ohne Bilder per file_id64 MiB
Gesamtgröße einschließlich Bildern per file_id200 MiB
Maximale Abmessung8.192 Pixel pro Seite
Abmessungslimit bei 15 oder mehr Bildern4.096 Pixel pro Seite
Länge externer URLs8.192 Zeichen
Download externer BilderMuss innerhalb von 60 Sekunden abgeschlossen sein

Zwei Einschränkungen werden leicht übersehen: Nur deepseek-v4-flash-vision-exp akzeptiert Bilder, und Bildblöcke in system- oder assistant-Nachrichten schlagen bei Chat Completions fehl. Wird ein Bild an ein Modell ohne Vision-Unterstützung gesendet, dokumentiert DeepSeek die 400-Fehlermeldung This model does not support image.

Dasselbe Modell über drei API-Schnittstellen

DeepSeek beschreibt das Modell in seinem Vision-Leitfaden für drei Schnittstellen:

SchnittstelleBildblockErgebniszugriff
Chat Completionsimage_url in einem User-Content-Arrayresponse.choices[0].message.content
Responses APIinput_image zusammen mit input_textresponse.output_text
Anthropic-kompatible APIimage unter https://api.deepseek.com/anthropicAnthropic-Message-Content

Alle drei Varianten unterstützen Base64, öffentliche URLs und Referenzen auf die Files API. Die Content-Typen unterscheiden sich jedoch. Der Block für Chat Completions lässt sich daher nicht unverändert in die Responses API kopieren.

Was die Launch-Daten zeigen – und was nicht

Im Changelog vom 21. August nennt DeepSeek starke Benchmark-Ergebnisse, darunter 83.9 bei Terminal Bench 2.1 und 64.3 bei Chartography auf p0.95. Das sind vom Anbieter gemeldete Werte, keine unabhängige Reproduktion. Außerdem weist der Release-Hinweis darauf hin, dass das reine Textmodell V4 Flash multimodale Elemente in zwei visuellen Evaluationen ignoriert.

Die Benchmark-Ergebnisse zum Launch stammen also vom Anbieter. Bevor Produktions-Traffic über das Modell läuft, sollten die für die eigene Anwendung relevanten visuellen Aufgaben mit realen Daten geprüft werden.

Ist der Einsatz in der Produktion sinnvoll?

Für einen kontrollierten Pilotbetrieb eignet sich DeepSeek V4 Flash Vision Exp etwa zur Screenshot-Analyse, Diagrammextraktion, Dokumentvorsortierung oder für Agenten, die visuelle Zustände untersuchen müssen. Die Preise auf V4-Flash-Niveau und drei verschiedene Wege für Bildeingaben machen die Evaluierung günstig. Auch die Obergrenze von 384 Token pro Bild liefert einen konkreten Ausgangspunkt für die Kostenplanung.

Als einziges Backend für Identitätsprüfungen, Sicherheitsentscheidungen, medizinische Interpretationen oder andere visuelle Bewertungen mit hohen Konsequenzen sollte das Modell jedoch nicht eingesetzt werden, solange es experimentell bleibt und die genannten Launch-Daten keine Zuverlässigkeit für solche Fälle belegen. Ein Fallback sollte hinter derselben Schnittstelle bereitstehen. Außerdem gehören Bildquelle, detail-Einstellung, Input- und Output-Nutzung, Latenz, Retries und Aufgabenerfolg ins Monitoring.

Vor der Weiterleitung von Produktions-Traffic sollten mindestens diese Fälle getestet werden:

  1. Kleiner Text in Screenshots mit den Detailstufen low und original.
  2. Diagramme mit Beschriftungen, Legenden und dicht beschrifteten Achsen.
  3. Mehrere Bilder in einer Anfrage.
  4. Private und langsame Bild-URLs.
  5. Tool-Aufrufe nach der visuellen Analyse.
  6. Falsche oder mehrdeutige Identitäts-Prompts.
  7. Fallback-Verhalten nach einem 400-Fehler, Timeout oder einer fehlerhaften Bildantwort.

DeepSeek V4 Flash Vision Exp API: Häufige Fragen

Wie lautet der exakte Modellname?

Verwende deepseek-v4-flash-vision-exp. Im Changelog vom 21. August 2026 bezeichnet DeepSeek das Modell als experimentelles multimodales Modell auf der API-Plattform.

Wird es wie V4 Flash abgerechnet?

Ja. Auf der Preisseite nennt DeepSeek für Vision Exp und V4 Flash dieselben Tokenpreise für Cache-Hits, Cache-Misses und Output. Bild-Token werden als Input-Token abgerechnet; nach der Skalierung sind bis zu 384 Bild-Token pro Bild möglich.

Kann das Modell Bilder erzeugen?

Der offizielle Vision-Leitfaden beschreibt Bildverständnis, nicht Bildgenerierung. Solange DeepSeek keine separate Unterstützung für die Generierung veröffentlicht, sollte dieser Endpoint ausschließlich zur Analyse von Bildern betrachtet werden.

Warum liefert mein Request einen 400-Fehler?

Prüfe Modellnamen, Nachrichtenrolle, Content-Block-Typ, Dateigröße und Bildformat. Bilder an ein Modell ohne Vision-Unterstützung oder in nicht unterstützten Nachrichtenrollen können den dokumentierten Fehler This model does not support image auslösen.