DeepSeek's V4 Pro kostet jetzt auf der offiziellen API $0.435 pro Million Input-Tokens und $0.87 pro Million Output-Tokens. Dasselbe Modell wird auf Azure AI Foundry weiterhin mit $1.74 und $3.48 gelistet, exakt dem Preis vor der Senkung. Dieser 4x-Abstand, verifiziert am 14. Juli 2026, ist derzeit die wichtigste Erkenntnis über die Kosten-Dynamik von DeepSeek Enterprise AI: Was Ihr Unternehmen zahlt, hängt weniger vom Modell ab als von der Tür, durch die Sie es erreichen.
Dieser Artikel versieht die direkte API und Azure mit datierten Zahlen, testet einen Reseller-Pfad, führt dieselbe Arbeitslast durch beide V4-Modelle und endet mit einem Entscheidungsrahmen sowie einer Frist: die alten Aliase deepseek-chat und deepseek-reasoner werden am 24. Juli 2026 eingestellt.
DeepSeek V4-Preise heute: die Zahlen, die zählen
Hier ist die offizielle Preisliste aus der DeepSeek-API-Dokumentation, geprüft am 14. Juli 2026:
| Modell | Eingabe (Cache-Treffer) | Eingabe (Cache-Fehltreffer) | Ausgabe | Kontext | Parallelitätslimit |
|---|---|---|---|---|---|
| deepseek-v4-flash | $0.0028/M | $0.14/M | $0.28/M | 1M tokens | 2,500 |
| deepseek-v4-pro | $0.003625/M | $0.435/M | $0.87/M | 1M tokens | 500 |
Drei Details in dieser Tabelle sind wichtiger als die angegebenen Zinssätze:
- Der Cache-Hit-Preis ist der echte Preis für Agent-Workloads. Ein Cache-Hit bei V4 Pro kostet 0,003625 $ pro Million Tokens, 120-mal günstiger als ein Cache-Miss. Agentensysteme, die bei jedem Aufruf denselben System-Prompt und dieselben Tool-Definitionen erneut senden, bewegen sich fast ausschließlich im Cache-Bereich, und DeepSeek wendet Caching automatisch an, ohne Konfiguration.
- Es gibt kein Werbe-Sternchen. Die 75-%-Reduktion, die als Einführungsaktion begann, ist jetzt der Listenpreis. Die Preisseite hat kein Ablaufdatum. Die Berichterstattung von InfoWorld führte die Dauerhaftigkeit auf das Engineering von V4 Pro zurück: bei langem Kontext etwa ein Viertel der Compute pro Token seines Vorgängers, sodass die Senkung strukturell und nicht subventioniert ist.
- Die Alias-Frist ist real. Die Modellnamen
deepseek-chatunddeepseek-reasonersind ab dem 24. Juli 2026 um 15:59 UTC veraltet. Produktionscode, der diese Namen noch aufruft, benötigt eine einzeilige Migration zudeepseek-v4-flashoderdeepseek-v4-pro. Da die neuen Standardwerte im Thinking-Modus laufen, ändern sich die Anzahl der Output-Tokens (und die Rechnungen), wenn Sie den Modus nicht explizit festlegen.
Beide Modelle bieten ein 1M-Token-Kontextfenster und bis zu 384K Ausgabe-Tokens, und die API stellt jetzt zusätzlich zum OpenAI-Format ein Anthropic-kompatibles Format unter api.deepseek.com/anthropic bereit, was wichtig ist, wenn Ihr Team DeepSeek in für Claude entwickelte Tools integrieren möchte.
Die Kürzung um 75 % erreichte nicht jeden Kanal
Azure AI Foundry verkauft dasselbe DeepSeek-V4 Pro für 1,74 $ für Input und 3,48 $ für Output pro Million Tokens (Globale Bereitstellung, Central US, verifiziert am 14. Juli 2026). Das ist der Preis vor der Kürzung, unverändert. V4 Flash auf Azure kostet 0,19 $/0,51 $: ein Aufschlag von 36 % auf Input und 82 % auf Output gegenüber der Cache-Miss-Rate der direkten API.
Auf der von uns geprüften Azure-Preisseite (Global deployment, Central US, 14. Juli 2026) erscheint für kein DeepSeek-Modell eine Position für zwischengespeicherte Eingaben; bestätigen Sie dies mit Ihrem Microsoft-Konto-Team, da die Marketplace-Preise den Anbieterpreisen hinterherhinken können. Bei der direkten API zahlt eine Agent-Workload mit starker Prefix-Wiederverwendung Bruchteile eines Cents pro Million Input-Tokens; auf Azure wird jedes dieser Tokens zum vollen Satz abgerechnet. Bei cache-lastigen Workloads beträgt die effektive Differenz nicht das 4-Fache; sie kann auf der Eingabeseite mehr als das 100-Fache betragen.
Um Azure fair zu behandeln: Sie kaufen nicht dasselbe. Foundry-Hosting hält den Traffic innerhalb von Microsofts Cloud, unter Microsofts Datenverarbeitungsbedingungen, mit Azure-SLAs und ohne dass Daten an von einem chinesischen Unternehmen betriebene Server weitergeleitet werden, was für viele Compliance-Teams genau der entscheidende Punkt ist. Microsoft positioniert es genau so, während es DeepSeek in Copilots Multi-Model-Routing einbindet. Aber dieser Governance-Aufpreis ist jetzt quantifizierbar: Für die unten stehende Referenz-Workload ist das der Unterschied zwischen 31 $ und 209 $ pro Monat und Workload, und Beschaffungsteams sollten ihn als eigene Position kalkulieren, nicht als unsichtbare Standardeinstellung hinnehmen.
Aggregatoren und API-Reseller sitzen dazwischen. Plattformen wie OpenRouter geben die Preise nahezu zum offiziellen Satz weiter, und Berichte aus der Community weisen darauf hin, dass DeepSeeks globaler Cache weiterhin über sie gilt. Der Haken ist die Transparenz; dazu unten mehr, denn wir haben es getestet.
Was eine echte Unternehmens-Workload kostet
Papierpreise werden erst zu Entscheidungen, wenn man sie mit einer Arbeitslast multipliziert. Nehmen wir einen mittelgroßen Enterprise-Assistenten: 100 Mio. Input-Tokens pro Monat (50 % Cache-Hit-Rate, eine konservative Rate für Agentenverkehr, der ständig System-Prompts erneut sendet) plus 10 Mio. Output-Tokens. Hier ist dieselbe Arbeitslast über sechs Kanäle hinweg bepreist, unter Verwendung von am 14. Juli 2026 verifizierten Raten:
| Kanal | Monatliche Kosten |
|---|---|
| DeepSeek V4 Flash, direkte API | $9.94 |
| Azure V4 Flash Global | $24.10 |
| DeepSeek V4 Pro, direkte API | $30.63 |
| GPT-5.6-Luna (OpenAI) | $115.00 |
| Azure V4 Pro Global | $208.80 |
| GPT-5.6-Sol (OpenAI) | $575.00 |
Die Mathematik hinter der Tabelle ist wiederverwendbar: monatliche Kosten = miss_tokens x miss_rate + hit_tokens x hit_rate + output_tokens x output_rate. Der Cache-Anteil dominiert sie. Die gleiche 100M-Eingabe-Workload auf V4 Pro kostet direkt 52,20 $ pro Monat bei 0 % Cache-Trefferquote, 30,63 $ bei 50 % und 13,38 $ bei 90 % – während sie auf Azure in allen drei Fällen bei 208,80 $ bleibt, weil kein Cache-Rabatt veröffentlicht wird.
Zwei Lesarten dieser Tabelle. Erstens unterscheiden sich der günstigste DeepSeek-Kanal und der teuerste Frontier-Kanal bei identischem Traffic um das 58-Fache. Zweitens, und weniger offensichtlich: Azures DeepSeek V4 Pro kostet mehr als OpenAIs GPT-5.6-Luna. Wenn Ihre Beschaffungszusammenfassung sagt: „Wir haben uns auf DeepSeek standardisiert, um Geld zu sparen“, die Bereitstellung aber Azure Global ist, dann könnte die Ersparnis kleiner ausfallen als die eines OpenAI-Modells der mittleren Preisklasse.
Der Multiplikator, der Budgets sprengt, ist agentische Verstärkung. Ein Single-Turn-Chatbot verrechnet grob einen Call pro Benutzerfrage; ein produktiver Agent verknüpft Planung, Retrieval, Tool-Calls und Verifikation, und das Verhältnis von Eingaben zu abgerechneten Tokens kann 1:700 erreichen – eine Zahl, die VentureBeats Analyse der Agentenökonomie vom Juli 2026 als das „100x problem“ bezeichnet. Bei diesem Verhältnis entspricht unsere Referenz-Workload von 100M Tokens dem, was ein mäßig stark genutztes Agent-Feature erzeugt, nicht dem Traffic eines ganzen Unternehmens. Günstige Preise pro Token sind keine Lizenz, Kostenkontrollen zu überspringen; sie sind das, was Agent-Produkte überlebensfähig macht, während Sie sie entwickeln.
Wir haben denselben Job auf V4 Flash und V4 Pro ausgeführt
Preiseseiten beantworten nicht die Frage, die Ihre Ingenieure stellen werden: Was kostet eine einzelne Anfrage und wie lange dauert sie? Am 14. Juli 2026 schickten wir dieselbe Programmieraufgabe – „Schreiben Sie eine Python-Funktion, die einen ISO-8601-Dauerstring in Gesamtsekunden umwandelt, mit 3 Testfällen“ – an beide V4-Modelle mit den Standardeinstellungen (Thinking Mode aktiviert, max. 4.000 Output-Tokens) über einen OpenAI-kompatiblen Reseller-Endpunkt. Wir nennen den Reseller nicht, weil es um das Verhalten dieser Kategorie geht, nicht um das eines einzelnen Anbieters; die Rohantworten enthielten DeepSeeks reasoning_content-Feld, womit wir das zugrunde liegende Modell bestätigten:
| V4 Flash | V4 Pro | |
|---|---|---|
| Gesamtzeit | 15.5s | 35.1s |
| Abschlusstokens (inkl. Reasoning) | 1,690 | 1,902 |
| Effektive Ausgabegeschwindigkeit | ~109 tok/s | ~54 tok/s |
| Kosten zu offiziellen Tarifen | ~$0.0005 | ~$0.0017 |
Die Vorbehalte klar gesagt: Dies ist nur eine einzelne Stichprobe, und die Latenz enthält Relay-Overhead, also betrachten Sie die Wall-Clock-Zahlen eher als Obergrenze denn als Benchmark der direkten API. Beide Antworten gaben DeepSeeks typisches reasoning_content-Feld zurück: Beide Modelle laufen standardmäßig im Thinking Mode, und diese Reasoning-Tokens werden als Output berechnet. Flash verbrachte 2.703 Zeichen damit, über eine Parsing-Funktion nachzudenken, bevor es antwortete. Wenn Ihr Workload keine Chain-of-Thought benötigt, ist das Ausschalten von Thinking eine der günstigsten verfügbaren Optimierungen. Für einen tieferen direkten Vergleich dazu, wann die zusätzliche Qualität von Pro den 3-fachen Preis rechtfertigt, haben wir beide Modelle einem vollständigen Vergleich in DeepSeek V4 Flash vs V4 Pro unterzogen.
Der Test brachte eine Erkenntnis zutage, die wir sonst nirgends dokumentiert gesehen haben: Die Nutzungsberichte des Relay-Kanals enthielten keine Cache-Aufschlüsselung. Wir haben denselben 824-Token-Präfix zweimal hintereinander gesendet – ein klassischer Cache-Hit, wenn der Wiederverkäufer DeepSeeks Prefix-Caching beibehält – und die API-Antwort meldete nur prompt_tokens, completion_tokens und total_tokens, ohne eine Aufschlüsselung von prompt_cache_hit_tokens. Bei der direkten API ist genau dieses Feld der Weg, um zu prüfen, ob der 120-fache Cache-Rabatt auf Ihrer Rechnung ankommt. Über einen Vermittler erhalten Sie den Rabatt möglicherweise, ohne ihn verifizieren zu können, oder Sie erhalten ihn überhaupt nicht. Wenn Sie DeepSeek über einen Wiederverkäufer kaufen, fragen Sie ausdrücklich, ob die Cache-Hit-Bepreisung weitergegeben wird und wie sie auf Ihrer Rechnung erscheint.
Direkte API, Azure oder ein Aggregator: Wie man wählt
Die Entscheidung für den Kanal reduziert sich auf eine kurze Tabelle:
| Direkte API | Azure AI Foundry | Aggregator/Reseller | |
|---|---|---|---|
| V4 Pro Preis (ein/aus pro M) | $0.435 / $0.87 | $1.74 / $3.48 | Variiert; typischerweise nahe am offiziellen Preis |
| Cache-Treffer-Rabatt | Ja, automatisch, prüfbar | Nicht aufgeführt | Manchmal; oft nicht prüfbar |
| Datenresidenz | DeepSeeks Server | Microsoft-Cloud, Ihr Mandant | Infrastruktur des Resellers |
| Vertrag/Compliance | Chinesische Einheit | Bestehende Azure-Vereinbarung | Geschäftsbedingungen des Resellers |
| Parallelität | 500 (Pro) / 2,500 (Flash) | PTU-Bereitstellung verfügbar | Gebündelt, variiert |
| Konsolidierung mehrerer Modelle | Nur DeepSeek | Foundry-Katalog | Breiter Katalog, eine Rechnung |
In der Praxis gewinnt die direkte API bei den reinen Kosten: Kein Kanal erreicht die Cache-Hit-Preise von 0,003625 $ pro Million, und nur dort können Sie diesen Rabatt prüfen. Azure gewinnt, wenn Ihr Rechtsteam keine Freigabe für Traffic zur eigenen Infrastruktur von DeepSeek erteilt; Sie zahlen für Governance etwa das 7-Fache der effektiven Rate, und dieser Tausch kann völlig rational sein, wenn Sie ihn bewusst treffen. Aggregatoren gewinnen, wenn DeepSeek eines von mehreren Modellen hinter einem Router ist und die konsolidierte Abrechnung eine geringe Marge wert ist; prüfen Sie die Weitergabe des Cache-Vorteils, bevor Sie Volumen zusagen.
Unabhängig davon, welchen Kanal Sie wählen, sind die Routing-Regeln, die die DeepSeek-Rechnungen niedrig halten, unspektakulär: Standard-Klassifizierung, Extraktion und Zusammenfassung auf Flash; Pro für die Codegenerierung mit mehreren Dateien und Langkontext-Reasoning reservieren; den Thinking-Modus für deterministische Aufgaben deaktivieren (diese Reasoning-Tokens werden als Output abgerechnet); und die Tiefe der Agent-Loop pro Workflow begrenzen. Ein gut abgestimmter Router ist wichtiger als der 3-fache Preisunterschied zwischen Flash und Pro.
Warum DeepSeek so niedrig bepreisen kann — und ob das Bestand hat
Die Preise sind kein Lockvogelangebot. V4s Architektur ist ein Mixture-of-Experts-Design mit insgesamt 1,6 Billionen Parametern, aber nur etwa 49 Milliarden aktiven pro Forward Pass: Sie inferieren den Rechenaufwand eines mittelgroßen Modells und erhalten dabei Frontier-Qualität (80,6 % auf SWE-bench Verified, laut den veröffentlichten Ergebnissen von DeepSeek). Die V4-Pro-Revision zielte speziell auf die Kosten langer Kontexte ab, weshalb das Unternehmen seine 75 %-Aktion in den regulären Preis umgewandelt hat, statt sie auslaufen zu lassen.
Die Richtung begünstigt die Käufer. Die Grenzwerte der Inferenzkosten pro Einheit sinken nach den meisten Schätzungen der Branche seit Jahren um etwa das 3-Fache pro Jahr, und DeepSeeks Senkung innerhalb eines Jahres, während die Kontextlänge auf 1M Tokens wuchs, übertrifft sogar diese Kurve. OpenAI ging im selben Zeitraum in die entgegengesetzte Richtung und positionierte seine Flaggschiff-Stufe mit GPT-5.6-Sol bei $5/$30 nach oben.
Der Gegengewicht ist Jevons: Günstigere Inferenz erzeugt verlässlich mehr Inferenz. Die Beobachtung von New Street Research – seit der V3-Ära zitiert – dass stärkerer Wettbewerb die Gesamtausgaben selten senkt, hat sich während des gesamten AI-Ausbaus bestätigt. Die Einführung von Agenten vervielfacht die Aufrufe pro Nutzer schneller, als die Preise pro Token fallen; deshalb sind die Unternehmen, die ihre Budgets konstant halten, diejenigen, die Routing, Caching und Prompt-Disziplin als erstklassige Engineering-Aufgaben behandeln, nicht diejenigen, die einfach das billigste Modell gewählt haben. Diese Kostendynamiken zu verstehen, nicht nur den Listenpreis, ist das, was eine DeepSeek-Implementierung, die billig bleibt, von einer unterscheidet, die unbemerkt ausufert.
FAQ
Warum ist DeepSeek V4 so günstig?
Mixture-of-experts-Architektur: 1,6T Gesamtparameter, ~49B aktiv pro Token. Die Rechenkosten pro Token ähneln denen eines viel kleineren Modells, und die Long-Context-Engineering von V4 Pro hat die Rechenkosten pro Token auf ungefähr ein Viertel des Vorgängers reduziert. Die Preisgestaltung ist strukturell, nicht werblich.
Wie stark wurde der Preis für DeepSeek V4 Pro gesenkt?
75 %: von $1.74/$3.48 pro Million Tokens (Eingabe/Ausgabe) auf $0.435/$0.87. Es begann als zeitlich begrenzte Aktion und wurde zum dauerhaften Listenpreis.
Gilt die Preissenkung um 75 % auch bei Azure?
Nein. Stand 14. Juli 2026 führt Azure AI Foundry DeepSeek-V4 Pro Global mit 1,74 $/3,48 $ auf, dem Preis vor der Senkung, ohne veröffentlichte Cached-Input-Preisgestaltung. Für cache-intensive Workloads kann die effektive Differenz gegenüber der direkten API 4x überschreiten; prüfen Sie die aktuellen Preise mit Microsoft, da Marketplace-Preise Anbieter-Senkungen hinterherhinken können.
Ist DeepSeek für den Unternehmenseinsatz kostenlos?
Die API wird pro Token abgerechnet, aber die Modellgewichte stehen unter der MIT-Lizenz, sodass Self-Hosting für die kommerzielle Nutzung legal ist. In V4s Größenordnung bräuchten Sie eine ernsthafte GPU-Infrastruktur; für die meisten Teams unterbietet der pro-Token-Preis der API die TCO von Self-Hosting mit großem Abstand.
Wie vergleicht sich die Kosten von DeepSeek mit ChatGPT?
Bei den API-Preisen ist DeepSeek V4 Pro ($0.435/$0.87) beim Input etwa 11x günstiger als GPT-5.6-Sol ($5/$30) und beim Output 34x. ChatGPT-Abonnements ($20–$200/Monat pro Sitz) sind ein anderes Produkt; für programmgesteuerte Workloads ist der API-zu-API-Vergleich der aussagekräftige.
Was vor dem 24. Juli zu tun ist
Drei Maßnahmen, nach Dringlichkeit geordnet:
1. Migrieren Sie Modell-Aliase jetzt. deepseek-chat und deepseek-reasoner werden ab dem 24. Juli 2026 um 15:59 UTC nicht mehr aufgelöst. Verwenden Sie deepseek-v4-flash oder deepseek-v4-pro explizit und setzen Sie den Thinking Mode bewusst; der Standard hat sich geändert, und Reasoning-Tokens werden als Output abgerechnet. 2. Passen Sie Ihre Kanalpreise an. Wenn Sie aus Governance-Gründen auf Azure sind, bestätigen Sie, dass das bei 4x Listenpreis und ohne Cache-Rabatt weiterhin eine bewusste Entscheidung ist. Wenn Sie über einen Reseller gehen, lassen Sie sich das Cache-Passthrough schriftlich zusichern. 3. Prüfen Sie Ihre Cache-Trefferquote. In der direkten API sehen Sie prompt_cache_hit_tokens in Ihren Nutzungsdaten. Wenn Ihr Agenten-Traffic unter 50 % Cache-Treffer liegt, strukturieren Sie Prompts so um, dass statische Inhalte zuerst kommen: Bei einem 120x-Verhältnis zwischen Treffer und Fehlversuch ist die Reihenfolge der Prompts eine Budgetentscheidung.
Das Modell ist billig geworden. Die Dynamik darüber, wer diese Kostensenkung abschöpft (Anbieter, Cloud, Wiederverkäufer oder Sie), entscheidet in diesem Jahr darüber, wo im Unternehmensgeschäft Geld gewonnen und verloren wird.
Weiterführende Lektüre: DeepSeek V4 Flash vs V4 Pro · GLM 5.2 vs DeepSeek V4 Pro · OpenRouter Preisleitfaden
