Le V4 Pro de DeepSeek coûte désormais 0,435 $ par million de tokens d’entrée et 0,87 $ par million de tokens de sortie sur l’API officielle. Le même modèle sur Azure AI Foundry est toujours affiché à 1,74 $ et 3,48 $, soit exactement le prix d’avant la réduction. Cet écart de 4x, vérifié le 14 juillet 2026, est de loin le fait le plus important concernant la dynamique des coûts de l’IA d’entreprise chez DeepSeek en ce moment : ce que votre entreprise paie dépend moins du modèle que de la porte par laquelle vous passez pour y accéder.
Cet article indique des chiffres datés pour l’API directe et Azure, teste un parcours revendeur, exécute la même charge de travail sur les deux modèles V4, et se termine par un cadre de décision, plus une échéance : les anciens alias deepseek-chat et deepseek-reasoner prennent leur retraite le 24 juillet 2026.
Tarification de DeepSeek V4 aujourd’hui : les chiffres qui comptent
Voici la liste de prix officielle issue de la documentation API de DeepSeek, vérifiée le 14 juillet 2026 :
| Modèle | Entrée (cache hit) | Entrée (cache miss) | Sortie | Contexte | Limite de concurrence |
|---|---|---|---|---|---|
| deepseek-v4-flash | $0.0028/M | $0.14/M | $0.28/M | 1M tokens | 2,500 |
| deepseek-v4-pro | $0.003625/M | $0.435/M | $0.87/M | 1M tokens | 500 |
Trois détails dans ce tableau comptent plus que les taux affichés en titre :
- Le prix du cache-hit est le vrai prix pour les charges de travail d’agent. Un cache hit sur V4 Pro coûte 0,003625 $ par million de tokens, soit 120 fois moins cher qu’un cache miss. Les systèmes d’agents qui renvoient à chaque appel le même system prompt et les mêmes définitions d’outils vivent presque entièrement dans le domaine du cache, et DeepSeek applique la mise en cache automatiquement, sans configuration.
- Il n’y a pas d’astérisque promotionnel. La réduction de 75 % qui a commencé comme une promotion de lancement est désormais le prix catalogue. La page de tarification n’indique aucune date d’expiration. Le reportage d’InfoWorld a attribué ce caractère permanent à l’ingénierie de V4 Pro : environ un quart du calcul par token de son prédécesseur à long contexte, donc la réduction est structurelle, pas une subvention.
- La date limite de l’alias est réelle. Les noms de modèles
deepseek-chatetdeepseek-reasonerseront obsolètes le 24 juillet 2026 à 15:59 UTC. Le code de production qui appelle encore ces noms nécessite une migration en une ligne versdeepseek-v4-flashoudeepseek-v4-pro. Comme les nouveaux paramètres par défaut s’exécutent en mode thinking, les nombres de tokens de sortie (et les factures) changeront si vous ne définissez pas explicitement le mode.
Les deux modèles offrent une fenêtre de contexte de 1M tokens et jusqu’à 384K tokens de sortie, et l’API propose désormais un format compatible avec Anthropic à api.deepseek.com/anthropic en plus du format OpenAI, ce qui est important si votre équipe souhaite intégrer DeepSeek dans des outils conçus pour Claude.
La réduction de 75 % n’a pas atteint tous les canaux
Azure AI Foundry vend le même DeepSeek-V4 Pro à 1,74 $ en entrée et 3,48 $ en sortie par million de tokens (déploiement global, US Central, vérifié le 14 juillet 2026). Il s’agit du prix avant réduction, inchangé. V4 Flash sur Azure est à 0,19 $/0,51 $ : une prime de 36 % sur l’entrée et une prime de 82 % sur la sortie par rapport au tarif en cas d’échec du cache de l’API directe.
Sur la page de tarification Azure que nous avons consultée (déploiement global, Centre des États-Unis, 14 juillet 2026), aucune ligne d’élément de coût pour l’entrée mise en cache n’apparaît pour aucun modèle DeepSeek ; confirmez cela avec votre équipe de compte Microsoft, car les tarifs du marketplace peuvent être en retard sur ceux du fournisseur. Sur l’API directe, une charge de travail d’agent avec une forte réutilisation du préfixe paie des fractions de centime par million de jetons d’entrée ; sur Azure, chacun de ces jetons est facturé au tarif plein. Pour les charges de travail fortement dépendantes du cache, l’écart effectif n’est pas de 4x ; il peut dépasser 100x du côté des entrées.
Pour être juste envers Azure, vous n’achetez pas la même chose. L’hébergement Foundry maintient le trafic à l’intérieur du cloud de Microsoft, soumis aux conditions de traitement des données de Microsoft, avec les SLA Azure et sans aucune donnée quittant les serveurs exploités par une entreprise chinoise, ce qui, pour de nombreuses équipes de conformité, est précisément l’enjeu. Microsoft se positionne exactement ainsi en intégrant DeepSeek au routage multi-modèle de Copilot. Mais cette prime de gouvernance est désormais quantifiable : pour la charge de travail de référence ci-dessous, cela représente une différence entre 31 $ et 209 $ par mois et par charge de travail, et les équipes achats devraient la chiffrer comme une ligne budgétaire, et non l’absorber comme une valeur par défaut invisible.
Les agrégateurs et les revendeurs d'API se situent entre les deux. Des plateformes comme OpenRouter répercutent des tarifs proches du taux officiel, et des retours de la communauté indiquent que le cache mondial de DeepSeek s'applique toujours via elles. Le hic, c'est la visibilité ; nous y reviendrons plus loin, car nous l'avons testé.
Ce que coûte une véritable charge de travail d’entreprise
Les tarifs affichés ne deviennent des décisions qu’une fois multipliés par une charge de travail. Prenons un assistant d’entreprise de taille moyenne : 100M jetons d’entrée par mois (50 % de taux de cache hit, un taux prudent pour le trafic d’agent qui renvoie constamment les prompts système) plus 10M jetons de sortie. Voici cette même charge de travail tarifée sur six canaux, en utilisant les tarifs vérifiés le 14 juillet 2026 :
| Canal | Coût mensuel |
|---|---|
| DeepSeek V4 Flash, API directe | $9.94 |
| Azure V4 Flash Global | $24.10 |
| DeepSeek V4 Pro, API directe | $30.63 |
| GPT-5.6-Luna (OpenAI) | $115.00 |
| Azure V4 Pro Global | $208.80 |
| GPT-5.6-Sol (OpenAI) | $575.00 |
Les mathématiques derrière le tableau sont réutilisables : coût mensuel = miss_tokens x miss_rate + hit_tokens x hit_rate + output_tokens x output_rate. La part du cache domine le calcul. La même charge de travail de 100M entrées sur V4 Pro coûte directement 52,20 $ par mois avec 0 % de cache hit, 30,63 $ à 50 % et 13,38 $ à 90 % - tandis que sur Azure, elle reste à 208,80 $ dans les trois cas, car aucune remise de cache n’est publiée.
Deux lectures de ce tableau. Premièrement, le canal DeepSeek le moins cher et le canal frontier le plus coûteux diffèrent d’un facteur de 58x pour un trafic identique. Deuxièmement, et c’est moins évident : DeepSeek V4 Pro sur Azure coûte plus cher que GPT-5.6-Luna d’OpenAI. Si votre récapitulatif d’achat indique « nous avons standardisé sur DeepSeek pour économiser de l’argent », mais que le déploiement est sur Azure Global, les économies peuvent être plus faibles que celles qu’offrirait un modèle OpenAI de milieu de gamme.
Le multiplicateur qui fait exploser les budgets est l’amplification agentique. Un chatbot à tour unique facture à peu près un appel par question utilisateur ; un agent en production enchaîne planification, récupération, appels d’outils et vérification, et le ratio entre les entrées et les tokens facturés peut atteindre 1:700, un chiffre que l’analyse de VentureBeat de juillet 2026 sur l’économie des agents qualifie de « problème des 100x ». À ce ratio, notre charge de travail de référence de 100 M de tokens correspond à ce qu’une fonctionnalité d’agent modérément sollicitée génère, et non au trafic d’une entreprise entière. Un prix bas par token n’est pas une licence pour ignorer les contrôles de coûts ; c’est ce qui rend les produits agentiques viables pendant que vous les construisez.
Nous avons exécuté le même travail sur V4 Flash et V4 Pro
Les pages de tarification ne répondent pas à la question que vos ingénieurs poseront : combien coûte une seule requête et combien de temps prend-elle ? Le 14 juillet 2026, nous avons envoyé la même tâche de codage - "Write a Python function that parses an ISO 8601 duration string into total seconds, with 3 test cases" - aux deux modèles V4 avec les paramètres par défaut (mode de réflexion activé, 4 000 jetons de sortie maximum) via un point de terminaison revendeur compatible OpenAI. Nous laissons le revendeur anonyme parce que l’enjeu concerne le comportement de la catégorie, pas celui d’un fournisseur en particulier ; les réponses brutes contenaient le champ reasoning_content de DeepSeek, ce qui nous a permis de confirmer le modèle sous-jacent :
| V4 Flash | V4 Pro | |
|---|---|---|
| Temps écoulé | 15.5s | 35.1s |
| Jetons de complétion (y compris le raisonnement) | 1,690 | 1,902 |
| Vitesse de sortie effective | ~109 tok/s | ~54 tok/s |
| Coût aux tarifs officiels | ~$0.0005 | ~$0.0017 |
Précisions importantes : il s’agit d’un seul échantillon, et la latence inclut la surcharge du relais, donc considérez les chiffres de temps réel comme une borne supérieure plutôt que comme un benchmark de l’API directe. Les deux réponses ont renvoyé le champ signature de DeepSeek reasoning_content : les deux modèles fonctionnent par défaut en mode réflexion, et ces jetons de raisonnement sont facturés comme des sorties. Flash a passé 2 703 caractères à raisonner sur une fonction d’analyse avant de répondre. Si votre charge de travail n’a pas besoin de chaîne de pensée, désactiver la réflexion est l’une des optimisations les moins coûteuses disponibles. Pour une comparaison plus approfondie en face-à-face sur les cas où la qualité supplémentaire de Pro justifie un prix 3x plus élevé, nous avons soumis les deux modèles à une comparaison complète dans DeepSeek V4 Flash vs V4 Pro.
Le test a mis en évidence un constat que nous n’avons vu documenté nulle part ailleurs : les rapports d’utilisation du canal relais ne contenaient aucune ventilation du cache. Nous avons envoyé deux fois de suite le même préfixe de 824 tokens — un cache hit classique si le revendeur conserve le cache de préfixe de DeepSeek — et la réponse de l’API n’a indiqué que prompt_tokens, completion_tokens et total_tokens, sans répartition prompt_cache_hit_tokens. Sur l’API directe, ce champ permet de vérifier si la remise de cache 120x se répercute sur votre facture. Via un intermédiaire, vous pouvez bénéficier de la remise sans pouvoir la vérifier, ou ne pas en bénéficier du tout. Si vous achetez DeepSeek auprès d’un revendeur, demandez explicitement si la tarification des cache-hit est bien répercutée et comment elle apparaît sur votre facture.
API directe, Azure ou agrégateur : comment choisir
La décision du canal se résume à un court tableau :
| API directe | Azure AI Foundry | Agrégateur/revendeur | |
|---|---|---|---|
| Prix V4 Pro (entrée/sortie par M) | $0.435 / $0.87 | $1.74 / $3.48 | Varie ; généralement proche de l’officiel |
| Remise pour cache hit | Oui, automatique, vérifiable | Non indiqué | Parfois ; souvent non vérifiable |
| Résidence des données | Serveurs de DeepSeek | Cloud Microsoft, votre tenant | Infrastructure du revendeur |
| Contrat/conformité | Entité chinoise | Contrat Azure existant | Conditions du revendeur |
| Concurrence | 500 (Pro) / 2,500 (Flash) | Provisioning PTU disponible | Mutualisé, varie |
| Consolidation multi-modèles | DeepSeek uniquement | Catalogue Foundry | Catalogue large, une seule facture |
En pratique : l’API directe l’emporte sur le plan purement économique : aucun canal n’égale le prix des cache-hit à 0,003625 $ par million, et c’est le seul canal où vous pouvez auditer cette remise. Azure l’emporte lorsque votre équipe juridique n’accepte pas le trafic vers l’infrastructure propre de DeepSeek ; vous payez environ 7x le taux effectif pour la gouvernance, et cet échange peut être parfaitement rationnel si vous le faites en toute connaissance de cause. Les agrégateurs l’emportent lorsque DeepSeek fait partie de plusieurs modèles derrière un router et que la facturation consolidée vaut une marge faible ; vérifiez la répercussion du cache avant d’engager du volume.
Quel que soit le canal que vous choisissez, les règles d’acheminement qui maintiennent les factures DeepSeek stables sont peu glamour : attribuer par défaut la classification, l’extraction et la synthèse à Flash ; réserver Pro à la génération de code multi-fichiers et au raisonnement à long contexte ; désactiver le mode thinking pour les tâches déterministes (ces tokens de raisonnement sont facturés comme output) ; et plafonner la profondeur de boucle de l’agent par workflow. Un routeur bien réglé compte davantage que l’écart de 3x entre Flash et Pro.
Pourquoi DeepSeek peut proposer un prix aussi bas — et si cela tient la route
Les prix ne sont pas une opération d’appel à perte. L’architecture de V4 est une conception de type mixture-of-experts avec 1,6 trillion de paramètres au total, mais seulement environ 49 milliards actifs par passe avant : vous effectuez l’inférence avec un niveau de calcul équivalent à celui d’un modèle de taille moyenne tout en obtenant des capacités de pointe (80,6 % sur SWE-bench Verified, selon les résultats publiés par DeepSeek). La version V4 Pro s’est précisément attaquée au coût du long contexte, ce qui explique pourquoi l’entreprise a transformé sa promotion de 75 % en prix permanent au lieu de la laisser expirer.
La direction du marché favorise les acheteurs. Les coûts unitaires d’inférence à la frontière ont baissé d’environ 3x par an selon la plupart des estimations du secteur, et la réduction opérée par DeepSeek en un an, alors que la longueur de contexte a atteint 1M tokens, dépasse même cette courbe. OpenAI a évolué dans le sens opposé sur la même période, repositionnant sa gamme phare à la hausse avec GPT-5.6-Sol à $5/$30.
Le contrepoids est Jevons : une inférence moins chère produit de manière fiable davantage d’inférence. L’observation de New Street Research — citée depuis l’ère V3 — selon laquelle une concurrence accrue réduit rarement la dépense totale, s’est vérifiée tout au long du déploiement de l’IA. L’adoption des agents multiplie les appels par utilisateur plus vite que les prix par token ne baissent, c’est pourquoi les entreprises qui maintiennent des budgets stables sont celles qui traitent le routage, le caching et la discipline des prompts comme des priorités d’ingénierie, et non celles qui ont choisi le modèle le moins cher. Comprendre ces dynamiques de coûts, et pas seulement le prix affiché, est ce qui distingue un déploiement DeepSeek qui reste bon marché d’un autre qui enfle discrètement.
FAQ
Pourquoi DeepSeek V4 est-il si peu cher ?
Architecture de mélange d’experts : 1,6 T de paramètres au total, ~49 B actifs par token. Le coût de calcul par token ressemble à celui d’un modèle beaucoup plus petit, et l’ingénierie de long contexte de V4 Pro a réduit le calcul par token à environ un quart de celui de son prédécesseur. La tarification est structurelle, pas promotionnelle.
De combien le prix du DeepSeek V4 Pro a-t-il été réduit ?
75 % : de 1,74 $/3,48 $ par million de tokens (entrée/sortie) à 0,435 $/0,87 $. Cela a commencé comme une promotion limitée et est devenu le prix public permanent.
La réduction de prix de 75 % s’applique-t-elle sur Azure ?
Non. Au 14 juillet 2026, Azure AI Foundry affiche DeepSeek-V4 Pro Global à 1,74 $/3,48 $, le tarif avant la réduction, sans tarification des entrées mises en cache publiée. Pour les charges de travail fortement dépendantes du cache, l’écart effectif par rapport à l’API directe peut dépasser 4x ; vérifiez les tarifs actuels auprès de Microsoft, car les prix de la place de marché peuvent être en retard sur les baisses du fournisseur.
DeepSeek est-il gratuit pour une utilisation en entreprise ?
L'API est facturée au token, mais les poids du modèle sont sous licence MIT, donc l'auto-hébergement est légal pour un usage commercial. À l'échelle de V4, vous auriez besoin d'une infrastructure GPU sérieuse ; pour la plupart des équipes, le prix par token de l'API est largement inférieur au coût total de possession d'une solution auto-hébergée.
Comment le coût de DeepSeek se compare-t-il à celui de ChatGPT ?
En matière de tarification API, DeepSeek V4 Pro ($0.435/$0.87) coûte environ 11 fois moins cher que GPT-5.6-Sol ($5/$30) en entrée et 34 fois en sortie. Les abonnements ChatGPT ($20–$200/mois par siège) constituent un produit différent ; pour les charges de travail programmatiques, la comparaison API à API est la plus pertinente.
Que faire avant le 24 juillet
Trois actions, par ordre d'urgence :
1. Migrez maintenant les alias de modèle. deepseek-chat et deepseek-reasoner cesseront de se résoudre le 24 juillet 2026 à 15:59 UTC. Épinglez explicitement deepseek-v4-flash ou deepseek-v4-pro, et définissez le mode de réflexion de manière volontaire ; la valeur par défaut a changé, et les jetons de raisonnement sont facturés comme des sorties. 2. Reprenez le prix de votre canal. Si vous êtes sur Azure pour des raisons de gouvernance, confirmez qu’il s’agit toujours d’un arbitrage délibéré à 4x le prix catalogue et sans remise de cache. Si vous passez par un revendeur, obtenez par écrit le répercussion du cache. 3. Auditez votre taux de succès du cache. Sur l’API directe, vérifiez prompt_cache_hit_tokens dans vos données d’utilisation. Si le trafic de votre agent est inférieur à 50 % de hits de cache, restructurez les prompts pour que le contenu statique soit en tête : avec un écart hit/miss de 120x, l’ordre du prompt est une décision budgétaire.
Le modèle est devenu bon marché. Les dynamiques de qui capte cette baisse de coût (le fournisseur, le cloud, le revendeur ou vous) sont là où l’argent des entreprises se gagne et se perd cette année.
Lectures associées : DeepSeek V4 Flash vs V4 Pro · GLM 5.2 vs DeepSeek V4 Pro · Guide tarifaire OpenRouter
