AIREITER

Guide API DeepSeek V4 Pro GA : tarifs, benchmarks et migration

Dernière mise à jour: 2026-08-13 13:40:15

DeepSeek a officialisé V4 Pro GA le 13 août 2026. Au programme : scores de benchmarks complets, poids ouverts sous licence MIT et trois niveaux d'effort de raisonnement. Pour les utilisateurs de l'API, le changement à surveiller est tarifaire : la page officielle des prix confirme une facturation en heures pleines et heures creuses à compter du 16 août 2026 à 16:00 UTC. Les tokens de sortie V4 Pro passent de 0,87 $ à 1,98 $/million en heures creuses, ou 3,96 $/million en heures pleines.

Page officielle des tarifs API DeepSeek affichant les prix en heures pleines et heures creuses

V4-Pro-0813 : benchmarks publiés et poids ouverts

Le modèle désormais servi derrière l'alias API deepseek-v4-pro est DeepSeek-V4-Pro-0813. Il est accessible dans l'application DeepSeek, sur le web et via l'API. DeepSeek a annoncé sa disponibilité le 13 août, en mettant en avant des « capacités d'agent considérablement améliorées » face à la version preview du 24 avril.

Architecture et caractéristiques :

ÉlémentDeepSeek-V4-Pro-0813
Taille du modèle publiée1.7T paramètres (model card ; la preview comptait 1.6T)
Longueur de contexte1 million de tokens
Sortie maximale384K tokens
Modes de réflexionSans réflexion et avec réflexion (ce dernier est activé par défaut)
Niveaux d'effort de raisonnementlow, high, max
Nouveau module de décodageDécodage spéculatif DSpark (7 tokens spéculatifs)
Compatibilité APIOpenAI ChatCompletions, Responses API, Anthropic API, Codex
Limite de concurrence500
LicenceMIT

Pour les scénarios agentiques, la model card recommande temperature = 1.0 et top_p = 0.95. La longueur de sortie maximale atteint 384K tokens avec les niveaux d'effort high et max.

Les benchmarks officiels de la version GA

DeepSeek publie dix comparaisons sur la model card. Les tâches d'agents de code ont été exécutées avec DeepSeek Harness en mode minimal et un effort de raisonnement max. Les deux dernières lignes, DSBench, correspondent à des jeux de test internes à DeepSeek. Tous les scores ci-dessous proviennent de cette model card.

Scores des benchmarks GA de DeepSeek V4-Pro-0813 comparés à Kimi K3, Opus 4.8 et Fable 5 sur cinq benchmarks d'agents
BenchmarkPro-0813Flash-0731Pro PreviewKimi K3Opus 4.8Fable 5
HLE (sans outils / avec outils)42.7 / 60.037.8 / 51.537.7 / 48.243.5 / 56.049.8 / 57.953.3 / 63.0
Terminal Bench 2.187.982.772.188.385.088.0
DeepSWE62.754.412.867.558.070.0
Toolathlon-Verified74.170.355.976.576.277.9
Cybergym83.376.752.780.078.383.1
NL2Repo61.554.238.5—69.7—
Agents' Last Exam25.725.216.527.625.7—
AutomationBench (public)31.825.112.830.827.229.1
DSBench-FullStack (interne)71.168.741.873.771.677.2
DSBench-Hard (interne)67.259.631.163.071.768.3

Le bond par rapport à la preview est spectaculaire : DeepSWE passe de 12.8 à 62.7, tandis qu'AutomationBench progresse de 12.8 à 31.8. Face aux concurrents, Pro-0813 prend la tête sur HLE avec outils, à 60.0, devant les 56.0 de Kimi K3 et les 57.9 d'Opus 4.8. En revanche, il reste derrière Kimi K3 et Fable 5 sur DeepSWE, Terminal Bench et Toolathlon-Verified. Les deux lignes DSBench étant des évaluations internes à l'éditeur, elles ne doivent pas être interprétées comme des benchmarks maintenus de façon indépendante.

Des poids accessibles en open source

Les poids 0813 sont disponibles sur Hugging Face sous licence MIT, avec des options de déploiement via vLLM et SGLang. La model card fournit un exemple de service vLLM reposant sur le décodage spéculatif DSpark, un cache KV en FP8 et un unique nœud 4x GB300.

« Globalement compétitif face aux meilleurs modèles propriétaires disponibles. » — model card DeepSeek V4-Pro, Hugging Face

Tarifs API : avant et après le 16 août

La page tarifaire affiche à la fois un tarif fixe actuel et une grille heures pleines/heures creuses programmée, applicable à partir du 16 août 2026 à 16:00 UTC. Les heures pleines sont fixées à 01:00–04:00 UTC et 06:00–10:00 UTC, soit 09:00–12:00 et 14:00–18:00 à Pékin. Toutes les autres plages sont en heures creuses. Le tarif heures creuses est exactement deux fois inférieur au tarif heures pleines.

DeepSeek V4 Pro (DeepSeek-V4-Pro-0813)

Catégorie de facturationTarif fixe actuelHeures creuses (16 août)Heures pleines (16 août)Hausse en heures pleines
Entrée, cache atteint$0.003625/M$0.022/M$0.044/M+1,114%
Entrée, cache manqué$0.435/M$0.66/M$1.32/M+203%
Sortie$0.87/M$1.98/M$3.96/M+355%
Comparaison des tarifs par token DeepSeek V4 Pro : tarif fixe actuel contre tarifs programmés en heures pleines et heures creuses par million de tokens

En heures pleines, le coût de sortie est multiplié par 4.6. Le changement sur les cache hits est encore plus sensible pour les workflows d'agents en production : l'ancien tarif de $0.003625/M était environ 120 fois moins cher qu'un cache miss. Après le 16 août, cet écart tombe à 30x dans les deux tranches tarifaires, soit 0.022 contre 0.66 en heures creuses et 0.044 contre 1.32 en heures pleines. Dans le même temps, le coût absolu d'un cache hit est multiplié par 6 à 12.

DeepSeek V4 Flash (DeepSeek-V4-Flash-0731)

Catégorie de facturationTarif fixe actuelHeures creuses (16 août)Heures pleines (16 août)Hausse en heures pleines
Entrée, cache atteint$0.0028/M$0.007/M$0.014/M+400%
Entrée, cache manqué$0.14/M$0.22/M$0.44/M+214%
Sortie$0.28/M$0.66/M$1.32/M+371%

Limite de concurrence : 2,500 requêtes simultanées, soit cinq fois l'allocation de Pro.

À quelles heures les tarifs pleins s'appliquent-ils ?

Fuseau horairePlage de pointe 1Plage de pointe 2
Pékin (UTC+8)09:00–12:0014:00–18:00
Londres (UTC+1)02:00–05:0007:00–11:00
New York (UTC-4)21:00–00:00 (jour précédent)02:00–06:00
San Francisco (UTC-7)18:00–21:0023:00–03:00

Pour les équipes basées aux États-Unis, les créneaux de pointe tombent surtout la nuit et en soirée. En Chine et en Asie de l'Est, ils correspondent aux horaires habituels de bureau.

Simulation : Pro avec 10,000 appels par jour

Prenons le cas d'un agent en production qui envoie, à chaque appel, un préfixe mis en cache de 50K tokens et génère une réponse de 2K tokens.

Poste de coûtTarif fixe actuelHeures creusesHeures pleines
Entrée avec cache hit (500M tokens)$1.81$11.00$22.00
Sortie (20M tokens)$17.40$39.60$79.20
Total quotidien$19.21$50.60$101.20
Total sur 30 jours$576$1,518$3,036

Dans la réalité, une charge de travail combine appels en heures pleines et en heures creuses : le coût final se situera entre ces deux bornes. Pour ce même usage, Flash revient à $7.00/jour au tarif fixe actuel, à environ $16.70/jour en heures creuses et à environ $33.40/jour en heures pleines. Flash en heures pleines ($33.40/jour) coûte davantage que Pro au tarif fixe actuel ($19.21/jour), mais Flash en heures creuses ($16.70/jour) reste moins cher.

Migration : identifiants de modèles, contrôle du raisonnement et versions figées

Endpoints retirés et identifiants de remplacement

L'annonce de la preview du 24 avril indiquait que deepseek-chat et deepseek-reasoner seraient « entièrement retirés et inaccessibles après le 24 juillet 2026, 15:59 (UTC Time) ». Le code qui référence ces identifiants doit donc être mis à jour.

Ancien endpointModèle réellement serviRemplacement
deepseek-chatV4 Flash, sans réflexiondeepseek-v4-flash
deepseek-reasonerV4 Flash, avec réflexiondeepseek-v4-flash (avec réflexion) ou deepseek-v4-pro

De nombreuses équipes supposaient que deepseek-reasoner donnait accès au raisonnement de niveau Pro. Cet endpoint routait en fait vers Flash en mode réflexion. Passer à deepseek-v4-pro modifiera la qualité des sorties comme le montant de la facture.

// Before (retired — fails)
{"model": "deepseek-reasoner", "messages": [...]}

// After
{"model": "deepseek-v4-pro", "messages": [...]}

L'URL de base reste https://api.deepseek.com. La structure des requêtes ne change pas par ailleurs.

Trois niveaux d'effort de raisonnement

V4-Pro-0813 introduit trois niveaux d'effort : low pour les tâches simples, high pour le travail agentique courant, et max pour les problèmes complexes. Le mode réflexion est activé par défaut, et les tokens de réflexion sont facturés comme des tokens de sortie. Un prompt qui consomme 3,000 tokens de réflexion avant de fournir une réponse de 200 tokens sera ainsi facturé sur 3,200 tokens de sortie au tarif heures pleines : $0.0127 par appel, contre $0.0008 pour la réponse seule. DeepSeek désigne le niveau low pour les tâches simples, où une réflexion prolongée ajoute un coût sans apporter de valeur.

Figer une version de modèle

L'alias deepseek-v4-pro cible la version courante et peut évoluer lorsque DeepSeek publie de nouvelles versions. Pour garantir un comportement reproductible en production, vérifiez si votre fournisseur prend en charge les identifiants de modèles datés. Certaines passerelles tierces proposent des routes figées : consultez leur documentation pour confirmer quelle version est servie par chaque route avant de vous y fier en production.

Compatibilité des protocoles API

Les deux modèles prennent en charge les formats OpenAI ChatCompletions et Anthropic API. L'endpoint Anthropic est https://api.deepseek.com/anthropic. La compatibilité avec la Responses API et Codex est nouvelle dans la version GA. Testez les deux chemins de protocole si vous rencontrez des erreurs après la migration.

Pro ou Flash après la hausse des prix ?

V4-Pro-0813 devance V4-Flash-0731 sur les dix métriques publiées. L'écart dépend toutefois de la complexité de la tâche :

BenchmarkPro 0813Flash 0731Écart
Terminal Bench 2.187.982.75.2 pts
DeepSWE62.754.48.3 pts
AutomationBench31.825.16.7 pts
Cybergym83.376.76.6 pts

Choisissez V4 Pro si :

  • Votre boucle agentique renvoie régulièrement un préfixe stable et volumineux. Les économies liées aux cache hits restent valables, malgré une base tarifaire plus élevée
  • Vous avez besoin du plus grand nombre de paramètres de Pro pour un raisonnement complexe, l'utilisation d'outils en plusieurs étapes ou la génération de code à grande échelle
  • Votre charge de travail peut s'accommoder de la limite de 500 requêtes simultanées

Choisissez V4 Flash si :

  • Vos tâches sont simples, à fort volume ou sensibles à la latence
  • Vous avez besoin de la limite de 2,500 requêtes simultanées pour des charges avec fan-out
  • Le gain de qualité ne justifie pas un prix de sortie trois fois plus élevé

Pour une analyse plus complète modèle contre modèle, consultez notre comparatif DeepSeek V4 Flash vs Pro. Pour tester le modèle sans gérer de clés API, les pages de chat V4 Pro et V4 Flash sont accessibles immédiatement.

FAQ

Les poids V4-Pro-0813 sont-ils disponibles pour l'auto-hébergement ?

Oui : ils sont sous licence MIT et disponibles sur Hugging Face, avec des options vLLM et SGLang. Consultez la section consacrée aux poids ouverts ci-dessus pour les détails de déploiement.

Faut-il passer de V4 Flash à V4 Pro avec la GA ?

Pour la plupart des charges de travail sensibles aux coûts, Flash reste le meilleur choix en rapport qualité-prix. Selon les benchmarks, il accuse un retard allant de 0.5 point sur Agents' Last Exam à 8.5 points sur HLE avec outils, tout en coûtant trois fois moins cher en sortie. Passez à Pro si votre usage exige l'ensemble des paramètres pour un raisonnement complexe en plusieurs étapes ou pour générer du code à grande échelle.

Comment limiter l'impact de la hausse tarifaire ?

Trois leviers : planifier les traitements par lots et les agents différables en dehors des heures pleines, soit 01:00–04:00 et 06:00–10:00 UTC ; maximiser les cache hits en conservant des préfixes de prompt stables ; router les tâches simples vers Flash ou utiliser l'effort de raisonnement low sur Pro.

La tarification heures pleines/heures creuses concerne-t-elle l'application et le site DeepSeek ?

La page officielle des tarifs documente uniquement la facturation des tokens API. Le calendrier indiqué s'applique aux appels directs à l'API ; les fournisseurs de passerelles peuvent le répercuter, ajouter une marge ou appliquer leurs propres tarifs. Consultez la page tarifaire pour les informations à jour.