AIREITER

Hausse des prix de l’API DeepSeek : anciens et nouveaux tarifs (août 2026)

Dernière mise à jour: 2026-08-16 19:01:23

Depuis le 16 août 2026, appeler l’API DeepSeek ne coûte plus le même prix selon l’heure. Les modèles deepseek-v4-flash et deepseek-v4-pro abandonnent leur tarif fixe par token au profit d’une facturation heures pleines/heures creuses. Hors pointe, les entrées sans cache et les sorties sont désormais facturées entre 1,5× et 2,4× leur ancien prix ; en pointe, ces tarifs doublent. Pour les entrées servies par le cache, la hausse va de 2,5× à 6,1× hors pointe et peut atteindre 12,1× en pointe. Le chiffre qui déterminera l’impact réel sur votre facture : votre taux de cache-hit.

Ce qui a changé le 16 août 2026

Le basculement a eu lieu le dimanche 16 août à 16:00 UTC, soit minuit le 17 août à Pékin, selon le fil d’annonce et l’audit de 650 appels publiés sur r/DeepSeek. La page officielle Models & Pricing affiche déjà les nouveaux tableaux : ce n’est donc pas une simple annonce, le changement est bien appliqué.

DeepSeek distingue désormais les périodes de pointe et les heures creuses, les tarifs de pointe étant exactement deux fois supérieurs à ceux des heures creuses. Les deux créneaux de pointe sont 01:00–04:00 UTC et 06:00–10:00 UTC : sept heures de pointe par jour, contre dix-sept heures creuses. Les versions des modèles (DeepSeek-V4-Flash-0731, DeepSeek-V4-Pro-0813), la compatibilité API et les spécifications publiées restent inchangées sur cette même page. Il s’agit d’une modification de facturation, pas d’une évolution des modèles.

Nouveaux tarifs de l’API DeepSeek

Tous les prix ci-dessous sont exprimés en USD par million de tokens et proviennent directement de la page tarifaire officielle au 16 août 2026.

V4 FlashHeures creusesHeures de pointe
Entrée, cache-hit$0.007$0.014
Entrée, cache-miss$0.22$0.44
Sortie$0.66$1.32
V4 ProHeures creusesHeures de pointe
Entrée, cache-hit$0.022$0.044
Entrée, cache-miss$0.66$1.32
Sortie$1.98$3.96
Page officielle des tarifs de l’API DeepSeek affichant les nouveaux tarifs de pointe et d’heures creuses, 16 août 2026

Le reste des modalités de facturation ne change pas : chaque requête est facturée au tarif en vigueur au moment de son exécution, et DeepSeek se réserve explicitement le droit de modifier à nouveau ses prix.

De combien les tarifs de l’API DeepSeek ont-ils réellement augmenté ?

Les anciens tarifs fixes ont été confirmés par des comparateurs tiers jusqu’au 31 juillet 2026 : Flash à $0.14 pour les entrées sans cache, $0.0028 pour les cache-hits et $0.28 pour les sorties ; Pro à $0.435 / $0.003625 / $0.87 (TLDL, BenchLM). Voici les deux grilles côte à côte :

Par 1M de tokensAncien tarif fixeNouveau tarif heures creusesNouveau tarif de pointeHeures creuses vs ancien tarifPointe vs ancien tarif
Entrée Flash, cache-hit$0.0028$0.007$0.0142.5×5.0×
Entrée Flash, cache-miss$0.14$0.22$0.441.57×3.14×
Sortie Flash$0.28$0.66$1.322.36×4.71×
Entrée Pro, cache-hit$0.003625$0.022$0.0446.07×12.14×
Entrée Pro, cache-miss$0.435$0.66$1.321.52×3.03×
Sortie Pro$0.87$1.98$3.962.28×4.55×
Tarifs de l’API DeepSeek V4 : ancien tarif fixe, nouvelles heures creuses et nouvelles heures de pointe, en USD par million de tokens

Le chiffre de « hausse de 1,114 % » qui circule sur Reddit est exact, mais il ne concerne qu’un cas précis : l’entrée V4 Pro servie par le cache en heure de pointe ($0.003625 -> $0.044). Une charge sans cache exécutée en heures creuses se rapproche plutôt d’une hausse de 1,5–2,3×. Votre multiplicateur se situera quelque part entre ces deux extrêmes : c’est toute la question.

Les charges très dépendantes du cache sont les plus pénalisées

Les tarifs de cache-hit ont augmenté de 2,5× à 12×, contre 1,5× à 4,7× pour les cache-miss et les sorties. Plus votre volume d’entrée profitait auparavant de la voie ultra-bon marché du cache, plus votre hausse en pourcentage sera forte. Un utilisateur de r/DeepSeek a recalculé 650 appels API réels — 16 sessions, 155.9M de tokens de prompt et un taux de cache-hit de 98.09 % — avec les deux grilles tarifaires, puis a rapproché le résultat de la facturation dans la console DeepSeek avec un écart inférieur à 2 % :

« the better caching works for you today, the bigger your increase » - u/Swimming-Soup-1173, audit r/DeepSeek de 650 appels API

Pour cette charge d’agent, le nouveau calcul aboutit à 2.7× en heures creuses, contre 1.5× pour la même charge sans aucun cache-hit. Un autre utilisateur a modélisé une charge à long contexte passant de $33 à $100 en heures creuses, ou $200 en pointe : une hausse de 3× à 6×. Les tâches batch, pipelines RAG et agents dotés de prompts système statiques sont les profils les plus affectés ; à l’inverse, les requêtes de résumé ponctuelles se rapprochent du plancher de 1,5–2,3× en heures creuses.

Heures de pointe : conversion dans votre fuseau horaire

La page officielle ne donne que les créneaux UTC. Voici leur conversion pour le mois d’août, lorsque l’heure d’été est en vigueur :

ZoneCréneaux de pointe locauxVotre journée 9 h–17 h
Pékin (UTC+8)09:00–12:00, 14:00–18:00Pointe, sauf pendant la pause de 12:00–14:00
Europe centrale (UTC+2)03:00–06:00, 08:00–12:00Matinée en pointe
Londres (UTC+1)02:00–05:00, 07:00–11:00Matinée en pointe
Côte Est des États-Unis (UTC-4)21:00–00:00, 02:00–06:00Entièrement en heures creuses
Côte Ouest des États-Unis (UTC-7)18:00–21:00, 23:00–03:00Entièrement en heures creuses

Les périodes de pointe correspondent à la journée de travail chinoise, à l’exception de la pause déjeuner : 12:00–14:00 à Pékin reste en heures creuses. Les équipes américaines effectuent toute leur journée de travail au tarif hors pointe. Les équipes européennes, elles, paient le double pour leurs traitements batch du matin — 08:00–12:00 CEST est une période de pointe — et ont intérêt à déplacer ces tâches l’après-midi ou la nuit.

Le prompt caching reste-t-il intéressant ?

Oui, sans ambiguïté : la remise a diminué, elle n’a pas disparu. Avant, une entrée en cache-hit coûtait environ 50× moins cher qu’une entrée sans cache sur Flash, et 120× moins cher sur Pro. Elle reste désormais environ 30× moins chère sur les deux modèles : 31× pour Flash et 30× pour Pro en heures creuses ($0.007 contre $0.22, $0.022 contre $0.66). L’auteur de l’audit qui a mesuré une hausse de 2.7× arrive d’ailleurs à la même conclusion :

« Caching is still absolutely worth it » - même audit r/DeepSeek

Dans sa charge, le cache réduisait toujours les coûts d’environ 15× par rapport à l’envoi du même contexte sans cache. Le caching reste un mécanisme best-effort, sans taux de hit garanti, et les entrées inutilisées sont généralement supprimées après quelques heures à quelques jours (BenchLM). Avant de bâtir votre budget, mesurez donc votre usage réel : enregistrez les champs prompt_cache_hit_tokens et prompt_cache_miss_tokens de l’objet usage, comme le recommande BenchLM, afin de calculer votre part effective de cache-hits.

DeepSeek reste-t-il l’option la moins chère après la hausse ?

En heures creuses, oui. En pointe, l’avantage de Flash face à GPT-5.6 disparaît pratiquement. Voici les prix standard par million de tokens :

ModèleEntréeSortieNotes
DeepSeek V4 Flash (heures creuses)$0.22$0.66Contexte de 1M
DeepSeek V4 Flash (pointe)$0.44$1.32Dépasse le prix de sortie de Luna
GPT-5.6 Luna$0.20$1.20Baisse de prix de 80 % le 30 juillet
DeepSeek V4 Pro (heures creuses)$0.66$1.98Encore ~6× moins cher que Terra
DeepSeek V4 Pro (pointe)$1.32$3.96~3× moins cher que Terra
GPT-5.6 Terra$2$12
Claude Sonnet 5$2$10Tarif de lancement jusqu’au 31 août, puis $3/$15

Hors pointe, les $0.66 de Flash en sortie sont 45 % moins chers que GPT-5.6 Luna et 18× moins chers que Terra : DeepSeek reste l’offre la plus économique en sortie pour les gros volumes. En pointe, Luna ($1.20 en sortie, $0.20 en entrée) bat Flash sur les deux tarifs standard. Son tarif de lecture de cache, $0.02/M dans le journal des modifications de l’AI Price Index, reste toutefois plus élevé que la voie cache-hit de Flash, quelle que soit l’heure. Flash affiche aussi toujours un contexte de 1M de tokens et une concurrence de 2,500 dans le tableau des spécifications officielles. Comme l’a résumé un commentaire dans le fil d’annonce : « DS4 is good but when cheap. »

Que faire cette semaine

  1. Recalculez votre facture avant de vous alarmer. Récupérez les journaux d’usage du mois dernier et appliquez la formule suivante : entrée cache-hit × taux de hit × prix cache-hit + entrée cache-miss × taux de miss × prix cache-miss + sortie × prix de sortie. Utilisez le tarif de pointe ou d’heures creuses correspondant à la fenêtre de chaque requête. L’audit encadre bien la fourchette : 1.5× sans cache-hit, 2.7× avec un taux de hit de 98 %.
  2. Déplacez les tâches batch hors pointe. Tâches cron, évaluations, traitement de documents : tout ce qui ne fait pas attendre un utilisateur peut tourner pendant les 17 heures creuses. Pour les équipes américaines, c’est presque sans effort puisque votre journée de travail est déjà hors pointe ; pour les équipes européennes, déplacez les lots du matin vers l’après-midi.
  3. Continuez à générer des cache-hits. Conservez les structures de prompts qui produisent déjà des cache-hits : cette voie reste environ 30× moins chère que l’entrée sans cache.
  4. Testez Flash pour les appels courants. Pro coûte 3× le prix de Flash dans tous les cas, 3.1× pour les cache-hits. Si vous n’avez pas réévalué Flash depuis la mise à jour post-entraînement 0731, redirigez une partie de votre trafic courant vers lui. Les compromis de sélection entre modèles sont détaillés dans notre comparaison V4 Flash vs V4 Pro.
  5. Si vous partez, la migration peut être légère. Avec des clients compatibles OpenAI, il suffit parfois de changer l’URL de base et l’identifiant de modèle. Les hébergeurs tiers et plateformes relais ont leurs propres grilles tarifaires : DataLLM Lab a recensé des hébergeurs proposant V4 Pro autour de $1.74/$3.48 par 1M avant même cette hausse. Comparez donc le tarif effectif, pas seulement le prix affiché.

La décision, résumée dans un tableau :

Votre profilRecommandation
Fuseau horaire américain, trafic d’agents riche en cacheRestez : les heures creuses et la voie cache ~30× moins chère maintiennent le coût d’entrée le plus bas pour un trafic très dépendant du cache
Fuseau horaire européen, tâches batch du matinRestez, mais replanifiez : l’exposition aux heures de pointe est évitable
Uniquement en heures de pointe, code sensible à la qualité avec ProRéévaluez : la sortie Pro en pointe ($3.96) reste sous Terra ($12), mais l’écart n’est plus que de 3×, contre 14× avant le 16 août
Charges ponctuelles sans cacheRestez : la hausse de 1.5–2.3× en heures creuses est la plus faible du tableau

FAQ

À quel moment précis les nouveaux prix DeepSeek sont-ils entrés en vigueur ?

Le 16 août 2026 à 16:00 UTC, soit minuit le 17 août à Pékin, selon le fil d’annonce et l’audit de 650 appels sur r/DeepSeek. La page tarifaire officielle affichait les nouveaux tableaux le même jour.

De combien ma facture DeepSeek va-t-elle augmenter ?

Une charge sans cache est recalculée autour de 1.5× en heures creuses, tandis qu’une charge mesurée avec 98 % de cache-hits atteint 2.7×. Les heures de pointe doublent ces chiffres, jusqu’à 12× pour l’entrée Pro en cache-hit. Le tableau des multiplicateurs ci-dessus détaille toutes les paires de tarifs.

Quelles sont les heures de pointe aux États-Unis ?

Côte Est : 21:00–00:00 et 02:00–06:00. Côte Pacifique : 18:00–21:00 et 23:00–03:00. Les horaires de bureau habituels aux États-Unis se situent entièrement dans les fenêtres d’heures creuses.

deepseek-chat et deepseek-reasoner sont-ils toujours disponibles ?

Non. Les alias historiques ont atteint leur date de retrait le 24 juillet 2026, d’après l’historique des identifiants de modèles de BenchLM ; les nouvelles intégrations doivent appeler deepseek-v4-flash ou deepseek-v4-pro.

DeepSeek est-il toujours moins cher que GPT-5.6 et Claude ?

En heures creuses, oui : la sortie Flash coûte 45 % de moins que GPT-5.6 Luna et 18× moins que Terra. En pointe, les $1.20/M de Luna en sortie passent sous les $1.32/M de Flash ; tout dépend donc de l’horaire auquel tourne votre trafic.