Hy3 vs DeepSeek V4 Flash : Tarification, contexte, retours concrets

Dernière mise à jour: 2026-07-14 13:20:21

Si votre workload est un agent de codage qui reste en dessous d’environ 150K tokens de contexte, Hy3 est le modèle le plus intelligent et coûte à peu près le même prix par token d’entrée. Si vos sessions durent longtemps, si votre repo est volumineux, ou si vous avez besoin d’une forte concurrence en production, DeepSeek V4 Flash l’emporte sur trois chiffres qu’Hy3 ne peut pas égaler : une fenêtre de contexte de 1M tokens, un prix documenté de 0.0028 $ en cache-hit, et un plafond de concurrence de 2 500 requêtes. C’est la version courte de la décision hy3 vs deepseek v4 flash. Les preuves à l’appui : tarification vérifiée le 14 juillet 2026 à partir de la documentation officielle de DeepSeek et des annonces en direct d’OpenRouter, de données de benchmark tierces, et de ce que rapportent les développeurs sur Hacker News et Reddit après avoir utilisé les deux quotidiennement.

Deux modèles, deux paris différents

Tencent a publié la version finale de Hy3 le 6 juillet 2026, mettant à niveau la version de prévisualisation qui était en ligne depuis le 23 avril. Selon cette annonce, il s’agit d’un modèle Mixture-of-Experts avec 295B paramètres au total et 21B actifs, conçu autour de ce que Tencent appelle une pensée hybride rapide et lente : le modèle décide pour chaque requête de la quantité de raisonnement à consacrer. La fenêtre de contexte atteint 256K tokens. Les poids sont ouverts sous Apache 2.0, et l’API fonctionne sur Tencent Cloud TokenHub.

DeepSeek V4 Flash a été lancé en avril 2026 en tant que niveau rapide de la famille V4. C’est aussi un MoE à poids ouverts (284B au total, 13B actifs, selon Artificial Analysis), mais sous licence MIT et optimisé pour un objectif différent : servir 1M tokens de contexte à faible coût. Il prend en charge les modes thinking et non-thinking (thinking est le mode par défaut), avec une sortie maximale de 384K tokens.

Les nombres de paramètres semblent similaires. Les objectifs de conception, eux, ne le sont pas. Hy3 consacre son budget à la qualité du raisonnement par token ; Flash le consacre à la longueur du contexte, à l’efficacité du cache et au débit. La plupart des différences pratiques ci-dessous découlent de cette répartition.

Spec (verified 2026-07-14)Hy3DeepSeek V4 Flash
Paramètres295B total / 21B actifs284B total / 13B actifs
Fenêtre de contexte256K1M (384K max output)
RaisonnementPensée hybride rapide/lenteModes avec réflexion et sans réflexion
LicenceApache 2.0MIT
Publié6 juillet 2026 (aperçu le 23 avr.)avril 2026
API officielleTencent Cloud TokenHubapi.deepseek.com (formats OpenAI + Anthropic)

Ce que montrent réellement les benchmarks

Sur l’Artificial Analysis Intelligence Index v4.1, Hy3 obtient 41 contre 37 pour DeepSeek V4 Flash en mode de raisonnement à effort élevé. Quatre points sur cet indice constituent un véritable écart, à peu près la distance entre Flash et les modèles d’un niveau inférieur, mais ce n’est pas une différence de catégorie. Les deux modèles se situent dans la catégorie « très capables, mais pas à la frontière ».

Artificial Analysis comparison cards showing Hy3 at 41 and DeepSeek V4 Flash at 37 on the Intelligence Index

Deux réserves avant d’accorder trop de poids à ce score.

Premièrement, les benchmarks de codage agentique racontent une histoire plus sévère pour les deux modèles. Un commentateur dans le fil de lancement sur Hacker News a retrouvé le résultat DeepSWE de Hy3 : 28 %, contre 52 % pour GPT-5.4 à effort maximal. Aucun des deux modèles chinois n’est proche du codage agentique de pointe ; ils sont en concurrence l’un avec l’autre, pas avec le sommet du classement.

Deuxièmement, considérez avec le scepticisme habituel les tableaux de benchmarks publiés par l’un ou l’autre des deux fournisseurs. Les chiffres de lancement de Hy3 ont suscité immédiatement des accusations de « benchmaxxing » dans le fil HN, et les propres tableaux de DeepSeek ne couvrent que les évaluations qu’il a choisi d’exécuter. Les chiffres de tierces parties ci-dessus sont ceux sur lesquels je m’appuierais, et ils disent ceci : Hy3 est un peu plus intelligent, et l’écart est suffisamment faible pour que le prix et le contexte puissent faire basculer la décision.

Tarification : le prix affiché est une distraction

Deux grilles tarifaires, vérifiées le 14 juillet 2026, et qu’il convient de conserver séparées. DeepSeek publie des prix exacts par jeton en première partie sur ses docs API. Tencent ne publie pas de grille tarifaire équivalente en anglais pour la version finale de Hy3 — son communiqué de presse indique un aperçu de Hy3 à l’entrée d’environ 0,18 $ par million de jetons sur TokenHub — donc la colonne Hy3 ci-dessous utilise les tarifs indiqués par OpenRouter, un prix de place de marché plutôt qu’un prix en première partie.

Par 1M tokensHy3 (OpenRouter marketplace)DeepSeek V4 Flash (first-party API)
Entrée$0.14$0.14 (cache miss)
Entrée, mise en cache$0.035$0.0028 (cache hit)
Sortie$0.58$0.28
DeepSeek official pricing table showing $0.0028 per 1M cached input tokens

Les prix d'entrée sont identiques. La décision se trouve dans les deux autres lignes.

Le multiplicateur de cache-hit

Le prix de cache-hit de DeepSeek est 50 fois moins cher que son prix de cache-miss, et 12,5 fois moins cher que le tarif mis en cache de Hy3 sur OpenRouter. (Notez que les deux tarifs de cache ne sont pas strictement équivalents — celui de DeepSeek est un prix d’API first-party, celui de Hy3 correspond à ce que les fournisseurs sous-jacents d’OpenRouter facturent pour les lectures de cache — mais ce sont les tarifs que vous paieriez réellement aujourd’hui.) Cela compte plus que n’importe quel autre chiffre sur cette page si vous exécutez des agents. Une boucle d’agent renvoie à chaque tour le même contexte croissant — prompt système, définitions d’outils, contenu des fichiers, historique de conversation. Dans une session de 40 tours, la grande majorité de vos jetons d’entrée sont des répétitions. Avec un taux de cache-hit de 90 %, le prix d’entrée effectif de Flash chute de 0,14 $ à environ 0,017 $ par million de jetons. Celui de Hy3 descend à environ 0,045 $ — toujours bon marché, mais près de 3 fois plus cher, et l’écart s’élargit à mesure que vos sessions s’allongent.

Les jetons de sortie sont là où Hy3 devient coûteux

Les deux sont des modèles de raisonnement, ce qui signifie que tous deux facturent leurs tokens de réflexion comme des sorties. Le tarif de sortie de Hy3 à 0,58 $ est plus du double de celui de Flash à 0,28 $, donc chaque chaîne de raisonnement prolongée coûte aux utilisateurs de Hy3 environ deux fois plus cher. Flash dispose aussi d’une soupape de sécurité dont Hy3 est dépourvu : passer en mode non-réflexion pour les tâches mécaniques (mise en forme, extraction, modifications simples) et arrêter de payer pour un raisonnement dont vous n’avez pas besoin. Le détail deepseek-v4-flash-vs-deepseek-v4-pro explique comment ce changement de mode fonctionne en pratique.

Le niveau gratuit

Un véritable avantage de Hy3 : OpenRouter répertorie une variante tencent/hy3:free à coût nul, limitée en débit mais réelle. Pour évaluer le modèle avant de s’engager, c’est mieux que Flash, qui n’a pas de niveau API gratuit. L’aperçu de Hy3 reste aussi affiché à $0.063/$0.21 — en dessous du prix de la version finale — si vous pouvez vous contenter du checkpoint d’avril.

La taxe de la fenêtre de contexte

Le contexte de 256K de Hy3 semble largement suffisant jusqu’à ce que vous exécutiez un agent sur une base de code réelle. Un utilisateur Reddit dans r/hermesagent, exécutant les deux modèles dans le même environnement, a qualifié Hy3 de « presque identique sauf pour la taille du contexte, donc compactage fréquent ». Le compactage est plus qu’un simple désagrément : chaque cycle de compactage consomme des tokens de sortie pour résumer, élimine des détails et invalide votre cache de prompt, ce qui signifie que vous payez le taux de cache-miss pour le reconstruire.

L’écart devient structurel si vous l’hébergez vous-même. La conception à attention clairsemée de l’architecture V4 (DeepSeek appelle ce mécanisme un lightning indexer) rend son cache KV considérablement plus léger que l’attention conventionnelle de Hy3. Il s’agit de retours d’utilisateurs individuels plutôt que de benchmarks, mais les chiffres dans le fil HN sont frappants : un commentateur exécutant les deux sur une paire de DGX Sparks a indiqué pouvoir faire tenir 3M de tokens de cache KV en plus de DeepSeek V4 Flash, contre environ 130K tokens avec Hy3 quantifié en FP4. Un autre a estimé qu’une fois que llama.cpp prendra pleinement en charge l’indexer, le contexte complet de 1M de Flash ne devrait nécessiter qu’environ 6 Go de RAM. Flash a également fait ses preuves face à une quantification agressive : plusieurs utilisateurs dans le même fil rapportent qu’il reste cohérent même en 2-bit, un résultat qui n’a pas encore été démontré pour Hy3.

Si votre cas d’usage reste bien en dessous de 200K tokens, cette section entière ne vous coûte rien, et les quatre points d’intelligence supplémentaires de Hy3 sont gratuits. Si ce n’est pas le cas, la taxe de contexte s’accroît : plus de compactage, plus d’invalidation du cache, plus de mémoire par session.

Rapports de terrain depuis le lancement

Le signal le plus utile que j’ai trouvé ne figure dans aucun tableau de benchmarks. C’est la différence de caractère que décrivent les développeurs lorsqu’ils exécutent les deux modèles dans des agents de codage.

Un utilisateur du même fil Hacker News, qui est passé à DeepSeek V4 Flash et Pro comme modèles principaux quotidiens après avoir annulé son abonnement Anthropic, puis a essayé Hy3, a décrit Flash ainsi : la vitesse est excellente, mais il « construit souvent un modèle mental complètement faux et s’engage à fond dans la mauvaise voie », nécessitant des corrections régulières et une compression de l’historique. Hy3, selon son expérience, « n’est pas aussi rapide, mais jusqu’à présent, il semble rester sur la bonne voie de manière beaucoup plus fiable » et se dégrade moins à mesure que le contexte s’allonge. D’autres personnes dans le même fil ont loué les connaissances générales et la qualité de la prose de Hy3, jugées meilleures que celles de Flash pour sa taille.

L’image de Reddit penche dans l’autre sens pour la production brute de code. Une comparaison sur une même tâche dans r/LLMDevs a classé « DeepSeek V4 Flash > Hy3 > GLM », tout en qualifiant Hy3 de « prometteur pour les workflows de codage pratiques ». Dans r/opencode, le sentiment récurrent est que Flash est « plus que suffisant » pour le travail quotidien des agents.

Il y a aussi un historique opérationnel à prendre en compte. La demande de lancement de Hy3 a dépassé la capacité de service de Tencent : des utilisateurs du fil HN ont signalé un fort rate limiting, et une personne qui suit le classement public d’utilisation d’OpenRouter a noté que le modèle est passé de la première place à la 8e–9e en l’espace d’un mois, attribuant directement cette baisse à ces limites. DeepSeek, en revanche, documente un plafond de 2 500 requêtes en concurrence pour Flash sur son API officielle — cinq fois ce qu’elle autorise pour V4 Pro. Pour le trafic en production, l’un de ces fournisseurs a publié des garanties de capacité et l’autre a un historique de congestion.

Comment choisir

  • Coding d’agent, sessions de moins d’environ 150K tokens : Hy3. Meilleure qualité de raisonnement, reste mieux concentré sur la tâche, et les coûts d’entrée correspondent au prix affiché de Flash. (150K plutôt que le plein 256K parce que le contexte de l’agent grossit vite, et qu’il faut de la marge avant que la compaction ne se déclenche.)
  • Longues sessions, grands dépôts, RAG sur de gros documents : Flash est généralement le meilleur choix. La fenêtre de 1M plus la remise de 50x sur le cache relèvent d’une autre catégorie de coûts, et la surcharge de compaction de Hy3 grignote son avantage en intelligence.
  • API de production à fort volume : Flash. Concurrence documentée de 2,500, historique de service stable, et mode non-thinking pour des appels en masse peu coûteux.
  • Rédaction, recherche, tâches de connaissance du monde : Hy3. Les retours de la communauté et les évaluations de connaissances AA l’avantage tous les deux à cette taille.
  • Déploiement local : Flash pour la plupart des matériels. L’efficacité de son cache KV et sa résilience à la quantification disposent de beaucoup plus de preuves de terrain ; les conseils de service de Tencent pour Hy3, cités dans le fil de lancement, parlent de huit GPU de classe H20.
  • Évaluer avant de s’engager : le niveau gratuit OpenRouter de Hy3 ne coûte rien à essayer. Faites passer vos propres tâches par ce modèle avant de croire le tableau de benchmarks de qui que ce soit, y compris celui-ci.

Où les exécuter

DeepSeek V4 Flash : l’API officielle fournit à la fois des endpoints au format OpenAI (api.deepseek.com) et au format Anthropic (api.deepseek.com/anthropic), ce qui signifie qu’elle s’intègre aux outils compatibles avec Claude avec un simple changement d’URL de base. Notez la date limite de migration sur cette même page de tarification : les anciens noms de modèles deepseek-chat et deepseek-reasoner seront obsolètes le 24 juillet 2026, et correspondent respectivement aux modes non-thinking et thinking de Flash. OpenRouter l’affiche à 0,09 $/0,18 $, légèrement en dessous du tarif officiel, mais sans la tarification du cache-hit de l’API officielle.

Hy3: Tencent Cloud TokenHub est la voie officielle. OpenRouter propose la version finale, le checkpoint de préversion moins cher et le niveau gratuit. SiliconFlow a proposé des offres de lancement. L’auto-hébergement fonctionne sous Apache 2.0 si vous disposez des GPU. Le guide de configuration de l’API Hy3 explique comment obtenir une clé et effectuer le premier appel.

FAQ

Hy3 est-il gratuit à utiliser ?

Partiellement. OpenRouter répertorie un niveau à limitation de débit tencent/hy3:free sans frais, et les produits grand public de Tencent (Yuanbao, ima) utilisent Hy3 gratuitement. L'accès API de production via TokenHub ou le niveau payant d'OpenRouter est facturé au jeton.

Hy3 est-il identique à Tencent Hunyuan ?

Oui — Hy3 est la troisième génération de la gamme de modèles Hunyuan de Tencent, que Tencent commercialise désormais sous le nom de « Tencent Hy ». La préversion a été lancée le 23 avril 2026, et la version finale le 6 juillet 2026.

Lequel est meilleur pour le codage, Hy3 ou DeepSeek V4 Flash ?

Les résultats de la communauté sont répartis selon la forme de la tâche. Dans les comparaisons Reddit pour une même tâche, la sortie brute de Flash a été classée au-dessus de celle de Hy3, tandis que les utilisateurs d’agents sur de longues sessions indiquent que Hy3 reste plus fiablement sur la bonne voie. Les tâches courtes et bien délimitées favorisent la rapidité de Flash ; les sessions d’agent de plusieurs heures, où un détour vous coûte cher, favorisent Hy3, tant que votre contexte reste confortablement à l’intérieur de sa fenêtre de 256K.

Puis-je exécuter DeepSeek V4 Flash localement ?

Oui, et plus concrètement que Hy3. Les poids sont sous licence MIT, le cache KV de l’architecture est exceptionnellement léger, et les utilisateurs signalent une qualité utilisable même avec une quantification sur 2 bits sur des machines disposant d’environ 96 Go de RAM.

Pourquoi la comparaison des prix entre hy3 et deepseek v4 flash est-elle si déroutante ?

Parce qu'il existe au moins quatre grilles tarifaires : Tencent TokenHub, les listes finales et de prévisualisation Hy3 d'OpenRouter, et l'API officielle de DeepSeek avec son taux de cache-hit distinct. Comparez le prix effectif pour votre propre schéma de trafic : l'entrée mise en cache domine les charges de travail des agents, et c'est là que le tarif de DeepSeek à 0,0028 $ est difficile à battre.

Conclusion

Hy3 est le modèle le plus performant selon les preuves tierces disponibles ; DeepSeek V4 Flash est le service le plus performant. Pour les charges de travail API en production, Flash est mon choix par défaut : ses économies de cache, sa fenêtre de contexte et sa concurrence publiée se combinent d’une manière qu’un avantage de quatre points au benchmark ne peut pas compenser. Optez pour Hy3 lorsque la qualité du raisonnement par prompt compte davantage que l’échelle — et essayez d’abord son offre gratuite, puisqu’il ne coûte rien de le tester sur vos propres tâches.

Lectures associées