Quatre petites tâches de code et de raisonnement, avec les mêmes prompts et une exécution chacune. Les deux modèles les ont toutes réussies. Mais Opus 5 a produit 81, 94, 407 et 600 tokens de sortie, contre 36, 35, 103 et 206 pour Opus 4.8, alors que le tarif de sortie reste identique : 25 $ par million. Passer de Claude Opus 4.8 à Opus 5 ne se résume donc pas à modifier une ligne de modèle : la facture comme le comportement peuvent changer.
Ce n’est pas, d’après la documentation, une question de capacité brute. Sur Opus 5, le thinking est actif par défaut ; sur 4.8, il ne l’était pas. Une même requête paie donc désormais un raisonnement qui n’était auparavant pas facturé. Le paramètre qui fait bouger la facture n’est plus tant le modèle que effort. Si vous utilisez déjà claude-opus-4-8 en production, voici l’essentiel :
- Une incompatibilité API à traiter. Sur Opus 5, associer
thinking: {"type": "disabled"}à un effortxhighoumaxrenvoie une erreur 400. Opus 4.8 accepte cette combinaison. - Le prix unitaire ne change pas. Les deux modèles facturent 5 $ en entrée et 25 $ en sortie par million de tokens ; seule la quantité de tokens fait varier la dépense.
- Le thinking est activé par défaut.
max_tokensplafonne toujours le total thinking + réponse visible : des limites réglées pour 4.8 peuvent donc maintenant couper les réponses. - Vos prompts présentent davantage de risques que votre code. Les consignes demandant à 4.8 de vérifier son travail peuvent pousser Opus 5 à sur-vérifier.
- Aucun des deux modèles n’est déprécié. Tous deux sont indiqués Active ; rester sur 4.8 pendant votre prochain cycle de release est donc un choix défendable.
Les points à contrôler avant de changer de modèle
Le guide de migration d’Anthropic présente Opus 5 comme une « mise à niveau directe de Claude Opus 4.8 au même prix ». L’API évolue en effet très peu : claude-opus-5 est un identifiant fixe, sans suffixe de date, sur le même principe que claude-opus-4-8. Cinq éléments méritent toutefois un audit avant de basculer un flux de production.
1. thinking: {"type": "disabled"} avec un effort xhigh ou max renvoie une 400. Les changements de comportement officiels le classent comme une rupture par rapport à 4.8, où désactiver le thinking était indépendant de l’effort. La validation intervient sur chaque requête : augmenter l’effort au milieu d’une conversation sera donc refusé, même si les tours précédents ont fonctionné. 2. max_tokens doit désormais couvrir le thinking. Il reste un plafond strict sur toute la sortie, thinking et réponse inclus, de sorte qu’une tâche qui tournait sans thinking sur 4.8 avec max_tokens: 4096 conserve cette limite alors que le raisonnement y prélève désormais sa part. Anthropic recommande de partir de 64k avec xhigh ou max. 3. Les consignes de vérification peuvent devenir contre-productives. Opus 5 contrôle spontanément son propre travail. Le guide de prompting indique que des instructions comme « include a final verification step » entraînent une sur-vérification, et que leur suppression « réduit les tokens gaspillés sans perte de qualité ». Une utilisatrice de l’accès anticipé, Allie K. Miller, a rencontré le problème via le niveau d’effort : « I often default to 'high' reasoning effort... I had to switch it down to medium. » 4. Les skills et l’ossature de vos agents peuvent dériver sans aucune erreur API. Anthropic affirme qu’Opus 5 « fonctionne bien immédiatement avec les prompts existants de Claude Opus 4.8 ». Une équipe rapporte l’inverse : Dan Shipper d’Every a écrit le jour du lancement que « it breaks backward compatibility... It will often stop early or otherwise miss your instructions », et qu’ils avaient reconstruit leurs skills depuis zéro. Ce n’est que l’expérience d’une équipe, mais elle justifie de relancer vos évaluations : aucun log ne vous signalera ce problème. 5. Anthropic indique une date de fin des connaissances en mai 2026 pour Opus 5, contre janvier 2026 pour 4.8. Les prompts système qui codent en dur « your knowledge ends January 2026, defer to retrieved context » décrivent désormais le mauvais modèle ; tous les calculs de dates ancrés sur cette formulation changent donc aussi.
Un piège supplémentaire se cache derrière le premier point. Thinking désactivé, Opus 5 peut parfois écrire un appel d’outil dans son texte visible au lieu d’émettre un bloc tool_use, ou laisser fuir des balises XML internes. Dans une boucle agentique, ce texte reste dans l’historique et pollue les tours suivants. La solution proposée par Anthropic consiste à laisser le thinking activé et à réduire l’effort pour maîtriser les coûts.
La requête qui renvoie une 400, et les deux correctifs
Voici la combinaison rejetée, sous forme de diff à reprendre dans le corps de vos requêtes :
# Rejeté par claude-opus-5 avec HTTP 400. Accepté par claude-opus-4-8.
{
"model": "claude-opus-5",
"max_tokens": 16000,
"thinking": { "type": "disabled" },
"output_config": { "effort": "xhigh" }
}
# Correctif A — conserver l’effort xhigh et laisser le thinking s’exécuter. Augmenter max_tokens : le thinking y est comptabilisé.
{
"model": "claude-opus-5",
- "max_tokens": 16000,
+ "max_tokens": 65536,
- "thinking": { "type": "disabled" },
"output_config": { "effort": "xhigh" }
}
# Correctif B — garder le thinking désactivé et plafonner l’effort à high ou moins.
{
"model": "claude-opus-5",
"max_tokens": 16000,
"thinking": { "type": "disabled" },
- "output_config": { "effort": "xhigh" }
+ "output_config": { "effort": "high" }
}
Choisissez le correctif A pour les tâches agentiques, multi-fichiers ou très orientées outils, où une fuite d’appel d’outil est l’échec le plus coûteux. Le correctif B convient mieux aux endpoints sensibles à la latence et aux extractions au format strict, lorsque passer de xhigh à high coûte peu en qualité.
Ce que vous apporte réellement le passage à Opus 5
Lancé le 2026-07-24, Opus 5 ne modifie pas les deux chiffres que l’on regarde en premier dans toute comparaison Claude Opus 5 vs Opus 4.8 : 5 $/25 $ et une fenêtre de contexte de 1M tokens. Notre article sur le lancement et le détail des tarifs de Claude Opus 5 couvre cette sortie ; les différences pertinentes pour une migration sont plus resserrées.
Spécifications vérifiées le 25 juillet 2026 :
| Claude Opus 4.8 | Claude Opus 5 | Ce qui change pour vous | |
|---|---|---|---|
| Identifiant de modèle API | claude-opus-4-8 | claude-opus-5 | Une ligne à modifier |
| Prix par MTok | 5 $ / 25 $ | 5 $ / 25 $ | Rien |
| Contexte | 1M | 1M, par défaut et au maximum | Aucun niveau à activer |
| Échelle d’effort | jusqu’à xhigh, high par défaut | de low à max, high par défaut | Relancez vos tests selon l’effort |
| Thinking par défaut | désactivé sans demande explicite | activé, adaptatif | Revoir max_tokens |
| Désactivation du thinking | quel que soit l’effort | effort high ou inférieur | 400 au-dessus de high |
| Prompt minimum cachable | 1 024 tokens | 512 tokens | Les prompts courts sont désormais mis en cache |
| Fin des connaissances | janv. 2026 | mai 2026 | Mettre à jour la formulation |
Deux points s’ajoutent à ce tableau, dont un seul relève d’un benchmark :
- Les prompts courts deviennent cacheables. Le minimum tombe de 1 024 à 512 tokens. Un préfixe système de 600 tokens, non cacheable avec 4.8, est donc désormais facturé 0,50 $ par million lors des cache hits, contre 5 $ en entrée standard. En incluant l’écriture à 6,25 $ par million pour une entrée de 5 minutes, le préfixe doit être réutilisé avant de devenir rentable.
- Les gains de capacité restent uniquement déclarés par le fournisseur. L’annonce d’Anthropic donne des chiffres relatifs sans reproduction indépendante : Frontier-Bench v0.1 à « more than double » Opus 4.8, pour un coût inférieur par tâche, et CursorBench 3.2 à moins de 0,5 % du pic de Fable 5, pour la moitié du coût. Les faiblesses révélées sont plus instructives : la cybersécurité et la biologie restent derrière Mythos 5.
Nos quatre tâches ne disent rien de ce plafond de capacité : les deux modèles les ont toutes réussies. Sur des travaux aussi modestes, le gain de capacité est invisible, contrairement à la hausse de tokens.
Le calcul des coûts : même tarif, volume différent
Les deux modèles facturent 25 $ par million de tokens de sortie. À prix catalogue et sur un même canal, la question Claude Opus 5 vs Opus 4.8 se réduit donc au nombre de tokens produits pour une même tâche. Sur nos quatre tâches, Opus 5 en a généré 1 182, contre 380 pour Opus 4.8 : un ratio de 3,1x, soit environ 3,0 cents contre 0,95 cent.
Ce chiffre a trois limites :
- Une seule exécution par modèle et par tâche, le 2026-07-24. C’est un smoke test, pas un benchmark.
- Les paramètres par défaut des deux côtés : aucune valeur
effort, aucun champthinking, aucun prompt système. - Les seuls tokens de sortie, car la passerelle remontait des volumes de tokens de prompt très incohérents pour certaines familles de modèles. Les montants absolus sont négligeables ; seul le ratio est transposable.
La tendance n’est pas non plus uniforme. Deux tâches ont été rejouées via le canal first-party de Claude Code plutôt que par la passerelle :
| Exécution | Opus 5 | Opus 4.8 |
|---|---|---|
| Refactorisation, first-party | 429 tok | 220 tok |
| Correction de bug, first-party | 36 tok | 63 tok |
| Correction de bug, passerelle (graphique ci-dessus) | 81 tok | 36 tok |
Dans une de ces trois exécutions, Opus 5 a utilisé moins de tokens. Anthropic avance l’observation inverse au sommet de l’échelle, en citant un partenaire du secteur juridique qui aurait consommé en moyenne 26 % de tokens en moins au raisonnement maximal, sans méthodologie publiée.
Ces deux constats peuvent coexister. Le thinking actif par défaut et les réponses plus longues d’Opus 5 gonflent la sortie là où le raisonnement n’est qu’un surcoût. En revanche, sur des travaux multi-fichiers, ce même raisonnement peut remplacer des boucles de retry : les tokens par tâche terminée peuvent alors baisser, même si les tokens par appel montent. Aucun des deux jeux de données ne mesure directement ce phénomène. Budgétez donc sur votre propre coût par tâche acceptée, et considérez l’effort — pas le modèle — comme le levier principal :
- Réduisez d’abord l’effort. Anthropic indique que les niveaux
lowetmediumd’Opus 5 surpassent les mêmes réglages des précédents modèles Opus avec une fraction des tokens ;xhighreste le point de départ recommandé pour le code et les tâches agentiques. - Auditez les réglages hérités. Un
xhighconservé sur un endpoint de classification peut devenir la ligne la plus chère de votre facture sans aucun gain de qualité. - Si le coût reste élevé, remettez en cause la gamme. La comparaison Opus 5 face à Sonnet 5 à budget égal est l’option la moins chère.
Dans quels cas rester sur Opus 4.8 est le bon choix
Voici quatre situations où 4.8 l’emporte ce trimestre :
- Vous avez un engagement Priority Tier. Le guide de migration précise que le Priority Tier n’est pas pris en charge par Claude Opus 5, tandis qu’Opus 4.8 le conserve. Si vous avez acheté de la capacité réservée pour des garanties de latence, migrer revient à y renoncer : c’est une décision d’achat, non une décision d’ingénierie.
- Votre intégration doit fonctionner avec le thinking désactivé au-dessus de l’effort
high. Si vos évaluations nécessitent un raisonnementxhighet une sortie sans thinking, 4.8 est aujourd’hui le seul modèle qui combine les deux. - Vous avez des skills très finement réglés que vous ne pouvez pas retester pendant ce cycle. Une voie 4.8 figée vaut mieux qu’une migration inachevée vers Opus 5 avec des prompts écrits pour un autre modèle.
- Vous subissez une pression sur les coûts et utilisez un relais. Des passerelles tierces compatibles OpenAI appliquent de fortes remises aux anciens modèles : la liste des modèles Anthropic d’AIReiter affiche Opus 4.8 à 1,56 $/7,76 $ par million de tokens, soit environ 69 % sous le tarif catalogue, et n’a pas encore ajouté
claude-opus-5. La parité de prix ne tient plus selon le canal d’accès ; lorsqu’Opus 4.8 passe déjà les tests, le modèle correct le moins cher est le meilleur choix. Notre guide du meilleur modèle Claude pour le code compare toute la gamme tâche par tâche.
La crainte d’un retrait imminent n’en fait pas partie. Au 25 juillet 2026, la page des dépréciations de modèles d’Anthropic classait les deux modèles comme Active, et non Deprecated. Aucun n’a donc de date de retrait planifiée ; les dates les plus précoces, à titre indicatif, sont le 28 mai 2027 pour 4.8 et le 24 juillet 2027 pour Opus 5.
Un déploiement progressif qui préserve le retour arrière
1. Figez d’abord une référence sur 4.8. Sur 20 à 50 requêtes réelles, consignez les tokens de sortie, la latence et le taux de réussite afin d’obtenir un plancher ; prévoyez davantage de requêtes pour les tâches agentiques très variables, y compris celles que 4.8 échoue déjà. Sans cet historique, une régression ressemble à une simple différence. 2. Faites un grep avant le déploiement. Recherchez "disabled" près de effort, les valeurs max_tokens sous 16k, ainsi que les chaînes « verify », « double-check » et « January 2026 » dans les prompts système. Ces quatre recherches couvrent la rupture explicite et trois changements silencieux. 3. Ouvrez une voie, pas un basculement global. Dirigez une fraction du trafic vers claude-opus-5, avec l’identifiant de modèle placé dans la configuration plutôt qu’éparpillé dans le code. Le retour arrière devient alors un changement de configuration, pas un déploiement. 4. Définissez des seuils de promotion chiffrés avant d’ouvrir cette voie. Le taux de réussite doit atteindre au moins la référence 4.8 ; la validité des schémas et le respect des appels d’outils doivent aussi l’atteindre ; le coût par tâche acceptée doit rester sous un plafond défini à l’avance ; la latence p95 doit respecter votre SLO ; le taux d’erreurs 400 doit être nul. Si un seul critère échoue, repassez la configuration à claude-opus-4-8. 5. Journalisez séparément le modèle demandé et le modèle retourné. Une fois le fallback côté serveur activé, les classificateurs cybersécurité d’Opus 5 peuvent rediriger les requêtes refusées vers Opus 4.8. Une exécution affichée comme Opus 5 dans votre tableau de bord peut donc avoir été traitée par 4.8.
Pour la plupart des équipes, la décision Claude Opus 5 vs Opus 4.8 se résout ainsi : migrez, dans cet ordre, sur un cycle de release, et ne promouvez que ce qui franchit les seuils de l’étape 4 face à votre référence 4.8. Dès le premier jour, retirez les prompts de vérification hérités, comme le recommande le guide d’Anthropic : c’est là que la hausse des tokens se transforme en facture.
FAQ
Claude Opus 5 remplace-t-il directement Opus 4.8 ?
Le guide de migration d’Anthropic le décrit comme une mise à niveau directe au même prix, ce qui est vrai à l’échelle de l’API : même fenêtre de contexte, même plafond de sortie de 128k, une seule rupture à auditer. Ce n’est pas le cas au niveau des prompts. Les instructions de vérification, les valeurs d’effort par défaut, les limites max_tokens et les définitions de skills réglées pour 4.8 doivent toutes être revues, sans qu’aucune erreur ne les signale.
Pourquoi ma requête Opus 5 renvoie-t-elle une erreur 400 ?
Le cas le plus probable est l’envoi de thinking: {"type": "disabled"} avec un effort xhigh ou max, combinaison qu’Opus 5 refuse à chaque requête. Retirez soit le champ thinking en conservant le niveau d’effort, soit gardez le thinking désactivé mais réduisez l’effort à high ou moins. Des valeurs non par défaut de temperature, top_p ou top_k renvoient également une 400 sur tous les modèles Claude à partir de 4.7.
Claude Opus 4.8 va-t-il être arrêté ?
Non. La page de dépréciation d’Anthropic liste claude-opus-4-8 comme Active, avec une date de retrait la plus précoce envisagée au 28 mai 2027 et une politique de préavis d’au moins 60 jours pour les modèles publiés. Il reste aussi la cible de fallback lors des refus d’Opus 5 dans la catégorie cyber, et conserve la prise en charge du Priority Tier dont Opus 5 ne dispose pas.
Quel modèle Claude Opus est actuellement le meilleur ?
Claude Opus 5, selon les chiffres déclarés par Anthropic et les premiers retours de développeurs, avec les gains les plus nets en code agentique et sur les tâches de longue durée. Opus 4.8 reste préférable pour les charges Priority Tier, les intégrations qui exigent le thinking désactivé avec un effort supérieur à high, et les piles de prompts que vous ne pouvez pas encore réétalonner.
Comment passer à Opus 5 dans Claude Code et les applications Claude ?
Opus 5 est le nouveau modèle par défaut de Claude Max et le modèle le plus puissant sur Claude Pro. Il est également sélectionnable dans Claude Code, Claude Cowork, claude.ai, Amazon Bedrock sous anthropic.claude-opus-5, Google Cloud et Microsoft Foundry.
Dans Claude Code, l’effort par défaut est high. La profondeur de raisonnement se règle désormais via l’effort plutôt qu’avec un commutateur manuel d’extended thinking. Opus 4.8 reste sélectionnable sur ces interfaces, ce qui permet de revenir en arrière sans toucher au code API.
Claude Opus 5 coûte-t-il plus cher qu’Opus 4.8 ?
Pas par token : les deux modèles coûtent 5 $ en entrée et 25 $ en sortie par million, 2,50 $/12,50 $ via la Batch API, et 0,50 $ par million lors des cache hits. En revanche, notre test à une seule exécution montre qu’Opus 5 produit environ 3x plus de tokens de sortie par tâche : à tarif catalogue identique, la facture peut donc augmenter. Le mode Fast à 10 $/50 $, pour une vitesse environ 2,5x supérieure, est réservé à Claude API.
