Le prix affiché de Sonnet 5 est inférieur à celui de Sonnet 4.6 ($2/$10 introductory through Aug 31, 2026, vs. Sonnet 4.6's $3/$15), et le propre graphique de lancement d'Anthropic le qualifie d’« amélioration stricte » par rapport à Sonnet 4.6. Nous avons exécuté les deux modèles sur la même tâche à plusieurs niveaux d’effort pour voir ce que cela signifie en pratique. Résultat : lors de nos tests, Sonnet 5 a coûté plus que Sonnet 4.6 à chaque niveau d’effort essayé — et non moins. Voici ce que nous avons constaté et pourquoi.
Une tâche, exécutions uniques. Tout ce qui suit provient d’une seule tâche de codage, une exécution par configuration de modèle/effort. Considérez les chiffres spécifiques comme indicatifs, et non comme un benchmark moyenné statistiquement — l’invite exacte et un échantillon de la sortie API brute se trouvent dans l’annexe si vous souhaitez le reproduire sur votre propre charge de travail.
Sonnet 5 est-il vraiment moins cher que Sonnet 4.6 ? Nous l’avons testé.
Nous avons donné la même tâche aux deux modèles — construire un rate limiter token-bucket en Python avec des tests, exécuter les tests, corriger tout ce qui échoue — via l’interface Claude Code CLI (claude -p --model <id> --effort <level> --output-format json), de sorte que le coût et la durée proviennent directement de la réponse API. Exécuté le 2026-07-01.
Configuration | Coût | Durée | Tours | Résultat |
|---|---|---|---|---|
Sonnet 5, effort | $0.344 | 31.6s | 5 | 6/6 tests pass |
Sonnet 4.6, effort | $0.261 | 36.0s | 6 | 7/7 tests pass |
Sonnet 4.6, effort | $0.253 | 35.3s | 5 | 7/7 tests pass |
Sonnet 5, effort | $0.349 | 36.4s | 5 | 8/8 tests pass |
Sonnet 5 était plus rapide avec un effort medium, mais coûtait plus que Sonnet 4.6 dans les deux configurations de Sonnet 4.6 que nous avons testées — y compris Sonnet 4.6 exécuté avec un réglage d’effort plus faible. C’est l’inverse de certains témoignages anecdotiques de la communauté affirmant que Sonnet 5 devient moins cher que Sonnet 4.6 une fois qu’on compare des niveaux d’effort équivalents.
La cause probable : Sonnet 5 fonctionne avec un nouveau tokenizer. La documentation officielle d'Anthropic indique qu'il produit « environ 30 % de tokens en plus » que Sonnet 4.6 pour un même texte, et des tests indépendants menés par Simon Willison ont montré que le contenu en anglais, en particulier, pouvait aller jusqu'à ~1,4x plus de tokens. Le prix affiché plus bas de Sonnet 5 n'a pas entièrement compensé cela sur notre tâche de test, et après le 31 août 2026 — date à laquelle le tarif de lancement de Sonnet 5 expire et où les deux modèles passent au même tarif affiché de 3 $/15 $ — la différence de tokenizer à elle seule suggère que Sonnet 5 coûtera probablement plus cher pour un travail équivalent en anglais, et non pas autant, en l'absence de tout autre changement de tarification. (Répartition complète par langue dans notre guide tarifaire de Sonnet 5.)
Qu'est-ce qui a changé d'autre, au-delà du coût
Sur les benchmarks officiels, Sonnet 5 affiche de réels gains : 80.4% contre 67.0% sur Terminal-Bench 2.1, 63.2% contre 58.1% sur SWE-bench Pro, selon la fiche système de Claude Sonnet 5 d'Anthropic (voir notre tableau complet des benchmarks incluant Opus 4.8). Le graphique de l'annonce de lancement d'Anthropic décrit Sonnet 5 comme une « amélioration stricte » par rapport à Sonnet 4.6.
En examinant nos quatre propres sorties de test, une différence de comportement s’est démarquée et le tableau de benchmark ne capture pas : Sonnet 5 a ajouté des éléments que nous n’avions pas demandés. Aux deux niveaux d’effort, il a utilisé une horloge factice monkeypatchée dans les tests pour éviter de véritables appels à time.sleep(), et au niveau d’effort high il a ajouté la sécurité des threads au limiteur de débit sans qu’on le lui demande. Sonnet 4.6, aux deux niveaux d’effort, est resté plus proche de l’énoncé littéral de la tâche — en utilisant de véritables time.sleep() dans les tests, et au niveau d’effort medium il a ajouté un tableau récapitulatif pour la lisibilité, mais rien à l’implémentation réelle au-delà de ce qui était demandé.
Cela correspond aux retours d’utilisateurs réels publiés dès le premier jour du lancement de Sonnet 5 : un fil r/claude le décrivait comme « une amélioration objective par rapport à Sonnet 4.6 en termes de raisonnement... mais il semble aussi BEAUCOUP plus tendu que 4.6 ». Notre test est un échantillon d’une seule tâche, mais « ajoute plus facilement une portée non demandée » est une version concrète et précise de cette même observation.
Devriez-vous passer à la version supérieure ?
Mettez à niveau si votre charge de travail est principalement en chinois (le changement de tokenizer n’affecte presque pas le nombre de tokens en chinois), ou si vous effectuez un travail agentique/lourd en outils où les gains de Terminal-Bench et SWE-bench comptent plus qu’une légère augmentation des coûts.
Attendez si votre charge de travail est à grand volume et majoritairement en anglais, et que Sonnet 4.6 répond déjà à votre niveau de qualité — refaites vos propres calculs de coûts plutôt que de vous fier au prix affiché, surtout une fois que la période de tarification de lancement prendra fin le 31 août 2026.
Dans tous les cas, ne partez pas du principe que le modèle plus récent, qui semble moins cher, coûte automatiquement moins par tâche. Dans notre test, ce n’était pas le cas.
FAQ
Sonnet 5 est-il vraiment une « amélioration stricte » par rapport à Sonnet 4.6, comme le dit Anthropic ?
Sur les benchmarks de capacités publiés par Anthropic, oui — nous n’en avons trouvé aucun où Sonnet 4.6 est en tête. En coût par tâche, notre test a montré l’inverse une fois que l’on prend en compte le changement de tokenizer, donc l’« amélioration stricte » ne s’étend pas à l’efficacité en termes de coûts pour tous les workloads.
Pourquoi Sonnet 5 semble-t-il « plus sur le qui-vive » que Sonnet 4.6 ?
Anthropic n'a pas publié de précisions à ce sujet. D'après nos propres résultats de test, Sonnet 5 était plus enclin à ajouter des éléments hors périmètre demandés (thread-safety, une configuration de test-clock plus défensive) que Sonnet 4.6, qui restait plus proche de la demande littérale. Cela correspond — bien que de manière plus limitée — à la description de la communauté.
Sonnet 5 est-il désormais le modèle par défaut ? Puis-je toujours utiliser Sonnet 4.6 ?
Selon l'annonce de lancement d'Anthropic, Sonnet 5 a remplacé Sonnet 4.6 comme modèle par défaut pour les utilisateurs Free et Pro sur claude.ai. Les utilisateurs Max, Team et Enterprise, ainsi que les utilisateurs de l'API, peuvent toujours sélectionner directement Sonnet 4.6.
Dois-je comparer Sonnet 5 à Sonnet 4.6 ou à Opus 4.8 ?
Une décision complètement différente. Cette page concerne la mise à niveau générationnelle ; si vous hésitez spécifiquement entre Sonnet 5 et Opus 4.8, nous avons réalisé un ensemble distinct de tests en confrontation directe — voir Sonnet 5 vs Opus 4.8 : tests réels.
La affirmation selon laquelle « le niveau d'effort plus élevé est moins cher » que des gens publient en ligne est-elle réelle ?
Pas dans notre test. Nous avons exécuté Sonnet 5 à medium et high face à Sonnet 4.6 à low et medium, et Sonnet 5 a coûté plus cher pour chaque combinaison. Les rapports anecdotiques individuels varient selon la tâche — faites votre propre comparaison sur votre charge de travail réelle avant de supposer un croisement spécifique des niveaux d’effort.
Annexe : invite exacte et sortie brute
La tâche que nous avons envoyée aux deux modèles :
Implémentez un limiteur de débit token-bucket sous forme d’une classe Python `RateLimiter(capacity: int,
refill_rate: float)` avec une méthode `allow() -> bool` qui retourne si une requête
est autorisée maintenant, en consommant un jeton si c’est le cas. Utilisez une horloge monotone, sans
dépendances externes. Enregistrez-le dans limiter.py.
Puis écrivez test_limiter.py avec au moins 5 cas de test couvrant : une rafale jusqu’à la capacité
réussit puis bloque, les jetons se rechargent avec le temps (utilisez time.sleep ou une horloge mockable),
le taux de recharge est respecté (pas de recharge complète instantanée), la capacité n’est jamais dépassée,
et les capacités nulles/négatives sont gérées de manière raisonnable.
Exécutez les tests avec pytest et assurez-vous qu’ils passent tous. Si certains échouent, corrigez le code et
réexécutez jusqu’à ce qu’ils passent tous. Indiquez la sortie finale de pytest.
La réponse API réelle pour l’exécution de Sonnet 5 (medium), réduite aux champs pertinents pour le coût et le timing :
{
"duration_ms": 31616,
"num_turns": 5,
"stop_reason": "end_turn",
"total_cost_usd": 0.3438645,
"usage": {
"input_tokens": 4302,
"cache_creation_input_tokens": 60894,
"cache_read_input_tokens": 233420,
"output_tokens": 2172
}
}