AIREITER

Tarifs de l’API Claude 2026 : tous les modèles et comment payer moins

Dernière mise à jour: 2026-06-30 08:51:39

La tarification de Claude API varie de 1 $ par million de tokens (entrée Haiku 4.5) à 50 $ par million (sortie Fable 5) en juillet 2026, et pour chaque modèle actuel, la règle est la suivante : les tokens de sortie coûtent 5× les tokens d’entrée. Mais le prix affiché n’est que la partie facile. Un nouveau tokenizer, un routage limité aux États-Unis, le mode rapide et un piège de facturation que la plupart des gens ne remarquent jamais se situent tous entre le barème tarifaire et votre facture réelle — et il existe un moyen d’acheter les mêmes modèles pour une fraction du prix catalogue.

Chaque nombre ci-dessous figure sur la page de tarification officielle d’Anthropic ; vérifiez-la avant de finaliser un budget, car les tarifs des modèles évoluent.

Tarification de l'API Claude en 2026 : chaque modèle

Voici les tarifs actuels par million de tokens, vérifiés par rapport à la tarification d'Anthropic pour juillet 2026 (source officielle). Opus 4.8 a été lancé le 28 mai 2026 au même tarif que la version 4.7.

Modèle

Entrée / 1M

Sortie / 1M

Contexte

Claude Fable 5

$10.00

$50.00

1M

Claude Opus 4.8

$5.00

$25.00

1M

Claude Opus 4.7

$5.00

$25.00

1M

Claude Opus 4.6

$5.00

$25.00

1M

Claude Sonnet 4.6

$3.00

$15.00

1M

Claude Haiku 4.5

$1.00

$5.00

200K

Deux choses que beaucoup de guides plus anciens se trompent. Fable 5 — le modèle le plus performant d'Anthropic — se situe au-dessus du niveau Opus à $10/$50, et toute la gamme Opus 4.x (4.6, 4.7, 4.8) reste à $5/$25. Ces $5 racontent à eux seuls une histoire : Opus 4.1 coûtait $15/$75, et la baisse à $5/$25 lors du lancement de la 4.6 a été une réduction de 67% sur le modèle phare, qui s’est maintenue à travers trois versions depuis.

Options héritées et économiques

Si vous n’avez pas besoin des modèles les plus récents, les anciens sont toujours disponibles : Sonnet 4.5 ($3/$15), Opus 4.5 ($5/$25, 200K context), Haiku 3.5 ($0.80/$4), and Haiku 3 ($0.25/$1.25) pour les travaux à grand volume les plus sensibles aux coûts.

Un détail sous-estimé : Opus 4.6/4.7/4.8, Sonnet 4.6 et Fable 5 incluent tous la fenêtre de contexte complète de 1 M token au tarif standard — sans surtaxe pour le long contexte. Une requête de 900 K tokens coûte au même tarif par token qu’une requête de 9 K, alors que plusieurs concurrents appliquent un supplément au-delà d’un certain seuil de longueur.

Les coûts qui ne figurent pas sur l’étiquette de prix

Le tableau des tarifs est là où la plupart des articles sur la tarification s’arrêtent, et où les surprises commencent — car plusieurs éléments font évoluer votre facture réelle sans modifier le coût par jeton.

Le tokenizer qui ajoute discrètement des jetons

Opus 4.7 (et Opus 4.8, qui partage son tokenizer) a modifié la manière dont le texte est découpé en tokens. La même entrée peut produire jusqu’à ~35 % de tokens en plus que sur Opus 4.6 — à taux par token identique. Le code, les données structurées (JSON/XML) et le texte non anglais sont les plus touchés, car le taux n’a pas changé mais le nombre de tokens, lui, a changé. Ne prenez pas le chiffre de 35 % pour argent comptant : avant de vous fier à un ancien budget, réexécutez vos invites réelles via le token-counting endpoint sur le nouveau modèle et comparez.

Réflexion, mode rapide et routage réservé aux États-Unis

D’après les documents de tarification d’Anthropic :

  • Les jetons de réflexion étendue sont facturés comme des sorties, même lorsque vous ne les affichez jamais. Une requête à forte composante de raisonnement fait discrètement grimper la partie sortie de la facture.

  • Le mode rapide (Opus 4.8/4.7 uniquement) exécute le même modèle jusqu’à 2,5× plus vite à 2× le prix standard.

  • L’inférence réservée aux États-Unis (résidence des données) ajoute un multiplicateur de 1,1× sur les entrées et les sorties ; les points de terminaison régionaux AWS Bedrock ou Vertex ajoutent environ 10 % supplémentaires par-dessus.

Outils côté serveur

Les outils exécutés du côté d'Anthropic sont facturés séparément, selon la même documentation tarifaire : la recherche web coûte 10 $ par 1 000 recherches plus les jetons nécessaires pour traiter les résultats, et l'exécution de code est gratuite jusqu'à un quota mensuel, puis environ 0,05 $/heure par conteneur. (Vérifiez les chiffres actuels sur la page de tarification — les tarifs des outils serveur changent.)

Le piège de facturation qui prend au piège les utilisateurs de Claude Code

Celle-ci n’apparaît sur aucune carte tarifaire. Si vous avez ANTHROPIC_API_KEY défini dans votre shell, Claude Code facture via l’API au paiement à l’usage par jeton au lieu de votre abonnement. Des personnes s’attendant à un forfait de 20–200 $/mois ont été prises de court par des frais au compteur précisément pour cette raison. Vérifiez votre environnement avant une longue session.

Combien Claude vous coûtera-t-il réellement ?

Les tarifs signifient peu tant que vous ne les rapportez pas à une charge de travail. Trois exemples aux prix actuels, tous à 10 000 requêtes/jour (2 000 jetons d’entrée + 500 jetons de sortie chacun — 20 M de jetons d’entrée + 5 M de jetons de sortie/jour) :

  • Un chatbot de support sur Haiku 4.5 ($1/$5) : 20M × $1 + 5M × $5 = $45/jour, soit environ $1,350/mois.

  • Un agent de codage sur Sonnet 4.6 ($3/$15) : $60 + $75 = $135/jour, soit environ $4,050/mois avant optimisation.

  • Une application RAG à contexte élevé sur Opus 4.8 ($5/$25), où les documents récupérés augmentent fortement les entrées, grimpe jusqu’à des montants mensuels à quatre chiffres élevés ou à cinq chiffres parce que le volume d’entrées domine.

Même volume, trois modèles — le choix du modèle à lui seul fait varier la facture d’environ 3× entre Haiku et Sonnet.

Ce ne sont pas des plafonds hypothétiques. Un fil r/ClaudeAI a suivi 31 utilisateurs de Claude Code dont l’utilisation aurait coûté environ 80 000 $/mois aux tarifs de l’API, l’utilisateur le plus actif à lui seul près de 18 000 $ — une estimation de ce que l’utilisation de leur abonnement coûterait sur l’API facturée à l’usage, et non une facture littérale. Les charges de travail autonomes intensives sont là où la facture devient réelle, précisément là où les optimisations ci-dessous sont rentables.

Limites de taux et niveaux d’utilisation

Le prix n’est pas la seule contrainte — la vitesse à laquelle vous pouvez le dépenser est échelonnée. Les nouveaux comptes API commencent avec des limites prudentes de requêtes par minute (RPM) et de jetons par minute (TPM), qui augmentent automatiquement à mesure que votre compte vieillit et que vos dépenses cumulées augmentent (Niveau 1 → 4). Les nouveaux comptes reçoivent également 5 $ en crédits gratuits pour tester, sans carte requise. Au-delà du débit, Anthropic propose des niveaux de service qui arbitrent entre disponibilité et prix : un niveau standard (par défaut), un niveau prioritaire pour une disponibilité garantie, et un niveau batch pour la remise asynchrone de 50 % ci-dessous. Consultez la documentation sur les limites de débit pour connaître les chiffres exacts de votre niveau avant d’architecturer à grande échelle — un quota adapté au trafic pilote peut nécessiter une hausse de niveau pour la production.

Abonnement Claude vs API : lequel est moins cher ?

La question la plus courante dans le monde réel, et la réponse est un seuil, pas un verdict.

  • Claude Pro est à 20 $/mois ; Max est à 100 $ ou 200 $/mois. Ces offres couvrent les applications Claude et Claude Code dans le cadre d’une allocation d’utilisation — sans facturation au jeton.

  • L’API est entièrement en paiement à l’utilisation, sans minimum mensuel ni plafond d’utilisation.

Le point de bascule se situe dans les quelques millions de tokens par mois — environ 3 à 4 M sur un modèle de milieu de gamme (Sonnet), en supposant un équilibre entre entrées et sorties, et que vous resteriez sinon dans la limite d’utilisation de Pro. Il se décale vers le haut sur Haiku et vers le bas sur Opus, donc considérez-le comme une fourchette, pas comme une valeur fixe. En dessous de ce volume, un abonnement est généralement moins cher et plus simple. Au-delà — en particulier pour le trafic de production ou le codage agentique intensif — le tarif par token de l’API l’emporte, et vous gagnez un contrôle (limites de débit, suivi, facturation multi-clés) qu’un plan n’offre pas. Pour le codage toute la journée en particulier, les développeurs estiment qu’un plan Max peut être considérablement moins cher que le même travail facturé token par token sur Opus.

La règle pratique : prototypes et usage individuel → abonnement ; trafic d’un produit à grande échelle → API. Et attention au piège ANTHROPIC_API_KEY ci-dessus, sinon vous paierez dans les deux sens.

Comment payer moins pour l'API Claude

Trois leviers réduisent la facture standard sans changer de modèles.

1. Mise en cache des prompts (jusqu’à 90 % de réduction sur le contexte répété)

Cachez un préfixe stable — un long prompt système, des documents récupérés, des exemples few-shot — et les lectures du cache coûtent 0,1× le tarif d’entrée, soit une remise de 90 %. Le hic, c’est l’écriture : une écriture de cache de 5 minutes coûte 1,25× et est amortie après une lecture ; une écriture d’une heure coûte 2× et devient rentable après deux lectures. Pour tout ce qui comporte un long préambule fixe consulté à répétition, c’est le levier le plus puissant. (Documentation sur le caching.)

2. API Batch (50 % de réduction, dans les deux sens)

Pour tout ce qui n’a pas besoin d’une réponse en temps réel, le Batch API réduit les coûts d’entrée et de sortie de 50 % et renvoie une réponse sous 24 heures. Sonnet 4.6 passe à 1,50 $/7,50 $ ; Haiku 4.5 à 0,50 $/2,50 $. La mise en cache et le traitement par lots se cumulent, faisant chuter le coût effectif bien en dessous de la moitié du tarif affiché.

3. Routage des modèles et limites de sortie

Ne faites pas tourner chaque requête sur Opus. Acheminez la classification, la synthèse et la logique de routage vers Haiku, réservez Sonnet pour le milieu, et n’appelez Opus que lorsque la tâche en a besoin — souvent une réduction de 40 à 60 % à elle seule. Et comme la sortie coûte 5× le prix de l’entrée, limiter max_tokens est l’un de vos leviers les plus efficaces : réduire la sortie moyenne de 800 à 500 tokens sur un million d’appels permet d’économiser de l’argent réel chaque mois.

API officielle vs plateformes relais : pouvez-vous payer moins cher ?

Il existe une quatrième voie que la documentation officielle ne mentionnera pas : acheter les mêmes modèles Claude via un relais. Un relais API (ou agrégateur) se place entre vous et Anthropic, expose un endpoint compatible avec Anthropic et facture son propre tarif.

Pourquoi un relais peut-il être moins cher ? Trois mécanismes, principalement : les relais achètent à un volume d’engagement qui leur permet d’obtenir des remises qu’un compte individuel ne peut pas atteindre ; ils acheminent le trafic efficacement entre régions et fournisseurs ; et beaucoup fonctionnent avec des marges très faibles (ou à perte) pour séduire les développeurs. Mais une remise aussi importante doit bien venir de quelque part — comprenez le modèle d’une plateforme avant d’en dépendre.

Les remises varient considérablement. Voici comment trois options se comparent pour les mêmes modèles Claude :

Plateforme

Remise par rapport à la liste Anthropic

Couverture des modèles

Notes

API Anthropic officielle

— (référence)

Tous, y compris Fable 5 / Opus 4.8

Mise en cache, batch, toutes les fonctionnalités

OpenRouter

≈ liste (répercute le prix du fournisseur)

De nombreux modèles, multi-fournisseurs

Agrégateur ; la commodité avant les économies

EvoLink

~10% de réduction

Jusqu'à Opus 4.7

Point de terminaison compatible OpenAI

AIReiter

~80% de réduction

Jusqu'à Opus 4.6

Compatible Anthropic ; la mise en cache est répercutée

AIReiter se situe à l’extrémité agressive. Voici à quoi correspond le titre à ~80 % par modèle :

Modèle

Officiel (entrée / sortie)

AIReiter (entrée / sortie)

Vous économisez

Claude Haiku 4.5

$1 / $5

$0.20 / $1.00

80%

Claude Sonnet 4.6

$3 / $15

$0.60 / $3.00

80%

Claude Opus 4.6

$5 / $25

$1.00 / $5.00

80%

L'intégration est immédiate : l'endpoint d'AIReiter est compatible avec l'Anthropic Messages API, donc le SDK officiel anthropic fonctionne en changeant deux lignes — redirigez base_url vers https://aireiter.com/api et remplacez la clé :

client = anthropic.Anthropic(
    api_key="YOUR_AIREITER_KEY",
    base_url="https://aireiter.com/api",
)

Le streaming, les échanges multi-tours, la vision et cache_control sont tous pris en charge, donc la remise de 90 % sur la mise en cache mentionnée ci-dessus s’ajoute au tarif de base plus bas.

FAQ

Pourquoi l'API Claude est-elle si chère ?

Souvent, ce n’est pas le tarif par token — c’est la conception du workflow. Les principaux facteurs de coût sont d’exécuter tout sur Opus alors que Haiku ou Sonnet suffiraient, le contexte répété non mis en cache, la sortie non plafonnée, et les tokens de raisonnement pour lesquels vous êtes facturé mais que vous ne voyez jamais. Corriger cela compte généralement plus que le prix affiché.

Existe-t-il un niveau gratuit de l’API Claude ?

Pas de niveau de production gratuit permanent, mais les nouveaux comptes reçoivent 5 $ de crédits gratuits (aucune carte requise) pour effectuer des tests. Ensuite, la facturation est à l’utilisation.

Tarification de Claude API vs ChatGPT — laquelle est la moins chère ?

Cela dépend du niveau que vous comparez. En gros, par million de jetons (entrée / sortie) :

Claude

OpenAI comparable

Haiku 4.5 — $1 / $5

Niveau GPT mini — bas à un seul chiffre

Sonnet 4.6 — $3 / $15

niveau intermédiaire — comparable

Opus 4.8 — $5 / $25

GPT-5.5 — ~5 $ / 30 $

Comment calculer ma facture mensuelle Claude API ?

Estimez-le ainsi : (requests × avg input tokens ÷ 1,000,000 × input rate) + (requests × avg output tokens ÷ 1,000,000 × output rate). Utilisez le token-counting endpoint pour obtenir des comptes précis sur vos vrais prompts — un tokenizer générique peut s’écarter de 15 à 35 % sur Claude.

En résumé

Pour la plupart des équipes, il s'agit d'une répartition en trois voies : prototypage ou usage individuel → un abonnement Pro ou Max (plus simple, moins cher en dessous d'environ 3–4M tokens/mois) ; production sur le dernier modèle phare (Opus 4.8, Fable 5) → l'API officielle avec le caching, le batching et le routing activés ; production où Sonnet 4.6 ou Opus 4.6 suffit → un relais réputé comme AIReiter peut réduire la même facture jusqu'à 80 % avec un simple remplacement du SDK.

Quel que soit votre choix, la plupart des équipes paient trop cher en négligeant les optimisations, et non en choisissant le mauvais niveau — alors activez les leviers avant de vous soucier du tarif.