AIREITER

Tarifs de l’API Claude Haiku 5.5 : le piège des 100 000 tokens

Dernière mise à jour: 2026-10-07 19:02:52

Claude Haiku 5.5 paraît être un modèle peu coûteux et facile à budgéter… jusqu’à ce qu’une requête dépasse 100 000 tokens en entrée. Sous ce seuil, Anthropic facture 0,10 $ par million de tokens en entrée et 0,50 $ par million de tokens en sortie. Au-delà, les tarifs passent respectivement à 0,50 $ et 2,50 $. Cette multiplication par cinq du coût d’entrée est le chiffre à intégrer dans un budget de production, bien plus que les promesses mises en avant lors du lancement.

Les tarifs de l’API Claude Haiku 5.5 en un coup d’œil

La grille tarifaire directe de l’API distingue les requêtes selon la taille du prompt d’entrée, en dollars par million de tokens. Ce tableau s’appuie sur la tarification de la plateforme Claude et l’annonce de lancement de Haiku 5.5 publiée par Anthropic ; les tarifs appliqués par les marketplaces peuvent différer.

Le seuil des 100 000 tokens est le vrai point de bascule

Le seuil dépend de la taille du prompt envoyé avec la requête. Il ne s’agit pas d’une surcharge générale appliquée simplement parce que le modèle dispose d’une grande fenêtre de contexte. Une requête de 90 000 tokens en entrée et 2 000 tokens en sortie reste dans le palier inférieur ; une requête de 120 000 tokens en entrée passe aux tarifs supérieurs prévus pour les longs prompts, aussi bien pour l’entrée que pour la sortie.

Pour une requête simple de 10 000 tokens en entrée et 500 tokens en sortie, le calcul dans le palier inférieur est le suivant :

(10,000 x $0.10 + 500 x $0.50) / 1,000,000 = $0.00035

À raison de 10 000 requêtes identiques, la facture atteint donc 3,50 $, hors coûts liés aux outils, à la plateforme ou aux nouvelles tentatives. Pour illustrer le changement de palier avec un prompt long valide, une requête de 120 000 tokens en entrée et 500 tokens en sortie coûte :

(120,000 x $0.50 + 500 x $2.50) / 1,000,000 = $0.06125

Soit 612,50 $ pour 10 000 requêtes de ce type. Il faut comptabiliser l’intégralité des données envoyées à l’API, et pas uniquement la question visible à l’écran.

Dans son annonce officielle sur Reddit, Anthropic indique que les requêtes jusqu’à 100K tokens sont environ 90 % moins chères que celles de Haiku 4.5, tandis que celles dépassant 100K tokens sont environ 50 % moins chères. Ces chiffres restent des annonces relatives liées au lancement, pas une garantie valable pour tous les usages : les nouvelles tentatives, la longueur des sorties, le comportement du tokenizer et les échecs de cache peuvent encore modifier la facture.

Le cache et Batch modifient le tarif réellement payé

La mise en cache des prompts devient particulièrement intéressante lorsqu’une application renvoie régulièrement les mêmes instructions ou le même socle de connaissances. Avec Haiku 5.5, l’écriture dans le cache pendant cinq minutes coûte 1,25 fois le tarif d’entrée standard, tandis qu’une lecture du cache revient à un dixième du tarif d’entrée standard. Les mêmes ratios s’appliquent au palier supérieur.

OpérationJusqu’à 100KAu-delà de 100K
Premier million de tokens écrit dans le cache de cinq minutes$0.125$0.625
Chaque million de tokens mis en cache lu$0.01$0.05
Chaque million de tokens en entrée avec Batch$0.05$0.25
Chaque million de tokens en sortie avec Batch$0.25$1.25

Un cache de cinq minutes devient généralement rentable après environ deux lectures, car le surcoût d’écriture est rapidement amorti. Par exemple, un préfixe d’un million de tokens coûte 0,125 $ à l’écriture puis 0,01 $ à chaque lecture, contre 0,20 $ pour deux lectures sans cache, hors sortie. Le cache d’une heure est facturé deux fois le tarif d’entrée de base : il lui faut donc davantage de lectures répétées pour devenir rentable. Le résultat exact dépend de la persistance de la clé de cache et du maintien de la requête dans le même palier tarifaire.

L’API Batch divise par deux les tarifs d’entrée et de sortie pour les traitements asynchrones, comme l’enrichissement nocturne, la classification en masse, les backfills ou les campagnes d’évaluation. Elle ne remplace pas le chat synchrone : le compromis se fait sur la latence. Si votre architecture prend en charge les deux modes, vous pouvez combiner Batch et le cache ; vérifiez toutefois les champs finaux de usage au lieu de supposer que chaque requête a bénéficié du cache.

Le signal opérationnel à journaliser est cache_read_input_tokens, un champ documenté dans le schéma d’utilisation de l’API Messages d’Anthropic. S’il reste à zéro après la première requête, examinez l’ordre du prompt, les horodatages, la sérialisation des outils et l’emplacement de la directive de contrôle du cache. Un modèle moins cher avec un cache constamment froid peut coûter plus cher qu’une route correctement mise en cache avec un tarif nominal supérieur.

Haiku 5.5 face aux anciens Haiku et à Sonnet

La comparaison ci-dessous reprend les tarifs directs publiés avant Haiku 5.5. Les prix de Haiku 4.5 servent de référence ; ils ne signifient pas que tous les fournisseurs appliquent exactement la même grille.

ModèleEntrée / MTokSortie / MTokLecture côté budget
Claude Haiku 5.5, <=100K$0.10$0.50Traitements à fort volume et sorties courtes
Claude Haiku 5.5, >100K$0.50$2.50Prompts longs lorsque la qualité justifie ce palier
Claude Haiku 4.5$1.00$5.00Intégrations existantes nécessitant une référence connue
Claude Sonnet 5.5$2.00$10.00Tâches de production plus exigeantes

Haiku 5.5 est le premier modèle à tester pour générer des titres, classifier, extraire des informations, router des requêtes, produire de courts résumés et traiter d’autres appels de workers à fort volume. Un utilisateur de Reddit décrit les usages de type Haiku comme des « high-volume, low-complexity tasks », par exemple créer le titre d’une conversation ou extraire les noms de logiciels d’un texte (u/jam_pod_). C’est une cible plus pertinente que d’en faire systématiquement le remplaçant d’un modèle plus puissant à chaque étape d’un agent.

Ne choisissez pas uniquement en fonction du prix au token. Si Haiku nécessite une seconde tentative pour la moitié de vos requêtes, alors que Sonnet produit un résultat accepté dès le premier essai, l’écart tarifaire théorique de deux pour un peut disparaître. Avant de basculer du trafic en production, mesurez sur un échantillon représentatif les tokens facturés en entrée et en sortie, les nouvelles tentatives et les résultats acceptés.

La règle de calcul à appliquer en production

Avant de miser sur Haiku 5.5, suivez cette séquence :

  1. Faites passer le prompt réel dans la documentation de comptage des tokens d’Anthropic, en incluant les outils, les documents récupérés et l’historique de la conversation.
  2. Répartissez le trafic entre les requêtes d’entrée <=100K et >100K ; ne mélangez pas les deux paliers dans une moyenne.
  3. Estimez séparément la sortie. Une entrée courte accompagnée d’une réponse générée longue peut être dominée par le coût de sortie.
  4. Placez les préfixes stables derrière le contrôle du cache et déclenchez une alerte lorsque les lectures du cache tombent à zéro.
  5. Envoyez via l’API Batch les traitements qui peuvent attendre et gardez le routage synchrone pour les requêtes interactives.
  6. Comparez Haiku 5.5 et Sonnet 5.5 selon le coût par résultat accepté, et non selon le coût par million de tokens.

Cette méthode permet aussi de gérer la principale incertitude des données disponibles au lancement : les tarifs officiels et la disponibilité sont clairs, mais les mesures indépendantes de latence, de taux d’échec et de qualité sur les longs contextes ne sont pas encore établies. La discussion Reddit pose la même question, très directement : « What does ‘prompts up to 100k’ mean? » (u/ShadowBannedAugustus). Pour une équipe de production, cette question doit être tranchée par un test de facturation, pas par une supposition.

FAQ sur l’API Claude Haiku 5.5

Quel est l’identifiant du modèle Claude Haiku 5.5 pour l’API ?

Utilisez claude-haiku-5-5 comme alias actuel, conformément aux notes de version de Claude Code d’Anthropic. Lorsque le routage reproductible est important, vérifiez l’identifiant du snapshot dans la documentation des modèles de l’API.

Combien coûte une requête Haiku 5.5 de 100K tokens ?

Pour 100 000 tokens en entrée et aucune sortie, le coût d’entrée dans le palier inférieur est de 0,01 $. La sortie est facturée séparément, à raison de 0,50 $ par million de tokens dans ce même palier ; le palier supérieur s’applique lorsque le prompt dépasse le seuil indiqué dans la documentation.

Haiku 5.5 est-il inclus dans Claude Pro ou Max ?

Un abonnement Claude et l’utilisation de l’API Claude sont deux produits facturés séparément, comme l’indique la tarification de la plateforme Claude d’Anthropic. Pour le trafic programmatique, référez-vous à la grille tarifaire de l’API.

Le tarif Batch se cumule-t-il avec la mise en cache des prompts ?

La documentation tarifaire d’Anthropic présente Batch comme une remise de 50 % sur les coûts de tokens éligibles, tandis que la comptabilisation des tokens mis en cache reste distincte. Vérifiez les champs finaux de usage pour votre route, car l’éligibilité au cache et la prise en charge peuvent varier selon le fournisseur.

Haiku 5.5 est-il moins cher que Haiku 4.5 pour toutes les requêtes ?

Avec les tarifs directs publiés, Haiku 5.5 est moins cher dans les deux paliers d’entrée. L’économie réelle peut toutefois diminuer avec les nouvelles tentatives, les sorties plus longues, les échecs de cache ou les workloads qui nécessitent un modèle plus puissant pour aboutir correctement.