Nouveautés de Claude Haiku 5.5
Anthropic a publié Claude Haiku 5.5 le 7 octobre 2026, un an après Haiku 4.5. Le prix a baissé de 90 % pour les prompts courts et le modèle s'est nettement rapproché de Sonnet.
Le premier Haiku avec contrôle de l'effort
Haiku 5.5 utilise la réflexion adaptative et cinq niveaux d'effort : low, medium, high, xhigh et max. La valeur par défaut est medium. Les modèles Haiku précédents ne proposaient aucun paramètre d'effort.
1M de contexte et 128K en sortie
La fenêtre de contexte passe de 200K tokens sur Haiku 4.5 à 1M, et la sortie maximale de 64K à 128K. Il accepte le texte et les images en entrée. La date limite des connaissances est juin 2026.
Une avancée majeure sur les tâches d'agent et de bureautique
Au niveau d'effort maximal (max), Anthropic rapporte un score de 72,4 % sur OSWorld 2.1 (Haiku 4.5 : 15,7 %) et un Elo GDPval-AA de 1620 (Haiku 4.5 : 735). Sonnet 5.5 reste en tête sur tous les benchmarks publiés par Anthropic.
Score indépendant
Artificial Analysis attribue à Haiku 5.5 un score de 43 sur son Intelligence Index au niveau d'effort maximal, contre 17 pour Haiku 4.5, et 34 avec l'effort par défaut (medium).
Claude Haiku 5.5 vs Haiku 4.5 vs Sonnet 5.5
Tous ces modèles fonctionnent avec la même clé AIReiter, le changement se faisant simplement via le champ model.
Haiku 5.5 vs Haiku 4.5
Haiku 4.5 est affiché à 1 $ en entrée et 5 $ en sortie par million de tokens. Haiku 5.5 est affiché à 0,10 $ et 0,50 $ pour les prompts jusqu'à 100K tokens. Anthropic estime que les charges de travail réelles coûtent environ 75 % de moins après prise en compte du nouveau tokenizer, qui génère environ 30 % de tokens supplémentaires pour le même texte.
Haiku 5.5 vs Sonnet 5.5
Sonnet 5.5 est à 1,00 $ en entrée et 5,00 $ en sortie par million de tokens ici, soit vingt fois le tarif de base de Haiku 5.5. Anthropic recommande toujours Sonnet 5.5 ou Opus 5.5 pour le code complexe. Utilisez Haiku 5.5 pour la classification, l'extraction, les résumés, le routage et les étapes de sous-agents.
Haiku 5.5 vs GPT-6 Luna
Les deux affichent un tarif de 0,10 $ en entrée et 0,50 $ en sortie. Anthropic indique que Haiku 5.5 est en tête sur OSWorld 2.1 (72,4 % contre 48,9 %) et GDPval-AA (1620 contre 1437). Artificial Analysis note que Haiku 5.5 consomme plus de tokens de sortie que Luna pour atteindre des scores similaires ; comparez donc sur vos propres tâches.
Tarifs de l'API Claude Haiku 5.5 sur AIReiter
Chaque ligne est facturée à 50 % du tarif public d'Anthropic. Le tarif appliqué dépend du nombre de tokens en entrée envoyés dans une requête.
Jusqu'à 100K tokens en entrée
Entrée 0,05 $ (tarif public 0,10 $). Sortie 0,25 $ (tarif public 0,50 $). Lecture du cache 0,005 $ (tarif public 0,01 $). Écriture dans le cache 0,0625 $ (tarif public 0,125 $). Tous les prix sont par million de tokens.
Plus de 100K tokens en entrée : tous les tarifs x5
Entrée 0,25 $ (tarif public 0,50 $). Sortie 1,25 $ (tarif public 2,50 $). Lecture du cache 0,025 $ (tarif public 0,05 $). Écriture dans le cache 0,3125 $ (tarif public 0,625 $). Le palier est déterminé par requête selon le volume total d'entrée, y compris les tokens en cache, et s'applique à l'intégralité de la requête.
Deux appels réels
50K tokens en entrée plus 5K en sortie coûtent ici 0,00375 $ (0,0075 $ au tarif public). 200K tokens en entrée plus 10K en sortie basculent dans le palier de contexte long et coûtent 0,0625 $ ici (0,125 $ au tarif public). Si vous pouvez découper une tâche volumineuse en requêtes de moins de 100K, le coût est divisé par cinq.
Facturé selon les tokens réellement utilisés
Une estimation est provisionnée au début de l'appel, puis ajustée sur le nombre réel de tokens à la fin de la réponse, et la différence est remboursée. Les tokens de réflexion sont facturés comme de la sortie.
Migration depuis Haiku 4.5 : ce qui renvoie désormais une erreur
Changer la chaîne du modèle pour claude-haiku-5-5 ne suffit pas toujours. Ces formats de requête fonctionnaient sur Haiku 4.5 et sont rejetés sur Haiku 5.5.
Supprimer temperature, top_p et top_k
Les valeurs d'échantillonnage non définies par défaut renvoient une erreur 400 avec « deprecated for this model ». Supprimez ces champs et orientez la sortie à l'aide du prompt et du niveau d'effort.
Aucun préremplissage de l'assistant
Une conversation qui se termine par un message de l'assistant renvoie une erreur 400. Le dernier message doit provenir de l'utilisateur. Pour forcer un format, utilisez des sorties structurées ou indiquez-le dans le prompt.
Remplacer les budgets de réflexion par effort
L'API d'Anthropic rejette thinking: {"type": "enabled", "budget_tokens": N} sur ce modèle, supprimez-le donc et définissez plutôt output_config.effort. Les tokens de réflexion sont toujours décomptés de max_tokens, augmentez donc max_tokens si les réponses sont coupées.
Désactiver le thinking plafonne l'effort à high
thinking: {"type": "disabled"} fonctionne avec les efforts low, medium et high. Avec xhigh ou max, il renvoie une erreur 400. Le mode de réflexion between_tools utilisé sur Sonnet 5.5 n'est pas pris en charge sur Haiku 5.5. Le paramètre forcé tool_choice fonctionne toujours.
Choisissez le niveau d'effort avant de déployer
L'effort est le levier principal pour ajuster la qualité, la latence et le coût. Sur Haiku 5.5, l'écart entre les niveaux est important.
Les scores phares sont au niveau d'effort max
Les chiffres de lancement d'Anthropic utilisent l'effort max. Avec l'effort medium par défaut, Anthropic indique un score Elo GDPval-AA de 1277 au lieu de 1620. Lisez les affirmations des benchmarks en gardant à l'esprit le niveau d'effort.
max est gourmand en tokens
Artificial Analysis a mesuré environ 162K tokens de sortie par tâche Intelligence Index au niveau d'effort max, soit environ trois fois plus que GPT-6 Luna au niveau max. Au niveau medium, il a mesuré environ 137 tokens de sortie par seconde.
Commencer par low ou medium
Pour la classification, l'extraction et le routage, low ou medium avec le thinking désactivé permet de réduire la latence et les coûts. N'augmentez le niveau que pour les tâches où la qualité est insuffisante.
Comment appeler l'API Claude Haiku 5.5
Le point de terminaison utilise le protocole Messages d'Anthropic, de sorte qu'un client Claude existant n'a besoin que d'une nouvelle URL de base et d'une nouvelle clé.
Obtenez une clé et pointez le client vers AIReiter
Créez une clé API dans votre tableau de bord AIReiter. Dans les SDK officiels d'Anthropic, définissez l'URL de base sur https://aireiter.com/api — le SDK ajoute /v1/messages automatiquement.
Envoyez une requête avec curl
curl https://aireiter.com/api/v1/messages \ -H "x-api-key: $AIREITER_API_KEY" \ -H "anthropic-version: 2023-06-01" \ -H "content-type: application/json" \ -d '{ "model": "claude-haiku-5-5", "max_tokens": 4096, "output_config": {"effort": "low"}, "messages": [{"role": "user", "content": "Hello"}] }'
Ou utilisez le SDK Python
from anthropic import Anthropic client = Anthropic(api_key="YOUR_AIREITER_KEY", base_url="https://aireiter.com/api") msg = client.messages.create( model="claude-haiku-5-5", max_tokens=4096, messages=[{"role": "user", "content": "Hello"}], ) print(next(b.text for b in msg.content if b.type == "text"))
FAQ de l'API Claude Haiku 5.5
/ 01Quand Claude Haiku 5.5 est-il sorti et quel est l'identifiant du modèle ?
Anthropic l'a lancé le 7 octobre 2026. L'ID du modèle dans l'API est claude-haiku-5-5 et sa date limite de connaissances est juin 2026. Anthropic précise qu'il ne sera pas retiré avant le 7 octobre 2027.
/ 02Quelle est la fenêtre de contexte et la sortie maximale ?
Une fenêtre de contexte de 1M de tokens et jusqu'à 128K tokens de sortie par requête. Il accepte du texte et des images en entrée et renvoie du texte.
/ 03Combien coûte l'API Claude Haiku 5.5 ?
Anthropic indique 0,10 $ en entrée et 0,50 $ en sortie par million de tokens pour les requêtes allant jusqu'à 100K tokens en entrée, et cinq fois plus au-delà de 100K. AIReiter facture la moitié : 0,05 $ et 0,25 $, ou 0,25 $ et 1,25 $ au-delà de 100K.
/ 04Pourquoi une requête a-t-elle coûté cinq fois plus cher ?
Son total en entrée a dépassé 100K tokens, l'intégralité de la requête a donc été facturée au tarif de contexte long. Les tokens mis en cache sont également pris en compte dans la limite des 100K.
/ 05Pourquoi mes réponses commencent-elles par un bloc thinking ?
Le thinking adaptatif est activé par défaut, la réponse peut donc contenir un bloc thinking avant le texte. Lisez les blocs de contenu par type au lieu d'utiliser content[0], ou désactivez le thinking avec un effort low, medium ou high.
/ 06Haiku 5.5 est-il assez performant pour le code ?
Pour des modifications simples et bien ciblées ainsi que des étapes de sous-agents, souvent oui. Pour des tâches complexes multi-fichiers, Anthropic recommande Sonnet 5.5 ou Opus 5.5, tous deux disponibles avec la même clé.
/ 07Ai-je besoin d'un compte Anthropic ?
Non. Une clé AIReiter fonctionne avec l'endpoint AIReiter, et vous pouvez tester le modèle dans le playground sur cette page avant d'écrire la moindre ligne de code.
/ 08Quelles API sont prises en charge ?
Anthropic Messages à l'adresse /api/v1/messages constitue le contrat principal, avec streaming. Les Chat Completions de style OpenAI et l'API Responses sont également prises en charge, et /api/v1/models liste les modèles disponibles pour votre clé.