Entre Claude Fable 5 high et max, le choix est plus simple qu’il n’y paraît : gardez high dans presque tous les cas, passez à xhigh pour le code complexe et les flux agentiques, et ne considérez max qu’en dernier recours. Sur la plupart des tâches, max coûte environ deux fois plus cher pour un gain de qualité difficile à quantifier — et peut même pousser le modèle à trop réfléchir. Le détail souvent oublié : xhigh existe entre high et max, et c’est généralement la bonne réponse à la question « faut-il augmenter l’effort ? »
Ce que le réglage d’effort change sur Fable 5
Le paramètre d’effort (output_config.effort) propose cinq niveaux : low, medium, high, xhigh et max. Sur Fable 5, high est la valeur par défaut. D’après la documentation d’Anthropic sur l’effort, définir explicitement high revient exactement à ne pas renseigner ce paramètre.
Deux points surprennent souvent. D’abord, l’effort ne règle pas uniquement la phase de réflexion : il encadre l’ensemble des tokens dépensés — texte visible, réflexion étendue et appels d’outils dans une boucle agentique. Un effort faible produit moins d’appels d’outils, davantage regroupés, moins de préambule et des confirmations plus concises. À l’inverse, un effort élevé multiplie les appels, la planification explicite et les synthèses longues. Ensuite, la réflexion de Fable 5 est toujours active : impossible de la désactiver (thinking: {type: "disabled"} renvoie une erreur). L’effort est donc le levier qui en règle la profondeur. Avec high, xhigh et max, Claude réfléchit presque toujours en profondeur ; avec low et medium, il peut s’en passer sur les problèmes simples.
Entre high et max, il y a xhigh
Opposer « high ou max » masque en réalité un troisième palier : xhigh. Il apporte un réglage plus fin du compromis entre raisonnement et latence. L’ingénieur Anthropic Boris Cherny l’a présenté comme « a new level between high and max ». Ce niveau n’est disponible que sur Fable 5, Mythos 5, Opus 4.8, Opus 4.7 et Sonnet 5. Les modèles plus anciens, tels qu’Opus 4.6 et Sonnet 4.6, passent directement de high à max.
Voici l’échelle complète et l’usage qu’Anthropic associe à chaque niveau :
| Niveau | Usage indiqué par Anthropic |
|---|---|
low | Tâches simples privilégiant la rapidité et le coût minimal, comme les sous-agents |
medium | Tâches agentiques recherchant un équilibre entre vitesse, coût et performances |
high | Raisonnement complexe, code difficile et tâches agentiques (réglage par défaut) |
xhigh | Tâches agentiques ou de code longues (30+ minutes), avec des budgets de tokens de plusieurs millions |
max | Raisonnement le plus approfondi, sans plafond sur l’effort interne (la sortie reste limitée par max_tokens) |
Autrement dit, avant de lancer Fable 5 en max, la première question honnête est : avez-vous essayé xhigh ? Pour les tâches de code et agentiques les plus exigeantes, le cran recommandé est xhigh, pas max.
Le compromis réel : coût et latence
Augmenter l’effort ne modifie pas le tarif par token. Fable 5 facture $10 par million de tokens en entrée et $50 par million de tokens en sortie, quel que soit le niveau. Le coût augmente uniquement parce que le modèle génère davantage de tokens.
Ce graphique est illustratif, non mesuré : il représente la forme du compromis décrit ci-dessous, avec une normalisation à 1,0 pour max sur les deux axes. La qualité approche de son plafond dès high, tandis que le coût continue à pratiquement doubler à chaque palier.
C’est entre xhigh et max que le calcul devient défavorable. Le développeur logiciel Ishu Agarwal a indiqué (11 juillet 2026) que le passage de high à xhigh pouvait apporter « généralement moins de 3 % » de qualité supplémentaire pour un surcoût de « 30 % à 100 % », les modèles ayant tendance « to overthink at higher effort levels ». Un post très relayé du 14 juillet a affirmé que Fable 5 obtenait le même score en max et en xhigh : « 89.0 vs 89.0, at roughly double the cost ». Il faut considérer ces données communautaires comme des indications de tendance, et non comme un benchmark contrôlé. Leur conclusion rejoint toutefois la remarque d’Anthropic : max « adds significant cost for relatively small quality gains, and on some structured-output or less intelligence-sensitive tasks it can lead to overthinking. »
La latence suit la même logique. Après avoir testé les niveaux d’effort (11 juin 2026), le product manager Pawel Huryn a constaté qu’« below max, completion time barely moves », alors que sur de vraies tâches, « completion jumps from xhigh up ». Autre piège : le tokenizer de Fable 5, partagé avec la dernière génération d’Opus, peut produire jusqu’à ~35 % de tokens supplémentaires pour un même texte par rapport aux anciens modèles Claude. Toute estimation de coût fondée sur un modèle précédent sera donc trop basse.
Quelle règle suivre entre high, xhigh et max ?
| Type de tâche | Effort | Monter d’un niveau quand |
|---|---|---|
| Code courant, chat, extraction, sous-agents | low / medium | La qualité de sortie baisse visiblement |
| La plupart des tâches de raisonnement, code quotidien, travail agentique | high (par défaut) | Une tâche difficile bloque ou demande une planification plus poussée |
| Code et travail agentique les plus difficiles, exécutions de longue durée, usage intensif des outils | xhigh | xhigh ne parvient réellement pas à résoudre le problème |
Problème de pointe ou bug que xhigh n’a pas résolu, avec la justesse prioritaire sur le coût | max | (Sommet de l’échelle) |
high offre le meilleur équilibre entre qualité et efficacité en tokens ; xhigh achète une délibération réellement plus poussée pour les cas les plus durs ; max reste un pari sur ce que xhigh a déjà échoué à résoudre. Réduire l’effort est souvent plus judicieux : selon Anthropic, les niveaux inférieurs de Fable 5 restent performants et « often exceed[s] xhigh performance on prior models ». Le CTO Morgan Linton l’a formulé sans détour : « about 95% of what I do from a coding perspective only requires Fable 5 Low and Medium ». Utiliser systématiquement high alors que Low ou Medium renvoie le même résultat est le meilleur moyen d’épuiser les limites de son forfait.
Si le modèle n’est pas le bon pour la tâche, ajuster l’effort ne résoudra rien : c’est une question de choix de modèle, pas de niveau d’effort.
Les trois idées reçues sur l’effort de Fable 5
Un effort supérieur ne rend pas le modèle plus intelligent. L’effort détermine la quantité de travail effectuée par Claude avant de répondre — davantage de réflexion et d’appels d’outils —, pas ses capacités fondamentales. Une réponse en low vient du même modèle qu’une réponse en max. Si la tâche dépasse ses capacités, max dépensera simplement plus pour arriver au même résultat.
Le réglage par défaut de Claude Code diffère de celui de l’API. Claude Code utilise xhigh par défaut, contre high pour l’API. Cela explique à lui seul bon nombre de « pourquoi se comporte-t-il différemment ici ? » : avec Claude Code, le même modèle semble plus exhaustif et plus cher uniquement à cause de ce réglage par défaut plus élevé. Définissez explicitement xhigh si vous voulez reproduire ce comportement via l’API.
ultracode n’est pas un niveau d’effort. Cette option apparaît dans le menu de Claude Code, mais l’API n’accepte que les valeurs de low à max. Ultracode associe xhigh à une autorisation permanente de lancer des flux multi-agents : c’est gourmand en tokens et impossible à transmettre à l’API.
Configurer l’effort et comprendre max_tokens
L’effort se définit dans output_config et ne nécessite aucun en-tête beta. La réflexion étant toujours activée sur Fable 5, omettez entièrement le paramètre thinking :
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-fable-5",
max_tokens=64000, # give room at xhigh/max (see note below)
output_config={"effort": "xhigh"}, # low | medium | high | xhigh | max
messages=[{"role": "user", "content": "Refactor this module and add tests."}],
)
max_tokens fixe un plafond strict sur la sortie totale : réflexion et texte de réponse compris. En xhigh ou max, la réflexion peut consommer une grande partie de ce budget ; prévoyez donc une marge généreuse — commencez autour de 64,000 — sous peine d’obtenir des réponses tronquées en pleine réflexion. Fable 5 prend en charge un contexte de 1M tokens et jusqu’à 128K tokens en sortie.
FAQ
Quelle est la différence entre high et max sur Fable 5 ?
high, le réglage par défaut, mobilise l’effort nécessaire à d’excellents résultats ; max supprime toute retenue pour privilégier le raisonnement le plus approfondi. Dans la pratique, le passage pertinent depuis high est généralement xhigh, situé entre les deux.
Le niveau max vaut-il le coup sur Fable 5 ?
Rarement : il coûte environ deux fois plus que xhigh pour un gain mesurable limité, et peut trop réfléchir. Réservez-le à un problème de pointe ou à un bug que xhigh ne parvient pas à résoudre.
Comment modifier le niveau d’effort ?
Définissez output_config: {"effort": "..."} avec low, medium, high, xhigh ou max. Dans Claude Code, utilisez son menu d’effort.
Quel est le niveau d’effort par défaut ?
high dans l’API, ce qui équivaut à omettre le paramètre. Claude Code utilise xhigh par défaut.
Un effort plus élevé augmente-t-il le prix par token ?
Non : le tarif est fixe. Un effort supérieur coûte davantage uniquement parce que le modèle génère plus de tokens.
L’effort de Fable 5 fonctionne-t-il comme les niveaux de Sonnet ou Opus ?
Le paramètre et les noms sont les mêmes, mais xhigh n’existe que sur Fable 5, Mythos 5, Opus 4.8, Opus 4.7 et Sonnet 5 ; les réglages par défaut recommandés varient aussi selon le modèle. Consultez Sonnet 5 versus Fable 5 si vous hésitez entre les deux.