Na dúvida entre usar o Claude Fable 5 em high ou max, a resposta curta é simples: deixe em high para quase tudo, suba para xhigh em tarefas difíceis de programação e fluxos agênticos, e encare max como último recurso. Em boa parte das tarefas, max custa cerca de duas vezes mais por um ganho de qualidade difícil de perceber — e ainda pode levar o modelo a pensar demais. O detalhe que muita gente deixa passar é o nível xhigh, entre high e max, que geralmente é a resposta certa para quem quer aumentar o esforço.
O que o nível de effort muda no Fable 5
O parâmetro de esforço (output_config.effort) tem cinco níveis: low, medium, high, xhigh e max. No Fable 5, o padrão é high e, segundo a documentação de effort da Anthropic, definir high produz exatamente o mesmo resultado que omitir o parâmetro.
Há dois pontos que costumam surpreender. Primeiro: effort não é apenas um controle de raciocínio. Ele determina todo o consumo de tokens — texto visível, pensamento estendido e chamadas de ferramentas em um loop agêntico. Com menos esforço, há menos chamadas de ferramentas e elas são mais consolidadas, com menos preâmbulo e confirmações mais curtas. Com mais esforço, o modelo faz mais chamadas, expõe mais planejamento e entrega resumos mais longos. Segundo: o thinking do Fable 5 está sempre ativo — não é possível desativá-lo (thinking: {type: "disabled"} retorna erro). Portanto, effort é o controle de profundidade disponível. Em high, xhigh e max, Claude quase sempre raciocina profundamente; em low e medium, pode pular essa etapa em problemas simples.
Entre high e max, existe o xhigh
A discussão sobre “high vs max” envolve, na prática, três degraus, já que xhigh fica entre os dois e oferece um ajuste mais fino no equilíbrio entre raciocínio e latência. O engenheiro da Anthropic Boris Cherny descreveu-o como “um novo nível entre high e max”. Ele existe apenas no Fable 5, Mythos 5, Opus 4.8, Opus 4.7 e Sonnet 5; modelos anteriores, como Opus 4.6 e Sonnet 4.6, saltam diretamente de high para max.
Veja a escala completa e o uso que a Anthropic atribui a cada nível:
| Nível | Indicação da Anthropic |
|---|---|
low | Tarefas simples que exigem máxima velocidade e menor custo, como subagentes |
medium | Tarefas agênticas que equilibram velocidade, custo e desempenho |
high | Raciocínio complexo, programação difícil e tarefas agênticas (o padrão) |
xhigh | Tarefas agênticas/de programação de longa duração (30+ minutos), com orçamentos de milhões de tokens |
max | Raciocínio mais profundo, sem limite de esforço interno (a saída continua limitada por max_tokens) |
Por isso, antes de rodar o Fable 5 em max, a pergunta mais honesta é: você já testou xhigh? Para os trabalhos mais pesados de programação e agentes, o salto recomendado é para xhigh, não para max.
O preço em custo e latência
Aumentar o effort não altera o preço por token. O Fable 5 cobra uma taxa fixa de US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída em todos os níveis. O custo sobe apenas porque o modelo gera mais tokens.
O gráfico é ilustrativo, não uma medição: ele mostra o formato da relação descrita abaixo, normalizado para que max valha 1,0 em ambos os eixos. A qualidade já se aproxima do teto em high, enquanto o custo continua praticamente dobrando a cada degrau.
A conta começa a piorar de verdade na passagem de xhigh para max. O engenheiro de software Ishu Agarwal relatou, em 11 de julho de 2026, que subir de high para xhigh “normalmente pode render menos de 3%” de ganho de qualidade, com um custo “30% a 100%” maior, além de os modelos tenderem a “pensar demais em níveis mais altos de esforço”. Uma publicação amplamente compartilhada em 14 de julho afirmou que o Fable 5 obteve a mesma pontuação em max e xhigh: “89.0 vs 89.0, por aproximadamente o dobro do custo”. Trate esses dados da comunidade como indicativos, e não como benchmark controlado. Ainda assim, a direção coincide com a observação da Anthropic de que max “adiciona custo significativo para ganhos de qualidade relativamente pequenos” e, em algumas tarefas de saída estruturada ou menos sensíveis à inteligência, pode causar pensamento excessivo.
A latência segue a mesma lógica. Após testar os níveis de effort, em 11 de junho de 2026, o gerente de produto Pawel Huryn concluiu que “abaixo de max, o tempo de conclusão quase não muda”, mas, em trabalho real, “a conclusão salta a partir de xhigh”. Há mais uma armadilha: o tokenizador do Fable 5, compartilhado com a geração mais recente do Opus, pode contabilizar até ~35% mais tokens para o mesmo texto do que modelos Claude antigos. Por isso, qualquer referência de custo baseada em um modelo anterior tende a parecer menor do que será na prática.
Regra prática para escolher entre high, xhigh e max
| Tarefa | Effort | Suba o nível quando |
|---|---|---|
| Programação rotineira, chat, extração, subagentes | low / medium | A qualidade da resposta cair de forma visível |
| A maior parte do raciocínio, programação do dia a dia, trabalho agêntico | high (padrão) | Uma tarefa difícil travar ou precisar de planejamento mais profundo |
| Programação/trabalho agêntico mais difícil, execuções de longo prazo, uso intenso de ferramentas | xhigh | xhigh realmente não conseguir resolver |
Um problema de fronteira ou um bug que xhigh não resolveu, com correção acima de custo | max | (Topo da escala) |
high é o melhor ponto de equilíbrio entre qualidade e eficiência de tokens. xhigh compra uma dose real de deliberação extra para os trabalhos mais difíceis. Já max é uma tentativa de resolver o que xhigh não conseguiu. Muitas vezes, baixar o nível é a decisão mais inteligente: segundo a Anthropic, o Fable 5 ainda tem bom desempenho com menos esforço e “frequentemente supera o desempenho xhigh de modelos anteriores”. O CTO Morgan Linton foi direto ao ponto: “cerca de 95% do que faço em programação exige apenas Fable 5 Low e Medium”. Rodar tudo em high quando Low ou Medium entregam o mesmo resultado é uma forma de esgotar os limites do seu plano.
Se o próprio modelo não é adequado para a tarefa, ajustar effort não vai resolver — essa é uma questão de escolha de modelo, não de esforço.
Três equívocos comuns sobre o effort do Fable 5
Mais effort não torna o modelo mais inteligente. O nível de esforço define quanto trabalho Claude fará antes de responder — mais raciocínio e mais chamadas de ferramentas —, não sua capacidade. Uma resposta em low vem do mesmo modelo que uma em max. Se a tarefa ultrapassa a capacidade do modelo, max apenas gasta mais para chegar ao mesmo resultado.
O padrão do Claude Code não é o mesmo da API. Claude Code usa xhigh por padrão; a API usa high. Só isso já explica boa parte das dúvidas do tipo “por que ele se comporta diferente aqui?”. O mesmo modelo parece mais detalhista e mais caro no Claude Code simplesmente porque o nível padrão é maior. Defina xhigh explicitamente se quiser que a API se comporte da mesma forma.
ultracode não é um nível de effort. Ele aparece no menu do Claude Code, mas a API aceita apenas valores de low a max. Ultracode combina xhigh com permissão permanente para iniciar fluxos multiagente — algo que consome muitos tokens e não pode ser enviado como parâmetro para a API.
Como configurar o effort — e uma observação sobre max_tokens
Effort fica em output_config e não exige beta header. Como o thinking do Fable 5 está sempre ativo, omita inteiramente o parâmetro thinking:
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-fable-5",
max_tokens=64000, # dê espaço em xhigh/max (veja a observação abaixo)
output_config={"effort": "xhigh"}, # low | medium | high | xhigh | max
messages=[{"role": "user", "content": "Refactor this module and add tests."}],
)
max_tokens é um limite rígido para a saída total: o thinking e o texto da resposta. Em xhigh ou max, o raciocínio pode consumir uma parcela grande desse orçamento. Portanto, defina um valor generoso — comece em torno de 64.000 — ou as respostas podem ser truncadas no meio do raciocínio. O Fable 5 suporta contexto de 1M tokens e 128K tokens de saída.
Perguntas frequentes
Qual é a diferença entre high e max effort no Fable 5?
high, o padrão, usa o esforço necessário para entregar resultados excelentes. max remove qualquer contenção em busca do raciocínio mais profundo. Na maioria dos casos, o salto relevante a partir de high é para xhigh, que fica entre os dois.
Vale a pena usar max effort no Fable 5?
Raramente. Ele custa aproximadamente o dobro de xhigh por pouco ganho mensurável e pode levar o modelo a pensar demais. Reserve-o para um problema de fronteira ou um bug que xhigh não consegue resolver.
Como altero o nível de effort?
Defina output_config: {"effort": "..."} com low, medium, high, xhigh ou max. No Claude Code, use o menu de effort.
Qual é o nível de effort padrão?
high na API, com efeito idêntico a omitir o parâmetro. O Claude Code usa xhigh por padrão.
Effort maior aumenta o preço por token?
Não. A tarifa é fixa. Níveis maiores de effort custam mais apenas porque o modelo gera mais tokens.
O effort do Fable 5 é igual aos níveis de Sonnet ou Opus?
O parâmetro e os nomes são os mesmos, mas xhigh existe apenas no Fable 5, Mythos 5, Opus 4.8, Opus 4.7 e Sonnet 5, e os padrões recomendados variam de acordo com o modelo. Veja Sonnet 5 versus Fable 5 se estiver escolhendo entre eles.