AIREITER

Preço da API do Claude Haiku 5.5: a pegadinha dos 100 mil tokens

Última Atualização: 2026-10-07 19:02:50

O Claude Haiku 5.5 parece um modelo barato e simples de precificar — até a requisição ultrapassar 100 mil tokens de entrada. Abaixo desse limite, a Anthropic cobra US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída. Acima dele, os valores passam para US$ 0,50 e US$ 2,50. Esse salto de cinco vezes no custo da entrada, mais do que qualquer promessa de lançamento, é o número que precisa entrar no orçamento de produção.

Preço da API do Claude Haiku 5.5 em resumo

A tabela de preços da API direta separa as requisições pelo tamanho do prompt de entrada, em dólares por milhão de tokens. Os valores abaixo usam os preços da plataforma Claude e o anúncio de lançamento do Haiku 5.5 da Anthropic; as tarifas de marketplaces podem ser diferentes.

O limite de 100 mil tokens é o que define a conta

O limite considera o prompt de entrada da requisição. Ele não é uma sobretaxa geral aplicada só porque o modelo tem uma janela de contexto grande. Uma requisição com 90 mil tokens de entrada e 2 mil tokens de saída continua no nível mais barato; já uma requisição com 120 mil tokens de entrada usa as tarifas mais altas de entrada e saída previstas para prompts longos.

Para uma requisição simples, com 10 mil tokens de entrada e 500 tokens de saída, a conta no nível inferior fica assim:

(10,000 x $0.10 + 500 x $0.50) / 1,000,000 = $0.00035

Em 10 mil requisições idênticas, isso representa US$ 3,50, sem considerar custos de ferramentas, plataforma ou novas tentativas. Para visualizar a mudança de nível com um prompt longo válido, uma requisição com 120 mil tokens de entrada e 500 tokens de saída custa:

(120,000 x $0.50 + 500 x $2.50) / 1,000,000 = $0.06125

São US$ 612,50 para 10 mil requisições desse tipo. Na conta, considere toda a entrada enviada à API, não apenas a pergunta visível.

O anúncio oficial da Anthropic no Reddit afirma que requisições de até 100 mil tokens são cerca de 90% mais baratas que as do Haiku 4.5, enquanto as acima de 100 mil ficam cerca de 50% mais baratas. Encare esses números como afirmações relativas do lançamento, não como garantia de que todo fluxo terá exatamente essa redução: novas tentativas, tamanho da saída, comportamento do tokenizador e falhas de cache também alteram a fatura.

Cache e Batch mudam o custo efetivo

O cache de prompts é especialmente útil quando a aplicação envia repetidamente as mesmas instruções ou a mesma base de conhecimento. No Haiku 5.5, gravar dados no cache de cinco minutos custa 1,25 vez a tarifa padrão de entrada, enquanto ler do cache custa um décimo do preço padrão da entrada. No nível de prompts longos, as mesmas proporções continuam valendo.

OperaçãoAté 100 milAcima de 100 mil
Primeiro milhão de tokens gravado no cache de cinco minutosUS$ 0,125US$ 0,625
Cada milhão de tokens lido do cacheUS$ 0,01US$ 0,05
Cada milhão de tokens de entrada no BatchUS$ 0,05US$ 0,25
Cada milhão de tokens de saída no BatchUS$ 0,25US$ 1,25

O cache de cinco minutos normalmente se paga depois de aproximadamente duas leituras, porque o adicional da gravação é recuperado rapidamente. Um prefixo de 1 milhão de tokens, por exemplo, custa US$ 0,125 para ser gravado e US$ 0,01 para cada leitura, contra US$ 0,20 em duas leituras sem cache, antes de considerar a saída. O cache de uma hora custa o dobro da tarifa básica de entrada, portanto precisa de mais leituras repetidas para compensar. O resultado exato depende de a chave do cache continuar inalterada e de a requisição permanecer no mesmo nível de preço.

A Batch API reduz pela metade as tarifas de entrada e saída em tarefas assíncronas, como enriquecimento noturno, classificação em massa, reprocessamentos e rodadas de avaliação. Ela não substitui o chat síncrono: o trade-off é a latência. Se a sua rota aceitar os dois formatos, Batch e cache podem ser combinados; ainda assim, confira os campos finais de usage em vez de presumir que toda requisição aproveitou o cache.

O indicador operacional que vale registrar é cache_read_input_tokens, um campo documentado no esquema de uso da Messages API da Anthropic. Se ele continuar em zero depois da primeira requisição, verifique a ordem do prompt, os timestamps, a serialização das ferramentas e a posição do controle de cache. Um modelo mais barato com o cache permanentemente vazio pode custar mais do que uma rota corretamente armazenada em cache, mesmo com uma tarifa nominal maior.

Haiku 5.5 versus Haiku e Sonnet mais antigos

A comparação abaixo usa as tarifas diretas publicadas antes do Haiku 5.5. Os valores do Haiku 4.5 aparecem como referência; isso não significa que todos os provedores pratiquem preços idênticos.

ModeloEntrada / MTokSaída / MTokMelhor interpretação para o orçamento
Claude Haiku 5.5, <=100KUS$ 0,10US$ 0,50Tarefas de alto volume e saída curta
Claude Haiku 5.5, >100KUS$ 0,50US$ 2,50Prompts longos quando a qualidade justifica o nível
Claude Haiku 4.5US$ 1,00US$ 5,00Integrações existentes que precisam de uma referência conhecida
Claude Sonnet 5.5US$ 2,00US$ 10,00Tarefas de produção mais exigentes

O Haiku 5.5 é o primeiro modelo que vale testar para gerar títulos, classificar, extrair informações, fazer roteamento, produzir resumos curtos e executar outras chamadas de alto volume em segundo plano. Um usuário no Reddit descreveu esse tipo de uso do Haiku como “tarefas de alto volume e baixa complexidade”, como criar o título de uma conversa ou extrair nomes de softwares de um texto (u/jam_pod_). É um cenário mais adequado do que tratá-lo automaticamente como substituto de um modelo mais forte em todas as etapas de um agente.

Não escolha apenas pelo preço por token. Se o Haiku precisar de uma segunda tentativa em metade das requisições, enquanto o Sonnet entregar resultados aceitos na primeira, a diferença nominal de dois para um pode desaparecer. Antes de direcionar tráfego de produção, meça a entrada faturada, a saída faturada, as novas tentativas e os resultados aceitos em uma amostra representativa.

Uma regra prática para calcular o custo em produção

Siga esta sequência antes de adotar o Haiku 5.5:

  1. Rode o prompt real pela documentação de contagem de tokens da Anthropic, incluindo ferramentas, documentos recuperados e histórico da conversa.
  2. Separe o tráfego entre requisições de entrada <=100K e >100K; não faça uma média entre os dois níveis.
  3. Calcule a saída separadamente. Uma entrada curta com uma resposta gerada longa é dominada pelo custo da saída.
  4. Coloque prefixos estáveis sob controle de cache e crie um alerta quando as leituras do cache chegarem a zero.
  5. Envie pelo Batch API o trabalho que pode esperar e mantenha o roteamento síncrono para requisições interativas.
  6. Compare o Haiku 5.5 com o Sonnet 5.5 pelo custo por resultado aceito, não pelo custo por milhão de tokens.

Essa regra também cobre a principal incerteza dos dados do dia do lançamento: os preços e a disponibilidade oficiais estão claros, mas ainda não há medições independentes consolidadas de latência, taxa de falhas e qualidade em contextos longos. A discussão no Reddit traz a mesma dúvida de forma direta: “O que significa ‘prompts de até 100 mil’?” (u/ShadowBannedAugustus). Para uma equipe de produção, essa pergunta deve ser respondida em um teste de faturamento, não no chute.

Perguntas frequentes sobre a API do Claude Haiku 5.5

Qual é o ID do modelo da API do Claude Haiku 5.5?

Use claude-haiku-5-5 como o alias atual, conforme listado nas notas de versão do Claude Code da Anthropic. Quando o roteamento reprodutível for importante, confirme o ID do snapshot na documentação de modelos da API.

Quanto custa uma requisição do Haiku 5.5 com 100 mil tokens?

Para 100 mil tokens de entrada e nenhuma saída, a cobrança da entrada no nível inferior é de US$ 0,01. A saída é faturada separadamente, a US$ 0,50 por milhão de tokens no mesmo nível; o nível mais caro passa a valer quando o prompt ultrapassa o limite documentado.

O Haiku 5.5 está incluído no Claude Pro ou Max?

A assinatura do Claude e o uso da API do Claude são produtos de cobrança separados, como mostra a página de preços da plataforma Claude da Anthropic. Para tráfego programático, use a tabela de preços da API.

O preço do Batch pode ser combinado com o cache de prompts?

A documentação de preços da Anthropic apresenta o Batch como um desconto de 50% sobre as cobranças elegíveis de tokens, enquanto a contabilização dos tokens armazenados em cache continua separada. Confira os campos finais de usage da sua rota, porque a elegibilidade do cache e o suporte específico do provedor podem variar.

O Haiku 5.5 é mais barato que o Haiku 4.5 em todas as requisições?

Nas tarifas diretas publicadas, o Haiku 5.5 é mais barato nos dois níveis de entrada. A economia real pode diminuir por causa de novas tentativas, saídas mais longas, falhas de cache ou fluxos que precisam de um modelo mais forte para concluir a tarefa com sucesso.