O Claude Haiku 5.5 parece um modelo barato e simples de precificar — até a requisição ultrapassar 100 mil tokens de entrada. Abaixo desse limite, a Anthropic cobra US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída. Acima dele, os valores passam para US$ 0,50 e US$ 2,50. Esse salto de cinco vezes no custo da entrada, mais do que qualquer promessa de lançamento, é o número que precisa entrar no orçamento de produção.
Preço da API do Claude Haiku 5.5 em resumo
A tabela de preços da API direta separa as requisições pelo tamanho do prompt de entrada, em dólares por milhão de tokens. Os valores abaixo usam os preços da plataforma Claude e o anúncio de lançamento do Haiku 5.5 da Anthropic; as tarifas de marketplaces podem ser diferentes.
O limite de 100 mil tokens é o que define a conta
O limite considera o prompt de entrada da requisição. Ele não é uma sobretaxa geral aplicada só porque o modelo tem uma janela de contexto grande. Uma requisição com 90 mil tokens de entrada e 2 mil tokens de saída continua no nível mais barato; já uma requisição com 120 mil tokens de entrada usa as tarifas mais altas de entrada e saída previstas para prompts longos.
Para uma requisição simples, com 10 mil tokens de entrada e 500 tokens de saída, a conta no nível inferior fica assim:
(10,000 x $0.10 + 500 x $0.50) / 1,000,000 = $0.00035
Em 10 mil requisições idênticas, isso representa US$ 3,50, sem considerar custos de ferramentas, plataforma ou novas tentativas. Para visualizar a mudança de nível com um prompt longo válido, uma requisição com 120 mil tokens de entrada e 500 tokens de saída custa:
(120,000 x $0.50 + 500 x $2.50) / 1,000,000 = $0.06125
São US$ 612,50 para 10 mil requisições desse tipo. Na conta, considere toda a entrada enviada à API, não apenas a pergunta visível.
O anúncio oficial da Anthropic no Reddit afirma que requisições de até 100 mil tokens são cerca de 90% mais baratas que as do Haiku 4.5, enquanto as acima de 100 mil ficam cerca de 50% mais baratas. Encare esses números como afirmações relativas do lançamento, não como garantia de que todo fluxo terá exatamente essa redução: novas tentativas, tamanho da saída, comportamento do tokenizador e falhas de cache também alteram a fatura.
Cache e Batch mudam o custo efetivo
O cache de prompts é especialmente útil quando a aplicação envia repetidamente as mesmas instruções ou a mesma base de conhecimento. No Haiku 5.5, gravar dados no cache de cinco minutos custa 1,25 vez a tarifa padrão de entrada, enquanto ler do cache custa um décimo do preço padrão da entrada. No nível de prompts longos, as mesmas proporções continuam valendo.
| Operação | Até 100 mil | Acima de 100 mil |
|---|---|---|
| Primeiro milhão de tokens gravado no cache de cinco minutos | US$ 0,125 | US$ 0,625 |
| Cada milhão de tokens lido do cache | US$ 0,01 | US$ 0,05 |
| Cada milhão de tokens de entrada no Batch | US$ 0,05 | US$ 0,25 |
| Cada milhão de tokens de saída no Batch | US$ 0,25 | US$ 1,25 |
O cache de cinco minutos normalmente se paga depois de aproximadamente duas leituras, porque o adicional da gravação é recuperado rapidamente. Um prefixo de 1 milhão de tokens, por exemplo, custa US$ 0,125 para ser gravado e US$ 0,01 para cada leitura, contra US$ 0,20 em duas leituras sem cache, antes de considerar a saída. O cache de uma hora custa o dobro da tarifa básica de entrada, portanto precisa de mais leituras repetidas para compensar. O resultado exato depende de a chave do cache continuar inalterada e de a requisição permanecer no mesmo nível de preço.
A Batch API reduz pela metade as tarifas de entrada e saída em tarefas assíncronas, como enriquecimento noturno, classificação em massa, reprocessamentos e rodadas de avaliação. Ela não substitui o chat síncrono: o trade-off é a latência. Se a sua rota aceitar os dois formatos, Batch e cache podem ser combinados; ainda assim, confira os campos finais de usage em vez de presumir que toda requisição aproveitou o cache.
O indicador operacional que vale registrar é cache_read_input_tokens, um campo documentado no esquema de uso da Messages API da Anthropic. Se ele continuar em zero depois da primeira requisição, verifique a ordem do prompt, os timestamps, a serialização das ferramentas e a posição do controle de cache. Um modelo mais barato com o cache permanentemente vazio pode custar mais do que uma rota corretamente armazenada em cache, mesmo com uma tarifa nominal maior.
Haiku 5.5 versus Haiku e Sonnet mais antigos
A comparação abaixo usa as tarifas diretas publicadas antes do Haiku 5.5. Os valores do Haiku 4.5 aparecem como referência; isso não significa que todos os provedores pratiquem preços idênticos.
| Modelo | Entrada / MTok | Saída / MTok | Melhor interpretação para o orçamento |
|---|---|---|---|
| Claude Haiku 5.5, <=100K | US$ 0,10 | US$ 0,50 | Tarefas de alto volume e saída curta |
| Claude Haiku 5.5, >100K | US$ 0,50 | US$ 2,50 | Prompts longos quando a qualidade justifica o nível |
| Claude Haiku 4.5 | US$ 1,00 | US$ 5,00 | Integrações existentes que precisam de uma referência conhecida |
| Claude Sonnet 5.5 | US$ 2,00 | US$ 10,00 | Tarefas de produção mais exigentes |
O Haiku 5.5 é o primeiro modelo que vale testar para gerar títulos, classificar, extrair informações, fazer roteamento, produzir resumos curtos e executar outras chamadas de alto volume em segundo plano. Um usuário no Reddit descreveu esse tipo de uso do Haiku como “tarefas de alto volume e baixa complexidade”, como criar o título de uma conversa ou extrair nomes de softwares de um texto (u/jam_pod_). É um cenário mais adequado do que tratá-lo automaticamente como substituto de um modelo mais forte em todas as etapas de um agente.
Não escolha apenas pelo preço por token. Se o Haiku precisar de uma segunda tentativa em metade das requisições, enquanto o Sonnet entregar resultados aceitos na primeira, a diferença nominal de dois para um pode desaparecer. Antes de direcionar tráfego de produção, meça a entrada faturada, a saída faturada, as novas tentativas e os resultados aceitos em uma amostra representativa.
Uma regra prática para calcular o custo em produção
Siga esta sequência antes de adotar o Haiku 5.5:
- Rode o prompt real pela documentação de contagem de tokens da Anthropic, incluindo ferramentas, documentos recuperados e histórico da conversa.
- Separe o tráfego entre requisições de entrada
<=100Ke>100K; não faça uma média entre os dois níveis. - Calcule a saída separadamente. Uma entrada curta com uma resposta gerada longa é dominada pelo custo da saída.
- Coloque prefixos estáveis sob controle de cache e crie um alerta quando as leituras do cache chegarem a zero.
- Envie pelo Batch API o trabalho que pode esperar e mantenha o roteamento síncrono para requisições interativas.
- Compare o Haiku 5.5 com o Sonnet 5.5 pelo custo por resultado aceito, não pelo custo por milhão de tokens.
Essa regra também cobre a principal incerteza dos dados do dia do lançamento: os preços e a disponibilidade oficiais estão claros, mas ainda não há medições independentes consolidadas de latência, taxa de falhas e qualidade em contextos longos. A discussão no Reddit traz a mesma dúvida de forma direta: “O que significa ‘prompts de até 100 mil’?” (u/ShadowBannedAugustus). Para uma equipe de produção, essa pergunta deve ser respondida em um teste de faturamento, não no chute.
Perguntas frequentes sobre a API do Claude Haiku 5.5
Qual é o ID do modelo da API do Claude Haiku 5.5?
Use claude-haiku-5-5 como o alias atual, conforme listado nas notas de versão do Claude Code da Anthropic. Quando o roteamento reprodutível for importante, confirme o ID do snapshot na documentação de modelos da API.
Quanto custa uma requisição do Haiku 5.5 com 100 mil tokens?
Para 100 mil tokens de entrada e nenhuma saída, a cobrança da entrada no nível inferior é de US$ 0,01. A saída é faturada separadamente, a US$ 0,50 por milhão de tokens no mesmo nível; o nível mais caro passa a valer quando o prompt ultrapassa o limite documentado.
O Haiku 5.5 está incluído no Claude Pro ou Max?
A assinatura do Claude e o uso da API do Claude são produtos de cobrança separados, como mostra a página de preços da plataforma Claude da Anthropic. Para tráfego programático, use a tabela de preços da API.
O preço do Batch pode ser combinado com o cache de prompts?
A documentação de preços da Anthropic apresenta o Batch como um desconto de 50% sobre as cobranças elegíveis de tokens, enquanto a contabilização dos tokens armazenados em cache continua separada. Confira os campos finais de usage da sua rota, porque a elegibilidade do cache e o suporte específico do provedor podem variar.
O Haiku 5.5 é mais barato que o Haiku 4.5 em todas as requisições?
Nas tarifas diretas publicadas, o Haiku 5.5 é mais barato nos dois níveis de entrada. A economia real pode diminuir por causa de novas tentativas, saídas mais longas, falhas de cache ou fluxos que precisam de um modelo mais forte para concluir a tarefa com sucesso.