Novidades no Claude Haiku 5.5
A Anthropic lançou o Claude Haiku 5.5 em 7 de outubro de 2026, um ano após o Haiku 4.5. O preço caiu 90% em prompts curtos e o modelo ficou muito mais próximo do Sonnet.
O primeiro Haiku com controle de esforço
O Haiku 5.5 usa pensamento adaptativo e cinco níveis de esforço: low, medium, high, xhigh e max. O padrão é medium. Os modelos Haiku anteriores não tinham configuração de esforço.
Contexto de 1M e saída de 128K
A janela de contexto passa de 200K tokens no Haiku 4.5 para 1M, e a saída máxima de 64K para 128K. Aceita entrada de texto e imagem. A data de corte do conhecimento é junho de 2026.
Um grande salto em tarefas de agentes e escritório
No esforço máximo, a Anthropic relata 72,4% no OSWorld 2.1 (Haiku 4.5: 15,7%) e um Elo GDPval-AA de 1620 (Haiku 4.5: 735). O Sonnet 5.5 ainda lidera em todos os benchmarks publicados pela Anthropic.
Pontuação independente
A Artificial Analysis atribui ao Haiku 5.5 uma pontuação de 43 em seu Intelligence Index no esforço máximo, acima dos 17 do Haiku 4.5, e 34 no esforço padrão medium.
Claude Haiku 5.5 vs Haiku 4.5 vs Sonnet 5.5
Todos eles funcionam com a mesma chave AIReiter, portanto a troca requer apenas uma alteração no campo model.
Haiku 5.5 vs Haiku 4.5
O Haiku 4.5 tem preço de tabela de $1 na entrada e $5 na saída por milhão de tokens. O Haiku 5.5 tem tabela de $0,10 e $0,50 para prompts de até 100K tokens. A Anthropic estima que as cargas de trabalho reais custem cerca de 75% menos após considerar o novo tokenizador, que gera aproximadamente 30% mais tokens para o mesmo texto.
Haiku 5.5 vs Sonnet 5.5
O Sonnet 5.5 custa $1,00 na entrada e $5,00 na saída por milhão de tokens aqui, vinte vezes a taxa base do Haiku 5.5. A Anthropic ainda recomenda o Sonnet 5.5 ou Opus 5.5 para programação complexa. Use o Haiku 5.5 para classificação, extração, resumos, roteamento e etapas de subagentes.
Haiku 5.5 vs GPT-6 Luna
Ambos têm preço de tabela de $0,10 na entrada e $0,50 na saída. A Anthropic relata o Haiku 5.5 à frente no OSWorld 2.1 (72,4% vs 48,9%) e GDPval-AA (1620 vs 1437). A Artificial Analysis observa que o Haiku 5.5 usa mais tokens de saída do que o Luna para atingir pontuações semelhantes, portanto, compare em suas próprias tarefas.
Preços da API Claude Haiku 5.5 na AIReiter
Cada linha é faturada com 50% de desconto sobre a tabela da Anthropic. A tarifa depende de quantos tokens de entrada uma única requisição envia.
Até 100K tokens de entrada
Entrada $0,05 (tabela $0,10). Saída $0,25 (tabela $0,50). Leituras de cache $0,005 (tabela $0,01). Gravações de cache $0,0625 (tabela $0,125). Tudo por milhão de tokens.
Acima de 100K tokens de entrada: todas as tarifas x5
Entrada $0,25 (tabela $0,50). Saída $1,25 (tabela $2,50). Leituras de cache $0,025 (tabela $0,05). Gravações de cache $0,3125 (tabela $0,625). O nível é determinado por requisição pelo total de entrada, incluindo tokens em cache, e se aplica a toda a requisição.
Duas chamadas reais
50K de entrada mais 5K de saída custam $0,00375 aqui ($0,0075 na tabela). 200K de entrada mais 10K de saída entram na faixa de contexto longo e custam $0,0625 aqui ($0,125 na tabela). Se você puder dividir um trabalho longo em requisições abaixo de 100K, o custo será um quinto desse valor.
Faturado com base nos tokens realmente usados
Uma estimativa é retida no início da chamada e depois liquidada com base na contagem real de tokens quando a resposta for concluída, sendo a diferença estornada. Tokens de pensamento são cobrados como saída.
Migrando do Haiku 4.5: o que agora retorna erro
Mudar a string do modelo para claude-haiku-5-5 nem sempre é suficiente. Estes formatos de requisição funcionavam no Haiku 4.5 e são rejeitados no Haiku 5.5.
Remova temperature, top_p e top_k
Valores de amostragem não padrão retornam 400 com "deprecated for this model". Remova esses campos e direcione a saída com o prompt e o nível de esforço.
Sem assistant prefill
Uma conversa que termina com uma mensagem do assistente retorna 400. A última mensagem deve ser do usuário. Para forçar um formato, use structured outputs ou especifique no prompt.
Substitua orçamentos de thinking por effort
A API da Anthropic rejeita thinking: {"type": "enabled", "budget_tokens": N} neste modelo, portanto, remova-o e defina output_config.effort. Os tokens de thinking continuam sendo descontados de max_tokens, então aumente max_tokens se as respostas forem cortadas.
Desativar o thinking limita o effort em high
thinking: {"type": "disabled"} funciona com effort low, medium e high. Com xhigh ou max, retorna 400. O modo de thinking between_tools usado no Sonnet 5.5 não é suportado no Haiku 5.5. O tool_choice forçado continua funcionando.
Escolha o nível de esforço antes de colocar em produção
O effort é o principal controle para qualidade, latência e custo. No Haiku 5.5, a diferença entre os níveis é grande.
As pontuações de destaque usam max effort
Os números de lançamento da Anthropic usam max effort. No padrão medium effort, a Anthropic relata um Elo GDPval-AA de 1277 em vez de 1620. Avalie as alegações de benchmark levando em consideração o nível de effort.
max consome muitos tokens
A Artificial Analysis mediu cerca de 162K tokens de saída por tarefa do Intelligence Index no max effort, cerca de três vezes o GPT-6 Luna no max. No medium, mediu cerca de 137 tokens de saída por segundo.
Comece em low ou medium
Para classificação, extração e roteamento, low ou medium com o thinking desativado mantém a latência e o custo baixos. Suba de nível apenas nas tarefas em que a qualidade não for suficiente.
Como chamar a API do Claude Haiku 5.5
O endpoint utiliza o protocolo Anthropic Messages, então um cliente Claude existente precisa apenas de uma nova URL base e chave de API.
Obtenha uma chave e aponte o cliente para o AIReiter
Crie uma chave de API no seu painel do AIReiter. Nos SDKs oficiais da Anthropic, defina a URL base como https://aireiter.com/api — o SDK adiciona /v1/messages automaticamente.
Envie uma requisição com curl
curl https://aireiter.com/api/v1/messages \ -H "x-api-key: $AIREITER_API_KEY" \ -H "anthropic-version: 2023-06-01" \ -H "content-type: application/json" \ -d '{ "model": "claude-haiku-5-5", "max_tokens": 4096, "output_config": {"effort": "low"}, "messages": [{"role": "user", "content": "Hello"}] }'
Ou use o SDK em Python
from anthropic import Anthropic client = Anthropic(api_key="YOUR_AIREITER_KEY", base_url="https://aireiter.com/api") msg = client.messages.create( model="claude-haiku-5-5", max_tokens=4096, messages=[{"role": "user", "content": "Hello"}], ) print(next(b.text for b in msg.content if b.type == "text"))
FAQ da API do Claude Haiku 5.5
/ 01Quando o Claude Haiku 5.5 foi lançado e qual é o ID do modelo?
A Anthropic o lançou em 7 de outubro de 2026. O ID do modelo na API é claude-haiku-5-5, e a data de corte do seu conhecimento é junho de 2026. A Anthropic afirma que ele não será descontinuado antes de 7 de outubro de 2027.
/ 02Qual é a janela de contexto e o limite máximo de saída?
Uma janela de contexto de 1M de tokens e até 128K tokens de saída por requisição. Aceita entrada de texto e imagem e retorna texto.
/ 03Quanto custa a API do Claude Haiku 5.5?
A Anthropic cobra US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por saída para requisições de até 100K tokens de entrada, e cinco vezes mais acima de 100K. O AIReiter cobra a metade: US$ 0,05 e US$ 0,25, ou US$ 0,25 e US$ 1,25 acima de 100K.
/ 04Por que uma requisição custou cinco vezes mais?
O total de tokens de entrada ultrapassou 100K, portanto toda a requisição foi cobrada na tarifa de contexto longo. Tokens em cache também contam para o limite de 100K.
/ 05Por que minhas respostas começam com um bloco de thinking?
O thinking adaptativo vem ativado por padrão, portanto a resposta pode conter um bloco de thinking antes do texto. Leia os blocos de conteúdo pelo tipo em vez de acessar content[0], ou desative o thinking nos níveis de effort low, medium ou high.
/ 06O Haiku 5.5 é bom o suficiente para programação?
Para edições pequenas e bem delimitadas e etapas de subagentes, geralmente sim. Para tarefas complexas em múltiplos arquivos, a Anthropic recomenda o Sonnet 5.5 ou Opus 5.5, ambos disponíveis com a mesma chave.
/ 07Preciso de uma conta da Anthropic?
Não. Uma chave do AIReiter funciona no endpoint do AIReiter, e você pode testar o modelo no playground nesta página antes de escrever qualquer código.
/ 08Quais APIs são suportadas?
Anthropic Messages em /api/v1/messages é o contrato principal, com suporte a streaming. Chat Completions no estilo OpenAI e a Responses API também são atendidas, e /api/v1/models lista os modelos disponíveis para a sua chave.