AIREITER

Preços da API Claude 2026: Todos os Modelos e Como Pagar Menos

Última Atualização: 2026-06-30 08:51:39

Os preços da Claude API variam de $1 por milhão de tokens (entrada do Haiku 4.5) a $50 por milhão (saída do Fable 5) em julho de 2026, e em todos os modelos atuais vale a mesma regra: tokens de saída custam 5× os tokens de entrada. Mas o preço de tabela é só a parte fácil. Um novo tokenizador, roteamento apenas nos EUA, modo rápido e uma armadilha de cobrança que a maioria das pessoas nunca percebe ficam entre a tabela de preços e sua fatura real — e há uma forma de comprar os mesmos modelos por uma fração do preço de lista.

Todos os números abaixo estão na página oficial de preços da Anthropic; verifique-a antes de finalizar um orçamento, pois os valores dos modelos mudam.

Preços da API Claude em 2026: todos os modelos

Estas são as taxas atuais por milhão de tokens, verificadas com os preços da Anthropic para julho de 2026 (fonte oficial). O Opus 4.8 foi lançado em 28 de maio de 2026 com a mesma taxa do 4.7.

Modelo

Entrada / 1M

Saída / 1M

Contexto

Claude Fable 5

$10.00

$50.00

1M

Claude Opus 4.8

$5.00

$25.00

1M

Claude Opus 4.7

$5.00

$25.00

1M

Claude Opus 4.6

$5.00

$25.00

1M

Claude Sonnet 4.6

$3.00

$15.00

1M

Claude Haiku 4.5

$1.00

$5.00

200K

Duas coisas que muitos guias antigos erram. Fable 5 — o modelo mais capaz da Anthropic — fica acima do nível Opus por $10/$50, e toda a linha Opus 4.x (4.6, 4.7, 4.8) permanece em $5/$25. Esses $5 por si só já contam uma história: o Opus 4.1 custava $15/$75, e a queda para $5/$25 no lançamento do 4.6 foi um corte de 67% no carro-chefe, que se manteve por três lançamentos desde então.

Opções legadas e econômicas

Se você não precisa dos modelos mais recentes, os mais antigos ainda estão disponíveis: Sonnet 4.5 ($3/$15), Opus 4.5 ($5/$25, 200K context), Haiku 3.5 ($0.80/$4) e Haiku 3 ($0.25/$1.25) para trabalhos de alto volume e mais sensíveis a custo.

Um detalhe subestimado: Opus 4.6/4.7/4.8, Sonnet 4.6 e Fable 5 incluem todos a janela de contexto completa de 1M tokens ao preço padrão — sem cobrança extra por contexto longo. Uma solicitação de 900K tokens custa a mesma taxa por token que uma de 9K, enquanto vários concorrentes cobram um valor adicional após um limite de comprimento.

Os custos que não estão no cartão de preços

A tabela de tarifas é onde a maioria dos artigos sobre preços para, e onde as surpresas começam — porque várias coisas afetam sua conta real sem alterar o valor por token.

O tokenizador que adiciona tokens discretamente

Opus 4.7 (e Opus 4.8, que compartilha seu tokenizer) mudou a forma como o texto é dividido em tokens. A mesma entrada pode produzir até ~35% mais tokens do que no Opus 4.6 — com a mesma taxa por token. Código, dados estruturados (JSON/XML) e texto em outros idiomas são os mais afetados, porque a taxa não mudou, mas a quantidade de tokens mudou. Não aceite os 35% sem questionar: antes de confiar em um orçamento antigo, execute novamente seus prompts reais pelo endpoint de contagem de tokens no novo modelo e compare.

Pensamento, modo rápido e roteamento apenas para os EUA

De acordo com a documentação de preços da Anthropic:

  • Tokens de raciocínio estendido são cobrados como saída, mesmo quando você nunca os exibe. Uma solicitação com muito raciocínio aumenta discretamente o lado de saída da conta.

  • Modo rápido (apenas Opus 4.8/4.7) executa o mesmo modelo até 2,5× mais rápido com preço padrão de 2×.

  • Inferência apenas nos EUA (residência de dados) adiciona um multiplicador de 1,1× na entrada e na saída; endpoints regionais do AWS Bedrock ou Vertex adicionam aproximadamente mais 10% sobre isso.

Ferramentas do lado do servidor

Ferramentas que rodam do lado da Anthropic são cobradas separadamente, conforme a mesma documentação de preços: web search custa US$ 10 por 1.000 buscas, além dos tokens para processar os resultados, e a execução de código é gratuita até um limite mensal, depois cerca de US$ 0,05/hora por contêiner. (Confirme os valores atuais na página de preços — as tarifas das server tools mudam.)

A armadilha de cobrança que pega usuários do Claude Code

Este não está em nenhum cartão de preços. Se você tiver ANTHROPIC_API_KEY definido no seu shell, o Claude Code é cobrado por meio da API pay-per-token em vez da sua assinatura. Pessoas que esperavam um valor fixo de US$ 20–US$ 200/mês foram surpreendidas por cobranças por consumo exatamente por esse motivo. Verifique seu ambiente antes de uma sessão longa.

Quanto o Claude realmente vai custar para você?

As taxas significam pouco até você mapeá-las a uma carga de trabalho. Três exemplos com os preços atuais, todos com 10.000 solicitações/dia (2.000 tokens de entrada + 500 tokens de saída cada — 20 milhões de tokens de entrada + 5 milhões de tokens de saída/dia):

  • Um chatbot de suporte no Haiku 4.5 ($1/$5): 20M × $1 + 5M × $5 = $45/dia, cerca de $1.350/mês.

  • Um agente de programação no Sonnet 4.6 ($3/$15): $60 + $75 = $135/dia, cerca de $4.050/mês antes da otimização.

  • Um app RAG de alto contexto no Opus 4.8 ($5/$25), em que os documentos recuperados elevam muito mais a entrada, chega a valores altos de quatro a cinco dígitos por mês, porque o volume de entrada domina.

Mesmo volume, três modelos — a escolha do modelo por si só faz a conta variar em ~3× entre Haiku e Sonnet.

Esses não são tetos hipotéticos. Um tópico no r/ClaudeAI acompanhou 31 usuários do Claude Code cujo uso teria custado cerca de US$ 80.000/mês nas tarifas da API, sendo que o principal usuário sozinho ficou perto de US$ 18.000 — uma estimativa do que o uso da assinatura custaria na API tarifada por uso, não uma fatura literal. Cargas de trabalho autônomas pesadas são onde a conta fica real, e é exatamente aí que as otimizações abaixo compensam.

Limites de taxa e níveis de uso

Preço não é a única restrição — com que rapidez você pode gastá-lo é escalonado. Novas contas de API começam com limites conservadores de requisições por minuto (RPM) e tokens por minuto (TPM) que aumentam automaticamente à medida que sua conta envelhece e seus gastos acumulados crescem (Tier 1 → 4). Novas contas também recebem $5 em créditos gratuitos para testar, sem צורך de cartão. Além da capacidade de processamento, a Anthropic oferece níveis de serviço que fazem concessões entre disponibilidade e preço: um nível padrão (o padrão), um nível prioritário para disponibilidade garantida e um nível em lote para o desconto assíncrono de 50% abaixo. Consulte a documentação de rate limits para os números exatos do seu nível antes de arquitetar para escala — uma cota que atendeu ao tráfego de teste pode precisar de um aumento de nível para produção.

Assinatura do Claude vs API: qual é mais barata?

A pergunta mais comum do mundo real, e a resposta é um limiar, não um veredicto.

  • Claude Pro custa US$ 20/mês; Max custa US$ 100 ou US$ 200/mês. Eles cobrem os apps do Claude e o Claude Code dentro de uma franquia de uso — sem cobrança por token.

  • The API é totalmente no modelo pay-as-you-go, sem mínimo mensal e sem limite de uso.

A interseção fica na faixa de poucos milhões de tokens por mês — aproximadamente 3–4 milhões em um modelo intermediário (Sonnet), assumindo uma mistura equilibrada de entrada/saída e que você, de outra forma, permaneceria dentro da cota de uso do Pro. Isso aumenta no Haiku e diminui no Opus, então encare isso como uma faixa, não como uma linha fixa. Abaixo desse volume, uma assinatura geralmente é mais barata e simples. Acima dele — especialmente tráfego de produção ou codificação agentic pesada — a taxa por token da API vence, e você ganha controle (limites de taxa, monitoramento, faturamento com múltiplas chaves) que um plano não oferece. Especificamente para codificação o dia todo, desenvolvedores estimam que um plano Max pode ser drasticamente mais barato do que o mesmo trabalho cobrado token por token no Opus.

A regra prática: protótipos e uso individual → assinatura; tráfego de produto em escala → API. E cuidado com a armadilha ANTHROPIC_API_KEY acima, ou você pagará dos dois jeitos.

Como pagar menos pela API do Claude

Três alavancas reduzem a fatura padrão sem alterar os modelos.

1. Cache de prompts (até 90% de desconto em contexto repetido)

Faça cache de um prefixo estável — um prompt de sistema longo, documentos recuperados, exemplos few-shot — e as leituras do cache custam 0,1× da taxa de entrada, um desconto de 90%. O porém é a gravação: uma gravação em cache de 5 minutos custa 1,25× e se paga após uma leitura; uma gravação de 1 hora custa 2× e se paga após duas. Para qualquer coisa com um grande preâmbulo fixo repetido várias vezes, esta é a maior alavanca isolada. (Documentação de cache.)

2. API em lote (50% de desconto, em ambas as direções)

Para qualquer coisa que não precise de uma resposta em tempo real, a Batch API oferece 50% de desconto na entrada e na saída e retorna em até 24 horas. O Sonnet 4.6 cai para $1.50/$7.50; o Haiku 4.5 para $0.50/$2.50. O cache e o batching se somam, reduzindo o custo efetivo para bem menos da metade da tarifa exibida.

3. Roteamento de modelos e limites de saída

Não execute todas as solicitações no Opus. Direcione classificação, sumarização e lógica de roteamento para Haiku, reserve Sonnet para o meio e chame o Opus apenas quando a tarefa realmente exigir — comumente um corte de 40–60% por si só. E, como a saída custa 5× o preço da entrada, limitar max_tokens é uma das alavancas de maior impacto: reduzir a saída média de 800 para 500 tokens em um milhão de chamadas economiza dinheiro de verdade todo mês.

API oficial vs. plataformas de relay: você pode pagar menos?

Existe uma quarta rota que a documentação oficial não mencionará: comprar os mesmos modelos Claude por meio de um relay. Um relay de API (ou agregador) fica entre você e a Anthropic, expõe um endpoint compatível com a Anthropic e cobra sua própria tarifa.

Por que um relay pode ser mais barato? Três mecanismos, principalmente: relays compram em volume com uso comprometido, o que gera descontos que uma conta individual não consegue alcançar; eles roteiam com eficiência entre regiões e provedores; e muitos operam com margens muito apertadas (ou como oferta de isca) para conquistar desenvolvedores. Mas um desconto tão grande precisa vir de algum lugar — entenda o modelo de uma plataforma antes de depender dela.

Os descontos variam bastante. Veja como três opções se comparam para os mesmos modelos Claude:

Plataforma

Desconto vs lista da Anthropic

Cobertura de modelos

Observações

API oficial da Anthropic

— (referência)

Todos, incl. Fable 5 / Opus 4.8

Cache, lote, todos os recursos

OpenRouter

≈ lista (repassa o preço do provedor)

Muitos modelos, múltiplos provedores

Agregador; conveniência em vez de economia

EvoLink

~10% de desconto

Até Opus 4.7

Endpoint compatível com OpenAI

AIReiter

~80% de desconto

Até Opus 4.6

Compatível com Anthropic; cache repassado

AIReiter fica na extremidade mais agressiva. Aqui está o que os cerca de 80% principais equivalem por modelo:

Modelo

Oficial (entrada / saída)

AIReiter (entrada / saída)

Você economiza

Claude Haiku 4.5

$1 / $5

$0.20 / $1.00

80%

Claude Sonnet 4.6

$3 / $15

$0.60 / $3.00

80%

Claude Opus 4.6

$5 / $25

$1.00 / $5.00

80%

A integração é plug-and-play: o endpoint da AIReiter é compatível com a Anthropic Messages API, então o SDK oficial anthropic funciona alterando duas linhas — aponte base_url para https://aireiter.com/api e troque a chave:

client = anthropic.Anthropic(
    api_key="YOUR_AIREITER_KEY",
    base_url="https://aireiter.com/api",
)

Streaming, multi-turn, visão e cache_control todos passam, então o desconto de caching de 90% acima se soma à taxa base mais baixa.

FAQ

Por que a API Claude é tão cara?

Muitas vezes, não é a taxa por token — é o design do fluxo de trabalho. Os maiores fatores de custo são executar tudo no Opus quando o Haiku ou o Sonnet seriam suficientes, contexto repetido sem cache, saída sem limite e tokens de raciocínio pelos quais você é cobrado, mas nunca vê. Corrigir isso geralmente importa mais do que o preço anunciado.

Existe uma camada gratuita da API Claude?

Não há um plano gratuito permanente para produção, mas novas contas recebem US$ 5 em créditos gratuitos (não é necessário cartão) para testes. Depois disso, é pagamento conforme o uso.

Preço da API Claude vs ChatGPT — qual é mais barato?

Depende da camada que você compara. Aproximadamente, por milhão de tokens (entrada / saída):

Claude

OpenAI comparável

Haiku 4.5 — $1 / $5

GPT mini tier — valores baixos de um dígito

Sonnet 4.6 — $3 / $15

faixa intermediária — comparável

Opus 4.8 — $5 / $25

GPT-5.5 — ~$5 / $30

Como calculo minha fatura mensal da API Claude?

Estime assim: (requests × avg input tokens ÷ 1,000,000 × input rate) + (requests × avg output tokens ÷ 1,000,000 × output rate). Use o endpoint de contagem de tokens para obter contagens precisas em seus prompts reais — um tokenizer genérico pode ter uma margem de erro de 15–35% no Claude.

Em resumo

Para a maioria das equipes, é uma divisão em três vias: prototipagem ou uso individual → uma assinatura Pro ou Max (mais simples, mais barata abaixo de ~3–4M de tokens/mês); produção no mais recente modelo flagship (Opus 4.8, Fable 5) → a API oficial com caching, batching e routing ativados; produção em que Sonnet 4.6 ou Opus 4.6 é suficiente → um relay confiável como o AIReiter pode reduzir a mesma conta em até 80% com uma troca de SDK plug-and-play.

Seja qual for a sua escolha, a maioria das equipes paga a mais por deixar de lado as otimizações, não por escolher o nível errado — então ative as alavancas antes de se preocupar com a tabela de preços.