Os preços da Claude API variam de $1 por milhão de tokens (entrada do Haiku 4.5) a $50 por milhão (saída do Fable 5) em julho de 2026, e em todos os modelos atuais vale a mesma regra: tokens de saída custam 5× os tokens de entrada. Mas o preço de tabela é só a parte fácil. Um novo tokenizador, roteamento apenas nos EUA, modo rápido e uma armadilha de cobrança que a maioria das pessoas nunca percebe ficam entre a tabela de preços e sua fatura real — e há uma forma de comprar os mesmos modelos por uma fração do preço de lista.
Todos os números abaixo estão na página oficial de preços da Anthropic; verifique-a antes de finalizar um orçamento, pois os valores dos modelos mudam.
Preços da API Claude em 2026: todos os modelos
Estas são as taxas atuais por milhão de tokens, verificadas com os preços da Anthropic para julho de 2026 (fonte oficial). O Opus 4.8 foi lançado em 28 de maio de 2026 com a mesma taxa do 4.7.
Modelo | Entrada / 1M | Saída / 1M | Contexto |
|---|---|---|---|
Claude Fable 5 | $10.00 | $50.00 | 1M |
Claude Opus 4.8 | $5.00 | $25.00 | 1M |
Claude Opus 4.7 | $5.00 | $25.00 | 1M |
Claude Opus 4.6 | $5.00 | $25.00 | 1M |
Claude Sonnet 4.6 | $3.00 | $15.00 | 1M |
Claude Haiku 4.5 | $1.00 | $5.00 | 200K |
Duas coisas que muitos guias antigos erram. Fable 5 — o modelo mais capaz da Anthropic — fica acima do nível Opus por $10/$50, e toda a linha Opus 4.x (4.6, 4.7, 4.8) permanece em $5/$25. Esses $5 por si só já contam uma história: o Opus 4.1 custava $15/$75, e a queda para $5/$25 no lançamento do 4.6 foi um corte de 67% no carro-chefe, que se manteve por três lançamentos desde então.
Opções legadas e econômicas
Se você não precisa dos modelos mais recentes, os mais antigos ainda estão disponíveis: Sonnet 4.5 ($3/$15), Opus 4.5 ($5/$25, 200K context), Haiku 3.5 ($0.80/$4) e Haiku 3 ($0.25/$1.25) para trabalhos de alto volume e mais sensíveis a custo.
Um detalhe subestimado: Opus 4.6/4.7/4.8, Sonnet 4.6 e Fable 5 incluem todos a janela de contexto completa de 1M tokens ao preço padrão — sem cobrança extra por contexto longo. Uma solicitação de 900K tokens custa a mesma taxa por token que uma de 9K, enquanto vários concorrentes cobram um valor adicional após um limite de comprimento.
Os custos que não estão no cartão de preços
A tabela de tarifas é onde a maioria dos artigos sobre preços para, e onde as surpresas começam — porque várias coisas afetam sua conta real sem alterar o valor por token.
O tokenizador que adiciona tokens discretamente
Opus 4.7 (e Opus 4.8, que compartilha seu tokenizer) mudou a forma como o texto é dividido em tokens. A mesma entrada pode produzir até ~35% mais tokens do que no Opus 4.6 — com a mesma taxa por token. Código, dados estruturados (JSON/XML) e texto em outros idiomas são os mais afetados, porque a taxa não mudou, mas a quantidade de tokens mudou. Não aceite os 35% sem questionar: antes de confiar em um orçamento antigo, execute novamente seus prompts reais pelo endpoint de contagem de tokens no novo modelo e compare.
Pensamento, modo rápido e roteamento apenas para os EUA
De acordo com a documentação de preços da Anthropic:
Tokens de raciocínio estendido são cobrados como saída, mesmo quando você nunca os exibe. Uma solicitação com muito raciocínio aumenta discretamente o lado de saída da conta.
Modo rápido (apenas Opus 4.8/4.7) executa o mesmo modelo até 2,5× mais rápido com preço padrão de 2×.
Inferência apenas nos EUA (residência de dados) adiciona um multiplicador de 1,1× na entrada e na saída; endpoints regionais do AWS Bedrock ou Vertex adicionam aproximadamente mais 10% sobre isso.
Ferramentas do lado do servidor
Ferramentas que rodam do lado da Anthropic são cobradas separadamente, conforme a mesma documentação de preços: web search custa US$ 10 por 1.000 buscas, além dos tokens para processar os resultados, e a execução de código é gratuita até um limite mensal, depois cerca de US$ 0,05/hora por contêiner. (Confirme os valores atuais na página de preços — as tarifas das server tools mudam.)
A armadilha de cobrança que pega usuários do Claude Code
Este não está em nenhum cartão de preços. Se você tiver ANTHROPIC_API_KEY definido no seu shell, o Claude Code é cobrado por meio da API pay-per-token em vez da sua assinatura. Pessoas que esperavam um valor fixo de US$ 20–US$ 200/mês foram surpreendidas por cobranças por consumo exatamente por esse motivo. Verifique seu ambiente antes de uma sessão longa.
Quanto o Claude realmente vai custar para você?
As taxas significam pouco até você mapeá-las a uma carga de trabalho. Três exemplos com os preços atuais, todos com 10.000 solicitações/dia (2.000 tokens de entrada + 500 tokens de saída cada — 20 milhões de tokens de entrada + 5 milhões de tokens de saída/dia):
Um chatbot de suporte no Haiku 4.5 ($1/$5): 20M × $1 + 5M × $5 = $45/dia, cerca de $1.350/mês.
Um agente de programação no Sonnet 4.6 ($3/$15): $60 + $75 = $135/dia, cerca de $4.050/mês antes da otimização.
Um app RAG de alto contexto no Opus 4.8 ($5/$25), em que os documentos recuperados elevam muito mais a entrada, chega a valores altos de quatro a cinco dígitos por mês, porque o volume de entrada domina.
Mesmo volume, três modelos — a escolha do modelo por si só faz a conta variar em ~3× entre Haiku e Sonnet.
Esses não são tetos hipotéticos. Um tópico no r/ClaudeAI acompanhou 31 usuários do Claude Code cujo uso teria custado cerca de US$ 80.000/mês nas tarifas da API, sendo que o principal usuário sozinho ficou perto de US$ 18.000 — uma estimativa do que o uso da assinatura custaria na API tarifada por uso, não uma fatura literal. Cargas de trabalho autônomas pesadas são onde a conta fica real, e é exatamente aí que as otimizações abaixo compensam.
Limites de taxa e níveis de uso
Preço não é a única restrição — com que rapidez você pode gastá-lo é escalonado. Novas contas de API começam com limites conservadores de requisições por minuto (RPM) e tokens por minuto (TPM) que aumentam automaticamente à medida que sua conta envelhece e seus gastos acumulados crescem (Tier 1 → 4). Novas contas também recebem $5 em créditos gratuitos para testar, sem צורך de cartão. Além da capacidade de processamento, a Anthropic oferece níveis de serviço que fazem concessões entre disponibilidade e preço: um nível padrão (o padrão), um nível prioritário para disponibilidade garantida e um nível em lote para o desconto assíncrono de 50% abaixo. Consulte a documentação de rate limits para os números exatos do seu nível antes de arquitetar para escala — uma cota que atendeu ao tráfego de teste pode precisar de um aumento de nível para produção.
Assinatura do Claude vs API: qual é mais barata?
A pergunta mais comum do mundo real, e a resposta é um limiar, não um veredicto.
Claude Pro custa US$ 20/mês; Max custa US$ 100 ou US$ 200/mês. Eles cobrem os apps do Claude e o Claude Code dentro de uma franquia de uso — sem cobrança por token.
The API é totalmente no modelo pay-as-you-go, sem mínimo mensal e sem limite de uso.
A interseção fica na faixa de poucos milhões de tokens por mês — aproximadamente 3–4 milhões em um modelo intermediário (Sonnet), assumindo uma mistura equilibrada de entrada/saída e que você, de outra forma, permaneceria dentro da cota de uso do Pro. Isso aumenta no Haiku e diminui no Opus, então encare isso como uma faixa, não como uma linha fixa. Abaixo desse volume, uma assinatura geralmente é mais barata e simples. Acima dele — especialmente tráfego de produção ou codificação agentic pesada — a taxa por token da API vence, e você ganha controle (limites de taxa, monitoramento, faturamento com múltiplas chaves) que um plano não oferece. Especificamente para codificação o dia todo, desenvolvedores estimam que um plano Max pode ser drasticamente mais barato do que o mesmo trabalho cobrado token por token no Opus.
A regra prática: protótipos e uso individual → assinatura; tráfego de produto em escala → API. E cuidado com a armadilha ANTHROPIC_API_KEY acima, ou você pagará dos dois jeitos.
Como pagar menos pela API do Claude
Três alavancas reduzem a fatura padrão sem alterar os modelos.
1. Cache de prompts (até 90% de desconto em contexto repetido)
Faça cache de um prefixo estável — um prompt de sistema longo, documentos recuperados, exemplos few-shot — e as leituras do cache custam 0,1× da taxa de entrada, um desconto de 90%. O porém é a gravação: uma gravação em cache de 5 minutos custa 1,25× e se paga após uma leitura; uma gravação de 1 hora custa 2× e se paga após duas. Para qualquer coisa com um grande preâmbulo fixo repetido várias vezes, esta é a maior alavanca isolada. (Documentação de cache.)
2. API em lote (50% de desconto, em ambas as direções)
Para qualquer coisa que não precise de uma resposta em tempo real, a Batch API oferece 50% de desconto na entrada e na saída e retorna em até 24 horas. O Sonnet 4.6 cai para $1.50/$7.50; o Haiku 4.5 para $0.50/$2.50. O cache e o batching se somam, reduzindo o custo efetivo para bem menos da metade da tarifa exibida.
3. Roteamento de modelos e limites de saída
Não execute todas as solicitações no Opus. Direcione classificação, sumarização e lógica de roteamento para Haiku, reserve Sonnet para o meio e chame o Opus apenas quando a tarefa realmente exigir — comumente um corte de 40–60% por si só. E, como a saída custa 5× o preço da entrada, limitar max_tokens é uma das alavancas de maior impacto: reduzir a saída média de 800 para 500 tokens em um milhão de chamadas economiza dinheiro de verdade todo mês.
API oficial vs. plataformas de relay: você pode pagar menos?
Existe uma quarta rota que a documentação oficial não mencionará: comprar os mesmos modelos Claude por meio de um relay. Um relay de API (ou agregador) fica entre você e a Anthropic, expõe um endpoint compatível com a Anthropic e cobra sua própria tarifa.
Por que um relay pode ser mais barato? Três mecanismos, principalmente: relays compram em volume com uso comprometido, o que gera descontos que uma conta individual não consegue alcançar; eles roteiam com eficiência entre regiões e provedores; e muitos operam com margens muito apertadas (ou como oferta de isca) para conquistar desenvolvedores. Mas um desconto tão grande precisa vir de algum lugar — entenda o modelo de uma plataforma antes de depender dela.
Os descontos variam bastante. Veja como três opções se comparam para os mesmos modelos Claude:
Plataforma | Desconto vs lista da Anthropic | Cobertura de modelos | Observações |
|---|---|---|---|
API oficial da Anthropic | — (referência) | Todos, incl. Fable 5 / Opus 4.8 | Cache, lote, todos os recursos |
≈ lista (repassa o preço do provedor) | Muitos modelos, múltiplos provedores | Agregador; conveniência em vez de economia | |
EvoLink | ~10% de desconto | Até Opus 4.7 | Endpoint compatível com OpenAI |
~80% de desconto | Até Opus 4.6 | Compatível com Anthropic; cache repassado |
AIReiter fica na extremidade mais agressiva. Aqui está o que os cerca de 80% principais equivalem por modelo:
Modelo | Oficial (entrada / saída) | AIReiter (entrada / saída) | Você economiza |
|---|---|---|---|
Claude Haiku 4.5 | $1 / $5 | $0.20 / $1.00 | 80% |
Claude Sonnet 4.6 | $3 / $15 | $0.60 / $3.00 | 80% |
Claude Opus 4.6 | $5 / $25 | $1.00 / $5.00 | 80% |
A integração é plug-and-play: o endpoint da AIReiter é compatível com a Anthropic Messages API, então o SDK oficial anthropic funciona alterando duas linhas — aponte base_url para https://aireiter.com/api e troque a chave:
client = anthropic.Anthropic(
api_key="YOUR_AIREITER_KEY",
base_url="https://aireiter.com/api",
)
Streaming, multi-turn, visão e cache_control todos passam, então o desconto de caching de 90% acima se soma à taxa base mais baixa.
FAQ
Por que a API Claude é tão cara?
Muitas vezes, não é a taxa por token — é o design do fluxo de trabalho. Os maiores fatores de custo são executar tudo no Opus quando o Haiku ou o Sonnet seriam suficientes, contexto repetido sem cache, saída sem limite e tokens de raciocínio pelos quais você é cobrado, mas nunca vê. Corrigir isso geralmente importa mais do que o preço anunciado.
Existe uma camada gratuita da API Claude?
Não há um plano gratuito permanente para produção, mas novas contas recebem US$ 5 em créditos gratuitos (não é necessário cartão) para testes. Depois disso, é pagamento conforme o uso.
Preço da API Claude vs ChatGPT — qual é mais barato?
Depende da camada que você compara. Aproximadamente, por milhão de tokens (entrada / saída):
Claude | OpenAI comparável |
|---|---|
Haiku 4.5 — $1 / $5 | GPT mini tier — valores baixos de um dígito |
Sonnet 4.6 — $3 / $15 | faixa intermediária — comparável |
Opus 4.8 — $5 / $25 | GPT-5.5 — ~$5 / $30 |
Como calculo minha fatura mensal da API Claude?
Estime assim: (requests × avg input tokens ÷ 1,000,000 × input rate) + (requests × avg output tokens ÷ 1,000,000 × output rate). Use o endpoint de contagem de tokens para obter contagens precisas em seus prompts reais — um tokenizer genérico pode ter uma margem de erro de 15–35% no Claude.
Em resumo
Para a maioria das equipes, é uma divisão em três vias: prototipagem ou uso individual → uma assinatura Pro ou Max (mais simples, mais barata abaixo de ~3–4M de tokens/mês); produção no mais recente modelo flagship (Opus 4.8, Fable 5) → a API oficial com caching, batching e routing ativados; produção em que Sonnet 4.6 ou Opus 4.6 é suficiente → um relay confiável como o AIReiter pode reduzir a mesma conta em até 80% com uma troca de SDK plug-and-play.
Seja qual for a sua escolha, a maioria das equipes paga a mais por deixar de lado as otimizações, não por escolher o nível errado — então ative as alavancas antes de se preocupar com a tabela de preços.