O preço de destaque do Sonnet 5 é menor do que o do Sonnet 4.6 ($2/$10 introductory through Aug 31, 2026, vs. Sonnet 4.6's $3/$15), e o próprio gráfico de lançamento da Anthropic o chama de uma "strict improvement" em relação ao Sonnet 4.6. Executamos ambos os modelos na mesma tarefa em vários níveis de esforço para ver o que isso significa na prática. Resultado: no nosso teste, o Sonnet 5 custou mais do que o Sonnet 4.6 em todos os níveis de esforço que tentamos — não menos. Eis o que descobrimos e por quê.
Uma tarefa, execuções únicas. Tudo abaixo vem de uma única tarefa de programação, uma execução por configuração de modelo/esforço. Considere os números específicos como indicativos, não como um benchmark estatisticamente متوسطizado — o prompt exato e uma amostra da saída bruta da API estão no apêndice, se você quiser reproduzi-lo em sua própria carga de trabalho.
O Sonnet 5 é realmente mais barato que o Sonnet 4.6? Nós testamos.
Deixamos para ambos os modelos a mesma tarefa — construir um rate limiter de token-bucket em Python com testes, executar os testes, corrigir qualquer falha — via o Claude Code CLI (claude -p --model <id> --effort <level> --output-format json), então custo e duração vêm diretamente da resposta da API. Execução em 2026-07-01.
Configuração | Custo | Duração | Turnos | Resultado |
|---|---|---|---|---|
Sonnet 5, effort | $0.344 | 31.6s | 5 | 6/6 testes aprovados |
Sonnet 4.6, effort | $0.261 | 36.0s | 6 | 7/7 testes aprovados |
Sonnet 4.6, effort | $0.253 | 35.3s | 5 | 7/7 testes aprovados |
Sonnet 5, effort | $0.349 | 36.4s | 5 | 8/8 testes aprovados |
Sonnet 5 foi mais rápido no esforço medium, mas custou mais do que o Sonnet 4.6 em ambas as configurações do Sonnet 4.6 que testamos — incluindo o Sonnet 4.6 executando em uma configuração de esforço mais baixa. Isso é o oposto de alguns relatos anedóticos da comunidade que afirmam que o Sonnet 5 fica mais barato do que o Sonnet 4.6 quando você compara níveis de esforço equivalentes.
A causa provável: o Sonnet 5 roda em um novo tokenizer. A própria documentação da Anthropic afirma que ele produz "aproximadamente 30% mais tokens" do que o Sonnet 4.6 para o mesmo texto, e testes independentes de Simon Willison constataram que conteúdos em inglês especificamente chegam a usar até ~1,4x mais tokens. O preço inicial mais baixo do Sonnet 5 não compensou totalmente isso em nossa tarefa de teste e, após 31 de agosto de 2026 — quando o preço promocional do Sonnet 5 expira e ambos os modelos passam a ter a mesma tarifa de tabela de $3/$15 —, a diferença de tokenizer por si só sugere que o Sonnet 5 provavelmente custará mais para trabalhos equivalentes em inglês, e não o mesmo, na ausência de quaisquer outras mudanças de preço. (Detalhamento completo por idioma em nosso guia de preços do Sonnet 5.)
O que mais mudou, além do custo
Em benchmarks oficiais, o Sonnet 5 apresenta ganhos reais: 80,4% vs. 67,0% no Terminal-Bench 2.1, 63,2% vs. 58,1% no SWE-bench Pro, ambos conforme o system card do Claude Sonnet 5 da Anthropic (veja nossa tabela completa de benchmarks, incluindo Opus 4.8). O gráfico do anúncio de lançamento da própria Anthropic descreve o Sonnet 5 como uma "strict improvement" em relação ao Sonnet 4.6.
Analisando nossos próprios quatro resultados de teste, uma diferença comportamental se destacou e a tabela de benchmark não captura: o Sonnet 5 adicionou coisas que não pedimos. Em ambos os níveis de esforço, ele usou um relógio falso com monkeypatch nos testes para evitar chamadas reais de time.sleep(), e no esforço high ele adicionou thread-safety ao limitador de taxa sem que isso fosse solicitado. O Sonnet 4.6, em ambos os níveis de esforço, permaneceu mais próximo da descrição literal da tarefa — usando time.sleep() real nos testes e, no esforço medium, adicionou uma tabela de resumo para facilitar a leitura, mas nada à implementação real além do que foi solicitado.
Isso está alinhado com o feedback real de usuários publicado no primeiro dia do lançamento do Sonnet 5: um thread do r/claude o descreveu como "uma melhoria objetiva em relação ao Sonnet 4.6 em termos de raciocínio... mas também parece MUITO mais tenso do que o 4.6." Nosso teste é uma amostra de uma tarefa, mas "adiciona escopo não solicitado com mais facilidade" é uma versão concreta e específica dessa mesma observação.
Deveria fazer o upgrade?
Atualize se sua carga de trabalho for principalmente em chinês (a mudança no tokenizador quase não afeta a contagem de tokens em chinês) ou se você estiver fazendo trabalho agentic/intensivo em ferramentas, em que os ganhos do Terminal-Bench e do SWE-bench importam mais do que um aumento modesto de custo.
Espere se sua carga de trabalho for de alto volume e predominantemente em inglês, e o Sonnet 4.6 já estiver atendendo ao seu padrão de qualidade — refaça sua própria conta de custos em vez de confiar no preço de tabela, especialmente quando a janela de preços introdutórios se encerrar em 31 de agosto de 2026.
De qualquer forma, não presuma que o modelo mais novo e aparentemente mais barato automaticamente custe menos por tarefa. Em nosso teste, não custou.
FAQ
O Sonnet 5 é realmente uma "melhoria rigorosa" em relação ao Sonnet 4.6, como a Anthropic diz?
Nos benchmarks de capacidade que a Anthropic publicou, sim — não encontramos nenhum em que o Sonnet 4.6 liderasse. No custo por tarefa, nosso teste encontrou o oposto quando você considera a mudança no tokenizador, então a "melhoria estrita" não se estende à eficiência de custo para todas as cargas de trabalho.
Por que o Sonnet 5 parece "mais na defensiva" do que o Sonnet 4.6?
A Anthropic não publicou detalhes sobre isso. Pelas nossas próprias saídas de teste, o Sonnet 5 estava mais disposto a adicionar escopo não solicitado (thread-safety, uma configuração de test-clock mais defensiva) do que o Sonnet 4.6, que ficou mais próximo da solicitação literal. Isso é consistente com — embora mais limitado do que — a descrição da comunidade.
Sonnet 5 é o modelo padrão agora? Ainda posso usar o Sonnet 4.6?
De acordo com o anúncio de lançamento da Anthropic, o Sonnet 5 substituiu o Sonnet 4.6 como padrão para usuários Free e Pro no claude.ai. Usuários Max, Team e Enterprise, assim como usuários da API, ainda podem selecionar diretamente o Sonnet 4.6.
Devo comparar Sonnet 5 com Sonnet 4.6 ou com Opus 4.8?
Uma decisão totalmente diferente. Esta página trata da atualização geracional; se você está escolhendo especificamente entre Sonnet 5 e Opus 4.8, realizamos um conjunto separado de testes lado a lado — veja Sonnet 5 vs Opus 4.8: testes reais.
A afirmação de que "o nível de esforço mais alto é mais barato" que as pessoas estão publicando online é real?
Não no nosso teste. Executamos o Sonnet 5 em medium e high contra o Sonnet 4.6 em low e medium, e o Sonnet 5 custou mais em todas as combinações. Relatos anedóticos individuais variam conforme a tarefa — faça sua própria comparação em sua carga de trabalho real antes de assumir uma sobreposição específica de nível de esforço.
Apêndice: Prompt Exato e Saída Bruta
A tarefa que enviamos para ambos os modelos:
Implemente um limitador de taxa token-bucket como uma classe Python `RateLimiter(capacity: int,
refill_rate: float)` com um método `allow() -> bool` que retorna se uma solicitação
é permitida agora, consumindo um token se for. Use um relógio monotônico, sem dependências
externas. Salve-o em limiter.py.
Depois, escreva test_limiter.py com pelo menos 5 casos de teste cobrindo: rajada até a capacidade
sucede e então bloqueia, tokens se reabastecem ao longo do tempo (use time.sleep ou um relógio
mockável), a taxa de reabastecimento é respeitada (sem recarga total instantânea), a capacidade
nunca é excedida, e capacidade zero/negativa é tratada de forma sensata.
Execute os testes com pytest e certifique-se de que todos passam. Se algum falhar, corrija o código e
execute novamente até que todos passem. Informe a saída final do pytest.
A resposta real da API para a execução do Sonnet 5 (medium), resumida aos campos relevantes para custo e tempo:
{
"duration_ms": 31616,
"num_turns": 5,
"stop_reason": "end_turn",
"total_cost_usd": 0.3438645,
"usage": {
"input_tokens": 4302,
"cache_creation_input_tokens": 60894,
"cache_read_input_tokens": 233420,
"output_tokens": 2172
}
}