A API da DeepSeek ficou mais cara em 16 de agosto de 2026. As tarifas fixas por token deram lugar a preços de pico e fora de pico, tanto no deepseek-v4-flash quanto no deepseek-v4-pro. Fora do pico, entrada sem acerto no cache e saída passaram a custar de 1,5× a 2,4× mais; no pico, o valor dobra. Já a entrada atendida pelo cache subiu de 2,5× a 6,1× fora do pico e pode chegar a 12,1× no pico. Para saber o tamanho do impacto na sua conta, o indicador decisivo é a taxa de acerto do cache de prompts.
O que mudou em 16 de agosto de 2026
A mudança entrou em vigor às 16:00 UTC de domingo, 16 de agosto — meia-noite de 17 de agosto em Pequim — segundo tanto a thread do anúncio quanto a auditoria de 650 chamadas no r/DeepSeek. A página oficial de modelos e preços já traz as novas tabelas, portanto não se trata apenas de um anúncio: a cobrança já foi alterada.
A DeepSeek passou a dividir a cobrança entre janelas de pico e fora de pico. As tarifas de pico são exatamente 2× as tarifas fora de pico. Há duas faixas de pico: de 01:00 a 04:00 UTC e de 06:00 a 10:00 UTC — sete horas de pico e dezessete horas fora de pico por dia. As versões dos modelos (DeepSeek-V4-Flash-0731, DeepSeek-V4-Pro-0813), a compatibilidade da API e as especificações publicadas permanecem inalteradas nessa mesma página. É uma mudança de cobrança, não de modelo.
Novos preços da API DeepSeek
Todos os valores abaixo estão em USD por 1 milhão de tokens e foram extraídos diretamente da página oficial de preços em 16 de agosto de 2026.
| V4 Flash | Fora de pico | Pico |
|---|---|---|
| Entrada, acerto de cache | $0.007 | $0.014 |
| Entrada, sem acerto de cache | $0.22 | $0.44 |
| Saída | $0.66 | $1.32 |
| V4 Pro | Fora de pico | Pico |
|---|---|---|
| Entrada, acerto de cache | $0.022 | $0.044 |
| Entrada, sem acerto de cache | $0.66 | $1.32 |
| Saída | $1.98 | $3.96 |
Os demais mecanismos de cobrança não mudaram: cada solicitação é tarifada conforme o preço vigente no momento da execução, e a DeepSeek deixa explícito que pode alterar os preços novamente.
Quanto a API DeepSeek realmente ficou mais cara?
Os preços fixos anteriores foram confirmados por rastreadores de terceiros até 31 de julho de 2026: Flash cobrava $0.14 por entrada sem acerto de cache, $0.0028 por acerto de cache e $0.28 por saída; no Pro, eram $0.435 / $0.003625 / $0.87 (TLDL, BenchLM). Veja a comparação direta:
| Por 1M de tokens | Tarifa fixa anterior | Novo fora de pico | Novo pico | Fora de pico vs. anterior | Pico vs. anterior |
|---|---|---|---|---|---|
| Entrada Flash, acerto de cache | $0.0028 | $0.007 | $0.014 | 2.5× | 5.0× |
| Entrada Flash, sem acerto de cache | $0.14 | $0.22 | $0.44 | 1.57× | 3.14× |
| Saída Flash | $0.28 | $0.66 | $1.32 | 2.36× | 4.71× |
| Entrada Pro, acerto de cache | $0.003625 | $0.022 | $0.044 | 6.07× | 12.14× |
| Entrada Pro, sem acerto de cache | $0.435 | $0.66 | $1.32 | 1.52× | 3.03× |
| Saída Pro | $0.87 | $1.98 | $3.96 | 2.28× | 4.55× |
A manchete de “aumento de 1.114%” que circula no Reddit é verdadeira, mas retrata um caso específico: entrada com acerto de cache do V4 Pro no pico ($0.003625 -> $0.044). Uma carga sem cache, fora do pico, fica mais próxima de 1,5–2,3×. O multiplicador real para a sua operação estará em algum ponto entre esses extremos — e é isso que define a história.
Por que operações dependentes de cache sentem mais
Os preços de acerto de cache aumentaram de 2,5× a 12×, enquanto entrada sem cache e saída subiram de 1,5× a 4,7×. Assim, quanto maior era a parcela do seu volume de entrada processada pela faixa extremamente barata de acerto de cache, maior será o aumento percentual. Um usuário do r/DeepSeek recalculou 650 chamadas reais de API — 16 sessões, 155.9M de tokens de prompt e taxa de acerto de cache de 98.09% — usando as duas tabelas de preço, e conciliou o resultado com a cobrança no console da DeepSeek, com diferença de até 2%:
"quanto melhor o cache funciona para você hoje, maior será o seu aumento" — u/Swimming-Soup-1173, auditoria de 650 chamadas de API no r/DeepSeek
A carga de agentes desse usuário foi recalculada em 2.7× fora do pico, ante 1,5× para a mesma carga sem nenhum acerto de cache. Outro usuário modelou uma carga com contexto longo que passaria de $33 para $100 fora do pico ou $200 no pico — uma alta de 3× a 6×. Jobs em lote, pipelines de RAG e agentes com prompts de sistema estáticos são os perfis mais pressionados; em comparação, tráfego de sumarização pontual fica mais perto do piso de 1,5–2,3× fora do pico.
Horários de pico no seu fuso
A página oficial informa apenas as janelas em UTC. A conversão para agosto, com horário de verão em vigor onde aplicável, fica assim:
| Fuso | Janelas de pico locais | Seu horário comercial |
|---|---|---|
| Pequim (UTC+8) | 09:00–12:00, 14:00–18:00 | Pico, exceto no almoço entre 12:00 e 14:00 |
| Europa Central (UTC+2) | 03:00–06:00, 08:00–12:00 | Manhãs são horário de pico |
| Londres (UTC+1) | 02:00–05:00, 07:00–11:00 | Manhãs são horário de pico |
| Leste dos EUA (UTC-4) | 21:00–00:00, 02:00–06:00 | Integralmente fora de pico |
| Oeste dos EUA (UTC-7) | 18:00–21:00, 23:00–03:00 | Integralmente fora de pico |
As janelas de pico cobrem o horário comercial chinês, menos o período de almoço: das 12:00 às 14:00 no horário de Pequim é fora de pico. Equipes nos EUA trabalham o dia inteiro com tarifas fora de pico. Na Europa, porém, lotes executados pela manhã custam o dobro — das 08:00 às 12:00 CEST é pico — e devem ser deslocados para a tarde ou a madrugada.
Ainda vale a pena usar cache de prompts?
Sim, sem dúvida. O desconto diminuiu, mas não desapareceu. Antes, a entrada com acerto de cache era cerca de 50× mais barata que a entrada sem cache no Flash e 120× mais barata no Pro. Agora ela segue cerca de 30× mais barata em ambos os modelos: 31× no Flash e 30× no Pro fora do pico ($0.007 contra $0.22; $0.022 contra $0.66). Mesmo o autor da auditoria que calculou a alta de 2.7× chegou à seguinte conclusão:
"O cache continua valendo muito a pena" — a mesma auditoria do r/DeepSeek
Na carga analisada, o cache ainda reduzia os custos em aproximadamente 15× em relação ao envio do mesmo contexto sem cache. O cache continua sendo best-effort, sem taxa de acerto garantida, e entradas não utilizadas geralmente são removidas após horas ou dias (BenchLM). Portanto, meça antes de projetar o orçamento: registre os campos prompt_cache_hit_tokens e prompt_cache_miss_tokens do objeto de uso, como o BenchLM recomenda, para calcular sua taxa efetiva de acertos.
Depois do aumento, a DeepSeek ainda é a opção barata?
Fora do pico, sim. No pico, a vantagem do Flash sobre o GPT-5.6 praticamente desaparece. Abaixo estão os preços padrão por 1M de tokens:
| Modelo | Entrada | Saída | Observações |
|---|---|---|---|
| DeepSeek V4 Flash (fora de pico) | $0.22 | $0.66 | Contexto de 1M |
| DeepSeek V4 Flash (pico) | $0.44 | $1.32 | Supera o preço de saída do Luna |
| GPT-5.6 Luna | $0.20 | $1.20 | Corte de preço de 80% em 30 de julho |
| DeepSeek V4 Pro (fora de pico) | $0.66 | $1.98 | Ainda cerca de 6× abaixo do Terra |
| DeepSeek V4 Pro (pico) | $1.32 | $3.96 | Cerca de 3× abaixo do Terra |
| GPT-5.6 Terra | $2 | $12 | |
| Claude Sonnet 5 | $2 | $10 | Tarifa de lançamento até 31 de agosto; depois, $3/$15 |
Fora do pico, os $0.66 por saída do V4 Flash ficam 45% abaixo do GPT-5.6 Luna e 18× abaixo do Terra. A DeepSeek continua sendo a mais barata em saída para tarefas de alto volume. No pico, o Luna ($1.20 de saída e $0.20 de entrada) supera o Flash nas duas tarifas padrão. Ainda assim, a tarifa de leitura de cache do Luna ($0.02/M no changelog do AI Price Index) é mais cara que a faixa de acerto de cache do Flash em qualquer horário. Além disso, o Flash continua listado com contexto de 1M de tokens e concorrência de 2,500 na tabela oficial de especificações. Como resumiu um comentário na thread do anúncio: "DS4 é bom, mas quando é barato."
O que fazer nesta semana
- Recalcule sua própria fatura antes de entrar em pânico. Busque os logs de uso do último mês e calcule: entrada com acerto de cache × taxa de acerto × preço de acerto + entrada sem acerto de cache × taxa de erro × preço sem cache + saída × preço de saída. Aplique a tarifa de pico ou fora de pico correspondente à janela de cada solicitação. Os extremos da auditoria delimitam o intervalo: sem acertos de cache, o custo foi para 1.5×; com taxa de acerto de 98%, para 2.7×.
- Leve o que puder para fora do pico. Jobs de cron, avaliações e processamento de documentos — tudo que não tenha um usuário esperando pode ser executado nas 17 horas fora de pico. Para equipes dos EUA, isso quase não exige esforço, pois o horário de trabalho já é fora de pico; na UE, mova os lotes da manhã para a tarde.
- Continue gerando acertos de cache. Mantenha a estrutura de prompt que já produz acertos no seu caso. A faixa de acerto de cache continua cerca de 30× mais barata que a entrada sem cache.
- Teste usar o Flash nas chamadas rotineiras. O Pro custa 3× o Flash em toda a tabela, ou 3.1× nos acertos de cache. Se você não testou o Flash desde a atualização pós-treinamento 0731, direcione uma parte do tráfego rotineiro para ele. Os trade-offs de seleção de modelo estão detalhados em nossa comparação entre V4 Flash e V4 Pro.
- Se for migrar, a troca pode ser pequena. Em clientes compatíveis com OpenAI, talvez baste alterar a URL base e o ID do modelo. Hosts de terceiros e plataformas de relay usam tabelas próprias. O DataLLM Lab documentou hosts que cobravam cerca de $1.74/$3.48 por 1M no V4 Pro antes mesmo deste aumento. Compare a tarifa efetiva, não o preço de vitrine.
A decisão, resumida em uma tabela:
| Seu perfil | Recomendação |
|---|---|
| Fuso dos EUA, tráfego de agentes muito dependente de cache | Fique — as tarifas fora de pico e a faixa de cache cerca de 30× mais barata mantêm o custo de entrada mais baixo para tráfego dependente de cache |
| Fuso europeu, jobs em lote pela manhã | Fique e reagende — a exposição ao pico é evitável e causada pelo próprio agendamento |
| Apenas horário de pico, programação sensível à qualidade no Pro | Reavalie — a saída do Pro no pico ($3.96) ainda custa menos que o Terra ($12), mas a diferença agora é de 3×, não das 14× anteriores a 16 de agosto |
| Cargas pontuais sem cache | Fique — a alta de 1.5–2.3× fora de pico é a menor da tabela |
Perguntas frequentes
Quando os novos preços da DeepSeek entraram em vigor?
Em 16 de agosto de 2026, às 16:00 UTC, ou meia-noite de 17 de agosto no horário de Pequim, segundo a thread do anúncio e a auditoria de 650 chamadas no r/DeepSeek. A página oficial de preços exibiu as novas tabelas no mesmo dia.
Quanto minha fatura da DeepSeek vai aumentar?
Uma carga sem cache passa a custar cerca de 1.5× fora do pico, enquanto uma carga medida com taxa de acerto de 98% ficou em 2.7×. No pico, esses valores dobram, chegando a 12× na entrada com acerto de cache do Pro. A tabela de multiplicadores acima traz todos os pares de tarifas.
Quais são os horários de pico nos EUA?
No leste dos EUA: 21:00–00:00 e 02:00–06:00. No Pacífico dos EUA: 18:00–21:00 e 23:00–03:00. O horário comercial normal nos EUA fica inteiramente dentro das janelas fora de pico.
deepseek-chat e deepseek-reasoner ainda estão disponíveis?
Não. Os aliases legados chegaram ao prazo de desativação em 24 de julho de 2026, segundo o histórico de IDs de modelo do BenchLM. Novas integrações devem chamar deepseek-v4-flash ou deepseek-v4-pro.
A DeepSeek ainda é mais barata que GPT-5.6 e Claude?
Fora do pico, sim: a saída do Flash custa 45% menos que o GPT-5.6 Luna e 18× menos que o Terra. No pico, os $1.20/M de saída do Luna ficam abaixo dos $1.32/M do Flash. Portanto, a resposta depende do horário em que seu tráfego é executado.