AIREITER

Aumento de preço da API DeepSeek: tarifas antigas vs. novas (ago. de 2026)

Última Atualização: 2026-08-16 19:01:27

A API da DeepSeek ficou mais cara em 16 de agosto de 2026. As tarifas fixas por token deram lugar a preços de pico e fora de pico, tanto no deepseek-v4-flash quanto no deepseek-v4-pro. Fora do pico, entrada sem acerto no cache e saída passaram a custar de 1,5× a 2,4× mais; no pico, o valor dobra. Já a entrada atendida pelo cache subiu de 2,5× a 6,1× fora do pico e pode chegar a 12,1× no pico. Para saber o tamanho do impacto na sua conta, o indicador decisivo é a taxa de acerto do cache de prompts.

O que mudou em 16 de agosto de 2026

A mudança entrou em vigor às 16:00 UTC de domingo, 16 de agosto — meia-noite de 17 de agosto em Pequim — segundo tanto a thread do anúncio quanto a auditoria de 650 chamadas no r/DeepSeek. A página oficial de modelos e preços já traz as novas tabelas, portanto não se trata apenas de um anúncio: a cobrança já foi alterada.

A DeepSeek passou a dividir a cobrança entre janelas de pico e fora de pico. As tarifas de pico são exatamente 2× as tarifas fora de pico. Há duas faixas de pico: de 01:00 a 04:00 UTC e de 06:00 a 10:00 UTC — sete horas de pico e dezessete horas fora de pico por dia. As versões dos modelos (DeepSeek-V4-Flash-0731, DeepSeek-V4-Pro-0813), a compatibilidade da API e as especificações publicadas permanecem inalteradas nessa mesma página. É uma mudança de cobrança, não de modelo.

Novos preços da API DeepSeek

Todos os valores abaixo estão em USD por 1 milhão de tokens e foram extraídos diretamente da página oficial de preços em 16 de agosto de 2026.

V4 FlashFora de picoPico
Entrada, acerto de cache$0.007$0.014
Entrada, sem acerto de cache$0.22$0.44
Saída$0.66$1.32
V4 ProFora de picoPico
Entrada, acerto de cache$0.022$0.044
Entrada, sem acerto de cache$0.66$1.32
Saída$1.98$3.96
Página oficial de preços da API DeepSeek mostrando as novas tarifas de pico e fora de pico, 16 de agosto de 2026

Os demais mecanismos de cobrança não mudaram: cada solicitação é tarifada conforme o preço vigente no momento da execução, e a DeepSeek deixa explícito que pode alterar os preços novamente.

Quanto a API DeepSeek realmente ficou mais cara?

Os preços fixos anteriores foram confirmados por rastreadores de terceiros até 31 de julho de 2026: Flash cobrava $0.14 por entrada sem acerto de cache, $0.0028 por acerto de cache e $0.28 por saída; no Pro, eram $0.435 / $0.003625 / $0.87 (TLDL, BenchLM). Veja a comparação direta:

Por 1M de tokensTarifa fixa anteriorNovo fora de picoNovo picoFora de pico vs. anteriorPico vs. anterior
Entrada Flash, acerto de cache$0.0028$0.007$0.0142.5×5.0×
Entrada Flash, sem acerto de cache$0.14$0.22$0.441.57×3.14×
Saída Flash$0.28$0.66$1.322.36×4.71×
Entrada Pro, acerto de cache$0.003625$0.022$0.0446.07×12.14×
Entrada Pro, sem acerto de cache$0.435$0.66$1.321.52×3.03×
Saída Pro$0.87$1.98$3.962.28×4.55×
Preços da API DeepSeek V4: tarifa fixa anterior versus novo fora de pico e novo pico, USD por milhão de tokens

A manchete de “aumento de 1.114%” que circula no Reddit é verdadeira, mas retrata um caso específico: entrada com acerto de cache do V4 Pro no pico ($0.003625 -> $0.044). Uma carga sem cache, fora do pico, fica mais próxima de 1,5–2,3×. O multiplicador real para a sua operação estará em algum ponto entre esses extremos — e é isso que define a história.

Por que operações dependentes de cache sentem mais

Os preços de acerto de cache aumentaram de 2,5× a 12×, enquanto entrada sem cache e saída subiram de 1,5× a 4,7×. Assim, quanto maior era a parcela do seu volume de entrada processada pela faixa extremamente barata de acerto de cache, maior será o aumento percentual. Um usuário do r/DeepSeek recalculou 650 chamadas reais de API — 16 sessões, 155.9M de tokens de prompt e taxa de acerto de cache de 98.09% — usando as duas tabelas de preço, e conciliou o resultado com a cobrança no console da DeepSeek, com diferença de até 2%:

"quanto melhor o cache funciona para você hoje, maior será o seu aumento" — u/Swimming-Soup-1173, auditoria de 650 chamadas de API no r/DeepSeek

A carga de agentes desse usuário foi recalculada em 2.7× fora do pico, ante 1,5× para a mesma carga sem nenhum acerto de cache. Outro usuário modelou uma carga com contexto longo que passaria de $33 para $100 fora do pico ou $200 no pico — uma alta de 3× a 6×. Jobs em lote, pipelines de RAG e agentes com prompts de sistema estáticos são os perfis mais pressionados; em comparação, tráfego de sumarização pontual fica mais perto do piso de 1,5–2,3× fora do pico.

Horários de pico no seu fuso

A página oficial informa apenas as janelas em UTC. A conversão para agosto, com horário de verão em vigor onde aplicável, fica assim:

FusoJanelas de pico locaisSeu horário comercial
Pequim (UTC+8)09:00–12:00, 14:00–18:00Pico, exceto no almoço entre 12:00 e 14:00
Europa Central (UTC+2)03:00–06:00, 08:00–12:00Manhãs são horário de pico
Londres (UTC+1)02:00–05:00, 07:00–11:00Manhãs são horário de pico
Leste dos EUA (UTC-4)21:00–00:00, 02:00–06:00Integralmente fora de pico
Oeste dos EUA (UTC-7)18:00–21:00, 23:00–03:00Integralmente fora de pico

As janelas de pico cobrem o horário comercial chinês, menos o período de almoço: das 12:00 às 14:00 no horário de Pequim é fora de pico. Equipes nos EUA trabalham o dia inteiro com tarifas fora de pico. Na Europa, porém, lotes executados pela manhã custam o dobro — das 08:00 às 12:00 CEST é pico — e devem ser deslocados para a tarde ou a madrugada.

Ainda vale a pena usar cache de prompts?

Sim, sem dúvida. O desconto diminuiu, mas não desapareceu. Antes, a entrada com acerto de cache era cerca de 50× mais barata que a entrada sem cache no Flash e 120× mais barata no Pro. Agora ela segue cerca de 30× mais barata em ambos os modelos: 31× no Flash e 30× no Pro fora do pico ($0.007 contra $0.22; $0.022 contra $0.66). Mesmo o autor da auditoria que calculou a alta de 2.7× chegou à seguinte conclusão:

"O cache continua valendo muito a pena" — a mesma auditoria do r/DeepSeek

Na carga analisada, o cache ainda reduzia os custos em aproximadamente 15× em relação ao envio do mesmo contexto sem cache. O cache continua sendo best-effort, sem taxa de acerto garantida, e entradas não utilizadas geralmente são removidas após horas ou dias (BenchLM). Portanto, meça antes de projetar o orçamento: registre os campos prompt_cache_hit_tokens e prompt_cache_miss_tokens do objeto de uso, como o BenchLM recomenda, para calcular sua taxa efetiva de acertos.

Depois do aumento, a DeepSeek ainda é a opção barata?

Fora do pico, sim. No pico, a vantagem do Flash sobre o GPT-5.6 praticamente desaparece. Abaixo estão os preços padrão por 1M de tokens:

ModeloEntradaSaídaObservações
DeepSeek V4 Flash (fora de pico)$0.22$0.66Contexto de 1M
DeepSeek V4 Flash (pico)$0.44$1.32Supera o preço de saída do Luna
GPT-5.6 Luna$0.20$1.20Corte de preço de 80% em 30 de julho
DeepSeek V4 Pro (fora de pico)$0.66$1.98Ainda cerca de 6× abaixo do Terra
DeepSeek V4 Pro (pico)$1.32$3.96Cerca de 3× abaixo do Terra
GPT-5.6 Terra$2$12
Claude Sonnet 5$2$10Tarifa de lançamento até 31 de agosto; depois, $3/$15

Fora do pico, os $0.66 por saída do V4 Flash ficam 45% abaixo do GPT-5.6 Luna e 18× abaixo do Terra. A DeepSeek continua sendo a mais barata em saída para tarefas de alto volume. No pico, o Luna ($1.20 de saída e $0.20 de entrada) supera o Flash nas duas tarifas padrão. Ainda assim, a tarifa de leitura de cache do Luna ($0.02/M no changelog do AI Price Index) é mais cara que a faixa de acerto de cache do Flash em qualquer horário. Além disso, o Flash continua listado com contexto de 1M de tokens e concorrência de 2,500 na tabela oficial de especificações. Como resumiu um comentário na thread do anúncio: "DS4 é bom, mas quando é barato."

O que fazer nesta semana

  1. Recalcule sua própria fatura antes de entrar em pânico. Busque os logs de uso do último mês e calcule: entrada com acerto de cache × taxa de acerto × preço de acerto + entrada sem acerto de cache × taxa de erro × preço sem cache + saída × preço de saída. Aplique a tarifa de pico ou fora de pico correspondente à janela de cada solicitação. Os extremos da auditoria delimitam o intervalo: sem acertos de cache, o custo foi para 1.5×; com taxa de acerto de 98%, para 2.7×.
  2. Leve o que puder para fora do pico. Jobs de cron, avaliações e processamento de documentos — tudo que não tenha um usuário esperando pode ser executado nas 17 horas fora de pico. Para equipes dos EUA, isso quase não exige esforço, pois o horário de trabalho já é fora de pico; na UE, mova os lotes da manhã para a tarde.
  3. Continue gerando acertos de cache. Mantenha a estrutura de prompt que já produz acertos no seu caso. A faixa de acerto de cache continua cerca de 30× mais barata que a entrada sem cache.
  4. Teste usar o Flash nas chamadas rotineiras. O Pro custa 3× o Flash em toda a tabela, ou 3.1× nos acertos de cache. Se você não testou o Flash desde a atualização pós-treinamento 0731, direcione uma parte do tráfego rotineiro para ele. Os trade-offs de seleção de modelo estão detalhados em nossa comparação entre V4 Flash e V4 Pro.
  5. Se for migrar, a troca pode ser pequena. Em clientes compatíveis com OpenAI, talvez baste alterar a URL base e o ID do modelo. Hosts de terceiros e plataformas de relay usam tabelas próprias. O DataLLM Lab documentou hosts que cobravam cerca de $1.74/$3.48 por 1M no V4 Pro antes mesmo deste aumento. Compare a tarifa efetiva, não o preço de vitrine.

A decisão, resumida em uma tabela:

Seu perfilRecomendação
Fuso dos EUA, tráfego de agentes muito dependente de cacheFique — as tarifas fora de pico e a faixa de cache cerca de 30× mais barata mantêm o custo de entrada mais baixo para tráfego dependente de cache
Fuso europeu, jobs em lote pela manhãFique e reagende — a exposição ao pico é evitável e causada pelo próprio agendamento
Apenas horário de pico, programação sensível à qualidade no ProReavalie — a saída do Pro no pico ($3.96) ainda custa menos que o Terra ($12), mas a diferença agora é de 3×, não das 14× anteriores a 16 de agosto
Cargas pontuais sem cacheFique — a alta de 1.5–2.3× fora de pico é a menor da tabela

Perguntas frequentes

Quando os novos preços da DeepSeek entraram em vigor?

Em 16 de agosto de 2026, às 16:00 UTC, ou meia-noite de 17 de agosto no horário de Pequim, segundo a thread do anúncio e a auditoria de 650 chamadas no r/DeepSeek. A página oficial de preços exibiu as novas tabelas no mesmo dia.

Quanto minha fatura da DeepSeek vai aumentar?

Uma carga sem cache passa a custar cerca de 1.5× fora do pico, enquanto uma carga medida com taxa de acerto de 98% ficou em 2.7×. No pico, esses valores dobram, chegando a 12× na entrada com acerto de cache do Pro. A tabela de multiplicadores acima traz todos os pares de tarifas.

Quais são os horários de pico nos EUA?

No leste dos EUA: 21:00–00:00 e 02:00–06:00. No Pacífico dos EUA: 18:00–21:00 e 23:00–03:00. O horário comercial normal nos EUA fica inteiramente dentro das janelas fora de pico.

deepseek-chat e deepseek-reasoner ainda estão disponíveis?

Não. Os aliases legados chegaram ao prazo de desativação em 24 de julho de 2026, segundo o histórico de IDs de modelo do BenchLM. Novas integrações devem chamar deepseek-v4-flash ou deepseek-v4-pro.

A DeepSeek ainda é mais barata que GPT-5.6 e Claude?

Fora do pico, sim: a saída do Flash custa 45% menos que o GPT-5.6 Luna e 18× menos que o Terra. No pico, os $1.20/M de saída do Luna ficam abaixo dos $1.32/M do Flash. Portanto, a resposta depende do horário em que seu tráfego é executado.