O DeepSeek V4 Pro agora custa US$ 0,435 por milhão de tokens de entrada e US$ 0,87 por milhão de saída na API oficial. O mesmo modelo no Azure AI Foundry ainda está listado a US$ 1,74 e US$ 3,48, exatamente o preço anterior ao corte. Essa diferença de 4x, verificada em 14 de julho de 2026, é o fato mais importante sobre a dinâmica de custos de IA empresarial da DeepSeek neste momento: o que sua empresa paga depende menos do modelo e mais da porta pela qual você entra para acessá-lo.
Este artigo coloca números com data na API direta e no Azure, testa um caminho de revenda, executa a mesma carga de trabalho por ambos os modelos V4 e termina com um framework de decisão, além de um prazo: os antigos aliases deepseek-chat e deepseek-reasoner serão desativados em 24 de julho de 2026.
Preços do DeepSeek V4 hoje: os números que importam
Aqui está a lista oficial de preços da documentação da API da DeepSeek, verificada em 14 de julho de 2026:
| Modelo | Entrada (cache hit) | Entrada (cache miss) | Saída | Contexto | Limite de concorrência |
|---|---|---|---|---|---|
| deepseek-v4-flash | $0.0028/M | $0.14/M | $0.28/M | 1M tokens | 2,500 |
| deepseek-v4-pro | $0.003625/M | $0.435/M | $0.87/M | 1M tokens | 500 |
Três detalhes nessa tabela importam mais do que as taxas principais:
- O preço de cache hit é o preço real para cargas de trabalho de agentes. Um cache hit no V4 Pro custa US$ 0,003625 por milhão de tokens, 120x mais barato do que um cache miss. Sistemas de agentes que reenviam o mesmo system prompt e as definições de ferramentas em cada chamada vivem praticamente inteiramente no território de cache, e o DeepSeek aplica o cache automaticamente, sem configuração.
- Não há asterisco promocional. A redução de 75% que começou como uma promoção de lançamento agora é o preço de tabela. A página de preços não tem data de expiração. A reportagem da InfoWorld atribuiu a permanência à engenharia do V4 Pro: aproximadamente um quarto do compute por token de seu predecessor em contexto longo, então o corte é estrutural, não um subsídio.
- O prazo do alias é real. Os nomes de modelo
deepseek-chatedeepseek-reasonerestão depreciados em 24 de julho de 2026 às 15:59 UTC. Código de produção que ainda chama esses nomes precisa de uma migração de uma linha paradeepseek-v4-flashoudeepseek-v4-pro. Como os novos padrões rodam em thinking mode, as contagens de tokens de saída (e as contas) vão mudar se você não definir o mode explicitamente.
Ambos os modelos oferecem uma janela de contexto de 1M tokens e até 384K tokens de saída, e a API agora disponibiliza um formato compatível com Anthropic em api.deepseek.com/anthropic, além do formato OpenAI, o que é importante se sua equipe quiser substituir o DeepSeek em ferramentas desenvolvidas para o Claude.
O corte de 75% não chegou a todos os canais
Azure AI Foundry vende o mesmo DeepSeek-V4 Pro por US$ 1,74 de entrada e US$ 3,48 de saída por milhão de tokens (Implantação global, Centro dos EUA, verificado em 14 de julho de 2026). Esse é o preço anterior ao corte, inalterado. O V4 Flash na Azure custa US$ 0,19/US$ 0,51: um acréscimo de 36% na entrada e de 82% na saída em relação à taxa de cache miss da API direta.
Na página de preços do Azure que verificamos (implantação global, US Central, 14 de julho de 2026), nenhum item de linha de entrada em cache aparece para nenhum modelo DeepSeek; confirme com sua equipe de conta da Microsoft, pois os preços do marketplace podem ficar atrás dos preços do fornecedor. Na API direta, uma carga de trabalho de agente com reutilização intensa de prefixo paga frações de centavo por milhão de tokens de entrada; no Azure, cada um desses tokens é cobrado pela taxa integral. Para cargas de trabalho com uso intenso de cache, a diferença efetiva não é 4x; ela pode exceder 100x no lado da entrada.
Para ser justo com a Azure, você não está comprando a mesma coisa. O hosting do Foundry mantém o tráfego dentro da nuvem da Microsoft, sob os termos de processamento de dados da Microsoft, com SLAs da Azure e sem dados saindo para servidores operados por uma empresa chinesa, o que para muitas equipes de conformidade é exatamente o objetivo. A Microsoft está se posicionando exatamente dessa forma ao integrar o DeepSeek ao roteamento multi-modelo do Copilot. Mas esse prêmio de governança agora é quantificável: para a carga de trabalho de referência abaixo, é a diferença entre US$ 31 e US$ 209 por mês por carga de trabalho, e as equipes de compras devem precificá-lo como um item separado, não absorvê-lo como um padrão invisível.
Os agregadores e revendedores de API ficam no meio. Plataformas como OpenRouter repassam preços próximos à tarifa oficial, e relatos da comunidade observam que o cache global da DeepSeek ainda se aplica por meio deles. O problema é a visibilidade; mais sobre isso abaixo, porque testamos isso.
O que custa uma carga de trabalho empresarial real
As tarifas no papel só se tornam decisões quando você as multiplica por uma carga de trabalho. Tome um assistente empresarial de médio porte: 100M de tokens de entrada por mês (50% de acerto de cache, uma taxa conservadora para tráfego de agentes que reenviam prompts de sistema constantemente) mais 10M de tokens de saída. Aqui está essa mesma carga de trabalho precificada em seis canais, usando tarifas verificadas em 14 de julho de 2026:
| Canal | Custo mensal |
|---|---|
| DeepSeek V4 Flash, API direta | $9.94 |
| Azure V4 Flash Global | $24.10 |
| DeepSeek V4 Pro, API direta | $30.63 |
| GPT-5.6-Luna (OpenAI) | $115.00 |
| Azure V4 Pro Global | $208.80 |
| GPT-5.6-Sol (OpenAI) | $575.00 |
A matemática por trás da tabela é reutilizável: custo mensal = miss_tokens x miss_rate + hit_tokens x hit_rate + output_tokens x output_rate. A participação do cache domina isso. A mesma carga de trabalho de 100M entradas no V4 Pro custa diretamente $52.20 por mês com 0% de acerto de cache, $30.63 com 50% e $13.38 com 90% - enquanto na Azure ela permanece em $208.80 nos três casos, porque nenhum desconto de cache é divulgado.
Duas leituras dessa tabela. Primeiro, o canal DeepSeek mais barato e o canal de fronteira mais caro diferem em 58x no mesmo volume de tráfego. Segundo, e menos óbvio: o DeepSeek V4 Pro da Azure custa mais do que o GPT-5.6-Luna da OpenAI. Se o seu resumo de compras diz "padronizamos em DeepSeek para economizar", mas a implantação é no Azure Global, a economia pode ser menor do que a que um modelo OpenAI de nível intermediário entregaria.
O multiplicador que estoura orçamentos é a amplificação agentiva. Um chatbot de turno único cobra aproximadamente uma chamada por pergunta do usuário; um agente em produção encadeia planejamento, recuperação, chamadas de ferramentas e verificação, e a proporção entre entrada e cobrança pode chegar a 1:700, um número que a análise de julho de 2026 da VentureBeat sobre a economia de agentes chama de "problema 100x". Nessa proporção, nossa carga de trabalho de referência de 100 milhões de tokens é o que um recurso de agente moderadamente movimentado gera, não o tráfego de uma empresa inteira. Preços baratos por token não são uma licença para ignorar controles de custo; são o que torna os produtos de agentes viáveis enquanto você os constrói.
Executamos o mesmo trabalho no V4 Flash e no V4 Pro
As páginas de preços não respondem à pergunta que seus engenheiros vão fazer: quanto custa uma única solicitação e quanto tempo ela leva? Em 14 de julho de 2026, enviamos a mesma tarefa de programação - "Write a Python function that parses an ISO 8601 duration string into total seconds, with 3 test cases" - aos dois modelos V4 com as configurações padrão (modo de raciocínio ativado, máximo de 4.000 tokens de saída) por meio de um endpoint de revendedor compatível com OpenAI. Não nomeamos o revendedor porque o ponto é o comportamento da categoria, não de um fornecedor específico; as respostas brutas continham o campo reasoning_content da DeepSeek, que foi como confirmamos o modelo subjacente:
| V4 Flash | V4 Pro | |
|---|---|---|
| Tempo de execução | 15.5s | 35.1s |
| Tokens de conclusão (incl. reasoning) | 1,690 | 1,902 |
| Velocidade efetiva de saída | ~109 tok/s | ~54 tok/s |
| Custo nas taxas oficiais | ~$0.0005 | ~$0.0017 |
As ressalvas, de forma direta: este é um único exemplo, e a latência inclui o overhead do relay, então trate os números de tempo decorrido como um limite superior, e não como um benchmark da API direta. Ambas as respostas retornaram o campo característico reasoning_content da DeepSeek: ambos os modelos executam o modo de raciocínio por padrão, e esses tokens de raciocínio são cobrados como output. O Flash gastou 2.703 caracteres raciocinando sobre uma função de parsing antes de responder. Se sua carga de trabalho não precisa de chain-of-thought, desativar o thinking é uma das otimizações mais baratas disponíveis. Para um comparativo mais aprofundado sobre quando a qualidade extra do Pro justifica 3x o preço, submetemos ambos os modelos a uma comparação completa em DeepSeek V4 Flash vs V4 Pro.
O teste revelou uma descoberta que não vimos documentada em outro lugar: os relatórios de uso do canal de retransmissão não continham detalhamento de cache. Enviamos o mesmo prefixo de 824 tokens duas vezes em seguida — um cache hit clássico, se o revendedor preserva o cache de prefixo do DeepSeek — e a resposta da API informou apenas prompt_tokens, completion_tokens e total_tokens, sem a divisão de prompt_cache_hit_tokens. Na API direta, esse campo é como você verifica se o desconto de cache de 120x está chegando à sua fatura. Por meio de um intermediário, você pode receber o desconto sem conseguir verificá-lo, ou não recebê-lo de forma alguma. Se você comprar DeepSeek por meio de qualquer revendedor, pergunte especificamente se o preço de cache hit é repassado e como ele aparece na sua fatura.
API direta, Azure ou um agregador: como escolher
A decisão de canal se resume a uma tabela curta:
| API direta | Azure AI Foundry | Agregador/revendedor | |
|---|---|---|---|
| Preço do V4 Pro (entrada/saída por M) | $0.435 / $0.87 | $1.74 / $3.48 | Varia; normalmente próximo ao oficial |
| Desconto por cache hit | Sim, automático, auditável | Não listado | Às vezes; muitas vezes não auditável |
| Residência de dados | Servidores da DeepSeek | Cloud da Microsoft, seu tenant | Infraestrutura do revendedor |
| Contrato/conformidade | Entidade chinesa | Contrato Azure existente | Termos do revendedor |
| Concorrência | 500 (Pro) / 2,500 (Flash) | Provisionamento de PTU disponível | Compartilhado, varia |
| Consolidação de múltiplos modelos | Apenas DeepSeek | Catálogo do Foundry | Catálogo amplo, uma única fatura |
Na prática: a API direta vence em economia pura: nenhum canal iguala o preço de cache-hit de $0.003625 por milhão, e é o único canal em que você pode auditar esse desconto. A Azure vence quando sua equipe jurídica não aprova tráfego para a própria infraestrutura da DeepSeek; você está pagando cerca de 7x a taxa efetiva por governança, e essa troca pode ser totalmente racional se você a fizer conscientemente. Os agregadores vencem quando a DeepSeek é um dos vários modelos por trás de um roteador e o faturamento consolidado vale uma margem apertada; verifique o repasse de cache antes de comprometer volume.
Independentemente do canal que você escolher, as regras de roteamento que mantêm as contas do DeepSeek estáveis são pouco glamourosas: classifique, extraia e resuma por padrão com o Flash; reserve o Pro para geração de código em vários arquivos e raciocínio de longo contexto; desative o modo de pensamento para tarefas determinísticas (esses tokens de raciocínio são cobrados como saída); e limite a profundidade do loop do agente por fluxo de trabalho. Um roteador bem ajustado importa mais do que a diferença de 3x entre Flash e Pro.
Por que a DeepSeek pode cobrar tão pouco — e se isso se sustenta
Os preços não são uma manobra de preço de isca. A arquitetura do V4 é um design de mistura de especialistas com 1,6 trilhão de parâmetros totais, mas apenas cerca de 49 bilhões ativos por passagem direta: você faz inferência com o equivalente ao compute de um modelo de porte médio enquanto obtém capacidade de classe de fronteira (80,6% no SWE-bench Verified, segundo os resultados publicados pela DeepSeek). A revisão V4 Pro atacou especificamente o custo de contexto longo, e é por isso que a empresa converteu sua promoção de 75% no preço permanente em vez de deixá-la expirar.
A direção do mercado favorece os compradores. Os custos unitários de inferência de frontier têm caído cerca de 3x por ano, segundo a maioria das estimativas do setor, e a redução da DeepSeek em um ano, enquanto o comprimento de contexto cresceu para 1M tokens, supera até essa curva. A OpenAI se moveu na direção oposta no mesmo período, reposicionando seu plano principal para cima com o GPT-5.6-Sol a $5/$30.
O contrapeso é Jevons: uma inferência mais barata produz, de forma confiável, mais inferência. A observação da New Street Research - citada desde a era V3 - de que o aumento da concorrência raramente reduz o gasto total se manteve ao longo de toda a expansão da IA. A adoção de agentes multiplica as chamadas por usuário mais rápido do que os preços por token caem, e é por isso que as empresas que mantêm os orçamentos estáveis são as que tratam roteamento, cache e disciplina de prompts como engenharia de primeira classe, não as que escolheram o modelo mais barato. Entender essas dinâmicas de custo, e não apenas o preço de tabela, é o que separa uma implantação da DeepSeek que continua barata de uma que cresce silenciosamente de forma descontrolada.
Perguntas Frequentes
Como o DeepSeek V4 é tão barato?
Arquitetura de mistura de especialistas: 1,6T de parâmetros totais, ~49B ativos por token. O custo de computação por token se assemelha ao de um modelo muito menor, e a engenharia de longo contexto do V4 Pro reduziu a computação por token para aproximadamente um quarto da de seu predecessor. O preço é estrutural, não promocional.
Qual foi o tamanho do corte de preço do DeepSeek V4 Pro?
75%: de US$ 1,74/US$ 3,48 por milhão de tokens (entrada/saída) para US$ 0,435/US$ 0,87. Começou como uma promoção limitada e se tornou o preço de tabela permanente.
A redução de preço de 75% se aplica no Azure?
Não. Em 14 de julho de 2026, o Azure AI Foundry lista o DeepSeek-V4 Pro Global por $1.74/$3.48, a tarifa anterior ao corte, sem preço de entrada em cache publicado. Para cargas de trabalho com uso intenso de cache, a diferença efetiva em relação à API direta pode exceder 4x; verifique as tarifas atuais com a Microsoft, pois os preços do marketplace podem demorar a refletir os cortes do fornecedor.
O DeepSeek é gratuito para uso empresarial?
A API é cobrada por token, mas os pesos do modelo têm licença MIT, então hospedar por conta própria é legal para uso comercial. Na escala do V4, você precisaria de uma infraestrutura séria de GPU; para a maioria das equipes, o preço por token da API fica muito abaixo do TCO de uma solução hospedada por conta própria, por uma margem ampla.
Como o custo do DeepSeek se compara ao do ChatGPT?
Em termos de preços de API, o DeepSeek V4 Pro ($0.435/$0.87) custa cerca de 11x menos que o GPT-5.6-Sol ($5/$30) na entrada e 34x na saída. As assinaturas do ChatGPT ($20–$200/mês por usuário) são um produto diferente; para cargas de trabalho programáticas, a comparação API com API é a mais relevante.
O que fazer antes de 24 de julho
Três ações, em ordem de urgência:
1. Migre os aliases do modelo agora. deepseek-chat e deepseek-reasoner deixam de resolver em 24 de julho de 2026 às 15:59 UTC. Fixe deepseek-v4-flash ou deepseek-v4-pro explicitamente e defina o modo de pensamento de forma deliberada; o padrão mudou, e os tokens de raciocínio são cobrados como saída. 2. Reprecifique seu canal. Se você estiver na Azure por motivos de governança, confirme que isso ainda é uma troca consciente a 4x da lista e sem desconto de cache. Se você estiver com um revendedor, obtenha por escrito a repasse do cache. 3. Audite sua taxa de acerto de cache. Na API direta, verifique prompt_cache_hit_tokens nos seus dados de uso. Se o tráfego do seu agente estiver abaixo de 50% de acertos de cache, reestruture os prompts para que o conteúdo estático venha primeiro: com uma diferença de 120x entre acerto e erro, a ordem do prompt é uma decisão de orçamento.
O modelo ficou barato. A dinâmica de quem captura essa barateza (fornecedor, nuvem, revendedor ou você) é onde o dinheiro corporativo será ganho e perdido este ano.
Leitura relacionada: DeepSeek V4 Flash vs V4 Pro · GLM 5.2 vs DeepSeek V4 Pro · Guia de Preços do OpenRouter
