O deepseek-v4-flash foi reconstruído discretamente pela DeepSeek hoje. Em quatro tarefas avaliadas, ele empatou com o GLM-5.2 em três, venceu a quarta e custou 19x menos para rodar. Isso não muda o fato de que, no papel, o GLM-5.2 continua sendo o modelo com maior pontuação — e a falha dele na minha quarta tarefa revela uma armadilha bastante específica.
A questão é o orçamento de raciocínio. No endpoint que testei, o GLM-5.2 raciocinou longamente até em prompts curtos. Em uma tarefa carregada de especificações, consumiu 16.000 tokens de saída sem emitir uma resposta. O Flash concluiu a mesma tarefa com 2.525 tokens.
O que mudou no deepseek-v4-flash com a atualização 0731
A documentação da API da DeepSeek agora identifica a versão de deepseek-v4-flash como DeepSeek-V4-Flash-0731. A forma de invocação não mudou, e o alias continua apontando para a build mais recente. Em outras palavras: seu código não quebra, mas também não há nenhum aviso de que o modelo por trás dele foi atualizado.
Não há entrada de changelog para essa atualização na página de preços, e o índice de notícias da DeepSeek não mostrava nenhuma publicação de julho de 2026 quando o consultei em 2026-07-31. Isso importa ao interpretar comparativos: uma pontuação publicada para o Flash vale para a build disponível no momento do teste. Confira a data da avaliação e a variante, porque “Flash Base”, “Flash (Reasoning)” e “Flash (Reasoning, Max Effort)” são linhas diferentes, com números diferentes.
A mesma página de documentação confirma as especificações mais relevantes para este confronto: contexto de 1M, saída máxima de 384K, modo de thinking ativado por padrão com um modo sem thinking disponível e limite de concorrência de 2.500, contra 500 no Pro. No momento, a Responses API suporta apenas deepseek-v4-flash; o suporte a deepseek-v4-pro está previsto para o início de agosto de 2026.
Quatro tarefas idênticas: o resultado na prática
Enviei prompts idênticos aos dois modelos por um relay compatível com OpenAI em 2026-07-31. Mantive o thinking no padrão e usei max_tokens de 8.000, salvo indicação contrária. A avaliação foi mecânica, não visual: as duas tarefas de código foram executadas contra casos de teste ocultos, 6 e 8 respectivamente; a tarefa de JSON foi conferida chave a chave contra o esquema solicitado; e a tarefa de recuperação tinha uma única string correta.
| Tarefa | DeepSeek V4 Flash (0731) | GLM-5.2 |
|---|---|---|
| t1 — localizar e corrigir um caso de borda na mesclagem de intervalos | 6/6 testes, 5.0s, 361 de saída | 6/6 testes, 19.0s, 990 de saída |
t2 — implementar next_version() para uma especificação de 8 regras | 8/8 testes, 29.9s, 2,525 de saída | nenhuma resposta retornada |
| t3 — JSON estrito, chaves exatas, sem bloco de código | passou, 5.2s, 327 de saída | passou, 11.2s, 826 de saída |
| t4 — recuperar e combinar 3 fatos em ~45K tokens | correto, 5.2s, 172 de saída | correto, 9.7s, 317 de saída |
Três das quatro tarefas foram empates reais. Os dois modelos encontraram o mesmo bug em t1: um < estrito que deixa de mesclar intervalos adjacentes, como (1,4) e (4,5). Ambos entregaram a mesma correção de um caractere. Os dois também acertaram a tarefa de JSON estrito byte a byte e resolveram t4, combinando um segredo escondido no registro 211 com uma regra no registro 1290 para retornar quartz-mallard-90.
A exceção é t2, e ela exige precisão, não comemoração. O GLM-5.2 não respondeu errado — ele simplesmente não respondeu. Com limite de 8.000 tokens, gastou todos os 8.000 em raciocínio e devolveu conteúdo vazio após 110s. Repeti o teste com 16.000 para descartar que o problema fosse o meu limite: 16.000 tokens consumidos, ainda sem conteúdo, em 214s. Uma terceira tentativa, com 24.000, terminou em erro após 301s. O Flash produziu uma função que passou nos oito casos, inclusive nos três que precisavam gerar ValueError.
Vale explicitar as limitações: é n=1 por tarefa em um único endpoint de relay, não um benchmark. Aqui, os tokens de raciocínio são cobrados dentro de completion_tokens, e o endpoint oficial da Z.ai pode transmiti-los ou contabilizá-los de outra forma. O que estes dados sustentam é o padrão, não uma proporção exata: o GLM-5.2 consome muito mais tokens e tempo de execução por tarefa.
Em que o GLM-5.2 realmente leva vantagem
Pelas métricas que o setor efetivamente utiliza, o GLM-5.2 é o modelo mais forte. Seria errado concluir, a partir dos meus resultados, que o mais barato vence em tudo. A Artificial Analysis dá 51 no Intelligence Index ao GLM-5.2 (max), contra 40 para o DeepSeek V4 Flash (Reasoning, Max Effort): uma diferença de 11 pontos em favor de um modelo muito maior, com 753B de parâmetros totais e ~40B ativos, contra 284B totais e 13B ativos no Flash.
Os números publicados pela Z.ai para o GLM-5.2 são os esperados de um modelo flagship: SWE-bench Pro 62.1%, Terminal-Bench 2.1 81.0, AIME 2026 99.2%, GPQA Diamond 91.2% e HLE com ferramentas 54.7%. São dados informados pelo fornecedor, e o Flash não tem resultados comparáveis na maior parte dessas avaliações.
Essa ausência é o principal ponto sobre benchmarks: os dois modelos praticamente não compartilham avaliações. O site de acompanhamento de modelos benchlm os compara, mas não aponta um vencedor, observando que o par não tem nenhuma linha equivalente. Os números públicos do Flash vêm de uma suíte de modelo base — MMLU 88.7%, HumanEval 69.5%, GSM8K 90.8% —, enquanto os do GLM-5.2 vêm de uma suíte de coding agentic.
Conhecimento é a única categoria em que há sobreposição, e nela o benchlm coloca o GLM-5.2 à frente, por 59.6 a 56.4. Quando duas páginas de comparação divergem sobre esse confronto, a explicação mais comum é que avaliaram variantes diferentes em suítes diferentes. Confie no número cuja variante e cuja data correspondam ao que você pretende chamar.
Profissionais descrevem essa divisão da mesma forma que ela apareceu na minha medição. Em uma thread do r/opencodeCLI, alguém que rodou a mesma tarefa nos dois modelos resumiu:
O GLM 5.2 raciocina pesado em tudo. O V4 escala isso, quase não perde tempo na correção simples; o GLM 5.2 passa à frente em qualquer coisa que não seja banalmente [simples] …
Essa é a troca em uma frase: o raciocínio do GLM-5.2 é uma vantagem em problemas difíceis e puro custo adicional nos fáceis.
A diferença de custo vai além da tabela de preços
Comece pelos preços de tabela, ambos verificados nas páginas dos próprios fornecedores em 2026-07-31.
| Por 1M de tokens | DeepSeek V4 Flash | GLM-5.2 | Multiplicador do GLM |
|---|---|---|---|
| Entrada (sem cache) | $0.14 | $1.40 | 10.0x |
| Entrada (com cache) | $0.0028 | $0.26 | 92.9x |
| Saída | $0.28 | $4.40 | 15.7x |
| Saída máxima | 384K | 128K | — |
Ao aplicar essas tarifas aos tokens que cada modelo realmente consumiu nas quatro tarefas, a diferença supera a relação de 15.7x do preço de saída. O motivo é simples: além de mais caro, o GLM-5.2 também é mais verboso.
| Tarefa | Entrada→saída Flash | Custo Flash | Entrada→saída GLM-5.2 | Custo GLM-5.2 | Multiplicador |
|---|---|---|---|---|---|
| t1 correção de bug | 165→361 | $0.000124 | 170→990 | $0.004594 | 37.0x |
| t2 implementação | 182→2,525 | $0.000732 | 196→16,000 | $0.070674 | 96.5x |
| t3 JSON estrito | 171→327 | $0.000116 | 177→826 | $0.003882 | 33.5x |
| t4 contexto longo | 45,225→172 | $0.006380 | 44,164→317 | $0.063224 | 9.9x |
| As quatro | 45,743→3,385 | $0.007352 | 44,707→18,133 | $0.142375 | 19.4x |
Todos os prompts foram enviados sem cache, portanto toda a entrada foi cobrada pela tarifa de cache miss. Para reproduzir qualquer valor, basta multiplicar as colunas acima pelos preços da tabela anterior.
Em t4, a diferença foi a menor: 9.9x. Quando o trabalho é dominado por tokens de entrada, a relação de 10x na entrada prevalece e a verbosidade da saída deixa de pesar tanto. É o formato de carga em que o prêmio do GLM-5.2 fica mais contido.
A página de preços da DeepSeek informa que a API “em breve adotará uma política de preços de pico/fora de pico”, com 2x em todos os itens de cobrança entre 09:00–12:00 e 14:00–18:00 no horário de Pequim, UTC+8; a data de início ainda depende de anúncio. Isso reduziria a vantagem do Flash na saída para cerca de 5x durante o horário comercial asiático. Na direção oposta, a entrada com cache do Flash, a $0.0028, é 93x mais barata que os $0.26 do GLM-5.2, ampliando a diferença ao reutilizar um grande prefixo estável. E, se o uso for especificamente para programação, o Coding Plan da Z.ai começa em $18/month, inclui GLM-5.2 e oferece uso fora de pico pela metade da tarifa; essa é uma cobrança diferente das tarifas por token mostradas acima.
Qual modelo usar em cada tipo de carga
| Carga de trabalho | Escolha | Motivo |
|---|---|---|
| Edições de código simples a intermediárias em alto volume | V4 Flash | Mesma resposta que o GLM-5.2 em t1, 3.8x mais rápido e 37x mais barato |
| Saída estruturada ou formato rígido em escala | V4 Flash | Resultado idêntico byte a byte por 1/34 do custo |
| Recuperação em contexto longo sobre documentos grandes | V4 Flash | Mesma resposta correta; menor diferença de custo, mas ainda 9.9x |
| Coding agentic difícil ou código em múltiplos arquivos | GLM-5.2 | 51 contra 40 no Intelligence Index, e é em sua própria suíte agentic que ele pontua |
Qualquer tarefa com max_tokens apertado | V4 Flash | O GLM-5.2 não retornou nada com limites de 8K e 16K na minha t2 |
| Saída acima de 128K tokens em uma única chamada | V4 Flash | Saída máxima de 384K, contra 128K do GLM-5.2 |
Trate isso como uma estratégia padrão de roteamento por custo que precisa ser validada, não como uma regra definitiva: a conclusão se apoia em uma única rodada de quatro tarefas. Encaminhe para o Flash e escale para o GLM-5.2 o subconjunto de tarefas em que uma resposta errada custa mais que 19x o gasto com tokens. Se for usar GLM-5.2, dê espaço para ele: um limite generoso para o Flash pode resultar em uma não resposta paga no GLM-5.2.
Há algo que esta comparação não resolve: desde que a 0731 foi lançada hoje, ainda não surgiu nenhuma nova avaliação de terceiros para o Flash. Portanto, a diferença de 51 contra 40 descreve a build de abril. A distância atual de capacidade não foi medida, e a única maneira de dimensioná-la para sua carga de trabalho é rodar suas próprias avaliações contra os dois aliases.
Perguntas frequentes
DeepSeek V4 Flash 0731 é um modelo novo ou uma atualização?
É uma atualização do modelo existente, não um modelo novo. A documentação da DeepSeek lista a versão como DeepSeek-V4-Flash-0731 e informa que a forma de invocação não mudou. Assim, deepseek-v4-flash continua apontando para a build mais recente sem exigir alteração no seu código.
O DeepSeek V4 Flash venceu o GLM-5.2?
Não em capacidade: a Artificial Analysis dá 51 ao GLM-5.2 (max), contra 40 para o DeepSeek V4 Flash (Reasoning, Max Effort). O Flash venceu em custo por tarefa resolvida, empatando três das quatro tarefas avaliadas com custo total 19.4x menor.
O GLM-5.3 já foi lançado?
Não em 2026-07-31: o GLM-5.2 é a entrada mais recente tanto na tabela de preços da Z.ai quanto na lista de modelos do Coding Plan, e nenhuma delas inclui uma linha 5.3.
Qual é mais barato para uma tarefa com contexto de 1M tokens?
O DeepSeek V4 Flash: ele custa 10x menos na entrada sem cache e 93x menos na entrada com cache. Minha tarefa de recuperação com ~45K tokens custou $0.006380 no Flash, contra $0.063224 no GLM-5.2.
Posso usar os dois no Claude Code?
Sim. Os dois fornecedores documentam um endpoint no formato Anthropic. A DeepSeek lista https://api.deepseek.com/anthropic ao lado de sua base URL no formato OpenAI, e o guia de Claude Code da Z.ai orienta definir ANTHROPIC_BASE_URL como https://api.z.ai/api/anthropic e mapear os slots Sonnet e Opus para glm-5.2[1m].
Leituras relacionadas
Fontes
- Modelos e preços da DeepSeek — nota sobre a versão 0731, preços, política de pico/fora de pico, verificados em 2026-07-31
- Preços da Z.ai — tarifas do GLM-5.2, verificadas em 2026-07-31
- Z.ai Coding Plan — níveis de assinatura e cobertura do GLM-5.2, verificados em 2026-07-31
- Z.ai: configuração do Claude Code — base URL compatível com Anthropic e mapeamento de modelos
- Índice de notícias da DeepSeek — consultado em 2026-07-31, sem entrada de julho de 2026
- Artificial Analysis: GLM-5.2 vs DeepSeek V4 Flash — Intelligence Index, parâmetros
- benchlm: DeepSeek V4 Flash Base vs GLM-5.2 — cobertura de benchmarks compartilhados, pontuações de conhecimento
- r/opencodeCLI: DeepSeek V4 vs GLM 5.2 para programação — relato de profissional