AIREITER

Imagem IA

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 ProSeedream V5 liteSeedream V4.5Mais

Vídeo IA

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0Grok Imagine 1.5Veo 3.1Mais

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 ProClaude Opus 5Claude Fable 5Mais
Em breveSeedance 2.5
Super ResolutionLyric Video GeneratorGPT Image 2 1K GeneratorGPT Image 2 Product Mockup GeneratorUse GPT-5.6 Online
DOCS APIPREÇOS
BlogAtualizaçõesLLM API GuideClaude API GuideKimi K3 API Guide
TEMPLATES
  • AIReiter
  • Blog
  • DeepSeek V4 Flash vs GLM-5.2: atualização 0731 testada

DeepSeek V4 Flash vs GLM-5.2: atualização 0731 testada

Última Atualização: 2026-07-31 07:33:27

O deepseek-v4-flash foi reconstruído discretamente pela DeepSeek hoje. Em quatro tarefas avaliadas, ele empatou com o GLM-5.2 em três, venceu a quarta e custou 19x menos para rodar. Isso não muda o fato de que, no papel, o GLM-5.2 continua sendo o modelo com maior pontuação — e a falha dele na minha quarta tarefa revela uma armadilha bastante específica.

A questão é o orçamento de raciocínio. No endpoint que testei, o GLM-5.2 raciocinou longamente até em prompts curtos. Em uma tarefa carregada de especificações, consumiu 16.000 tokens de saída sem emitir uma resposta. O Flash concluiu a mesma tarefa com 2.525 tokens.

O que mudou no deepseek-v4-flash com a atualização 0731

A documentação da API da DeepSeek agora identifica a versão de deepseek-v4-flash como DeepSeek-V4-Flash-0731. A forma de invocação não mudou, e o alias continua apontando para a build mais recente. Em outras palavras: seu código não quebra, mas também não há nenhum aviso de que o modelo por trás dele foi atualizado.

Documentação da API DeepSeek mostrando a versão DeepSeek-V4-Flash-0731, contexto de 1M e saída máxima de 384K

Não há entrada de changelog para essa atualização na página de preços, e o índice de notícias da DeepSeek não mostrava nenhuma publicação de julho de 2026 quando o consultei em 2026-07-31. Isso importa ao interpretar comparativos: uma pontuação publicada para o Flash vale para a build disponível no momento do teste. Confira a data da avaliação e a variante, porque “Flash Base”, “Flash (Reasoning)” e “Flash (Reasoning, Max Effort)” são linhas diferentes, com números diferentes.

A mesma página de documentação confirma as especificações mais relevantes para este confronto: contexto de 1M, saída máxima de 384K, modo de thinking ativado por padrão com um modo sem thinking disponível e limite de concorrência de 2.500, contra 500 no Pro. No momento, a Responses API suporta apenas deepseek-v4-flash; o suporte a deepseek-v4-pro está previsto para o início de agosto de 2026.

Quatro tarefas idênticas: o resultado na prática

Enviei prompts idênticos aos dois modelos por um relay compatível com OpenAI em 2026-07-31. Mantive o thinking no padrão e usei max_tokens de 8.000, salvo indicação contrária. A avaliação foi mecânica, não visual: as duas tarefas de código foram executadas contra casos de teste ocultos, 6 e 8 respectivamente; a tarefa de JSON foi conferida chave a chave contra o esquema solicitado; e a tarefa de recuperação tinha uma única string correta.

TarefaDeepSeek V4 Flash (0731)GLM-5.2
t1 — localizar e corrigir um caso de borda na mesclagem de intervalos6/6 testes, 5.0s, 361 de saída6/6 testes, 19.0s, 990 de saída
t2 — implementar next_version() para uma especificação de 8 regras8/8 testes, 29.9s, 2,525 de saídanenhuma resposta retornada
t3 — JSON estrito, chaves exatas, sem bloco de códigopassou, 5.2s, 327 de saídapassou, 11.2s, 826 de saída
t4 — recuperar e combinar 3 fatos em ~45K tokenscorreto, 5.2s, 172 de saídacorreto, 9.7s, 317 de saída

Três das quatro tarefas foram empates reais. Os dois modelos encontraram o mesmo bug em t1: um < estrito que deixa de mesclar intervalos adjacentes, como (1,4) e (4,5). Ambos entregaram a mesma correção de um caractere. Os dois também acertaram a tarefa de JSON estrito byte a byte e resolveram t4, combinando um segredo escondido no registro 211 com uma regra no registro 1290 para retornar quartz-mallard-90.

Gráfico de barras agrupadas com segundos de tempo total por tarefa, DeepSeek V4 Flash versus GLM-5.2

A exceção é t2, e ela exige precisão, não comemoração. O GLM-5.2 não respondeu errado — ele simplesmente não respondeu. Com limite de 8.000 tokens, gastou todos os 8.000 em raciocínio e devolveu conteúdo vazio após 110s. Repeti o teste com 16.000 para descartar que o problema fosse o meu limite: 16.000 tokens consumidos, ainda sem conteúdo, em 214s. Uma terceira tentativa, com 24.000, terminou em erro após 301s. O Flash produziu uma função que passou nos oito casos, inclusive nos três que precisavam gerar ValueError.

Vale explicitar as limitações: é n=1 por tarefa em um único endpoint de relay, não um benchmark. Aqui, os tokens de raciocínio são cobrados dentro de completion_tokens, e o endpoint oficial da Z.ai pode transmiti-los ou contabilizá-los de outra forma. O que estes dados sustentam é o padrão, não uma proporção exata: o GLM-5.2 consome muito mais tokens e tempo de execução por tarefa.

Em que o GLM-5.2 realmente leva vantagem

Pelas métricas que o setor efetivamente utiliza, o GLM-5.2 é o modelo mais forte. Seria errado concluir, a partir dos meus resultados, que o mais barato vence em tudo. A Artificial Analysis dá 51 no Intelligence Index ao GLM-5.2 (max), contra 40 para o DeepSeek V4 Flash (Reasoning, Max Effort): uma diferença de 11 pontos em favor de um modelo muito maior, com 753B de parâmetros totais e ~40B ativos, contra 284B totais e 13B ativos no Flash.

Os números publicados pela Z.ai para o GLM-5.2 são os esperados de um modelo flagship: SWE-bench Pro 62.1%, Terminal-Bench 2.1 81.0, AIME 2026 99.2%, GPQA Diamond 91.2% e HLE com ferramentas 54.7%. São dados informados pelo fornecedor, e o Flash não tem resultados comparáveis na maior parte dessas avaliações.

Essa ausência é o principal ponto sobre benchmarks: os dois modelos praticamente não compartilham avaliações. O site de acompanhamento de modelos benchlm os compara, mas não aponta um vencedor, observando que o par não tem nenhuma linha equivalente. Os números públicos do Flash vêm de uma suíte de modelo base — MMLU 88.7%, HumanEval 69.5%, GSM8K 90.8% —, enquanto os do GLM-5.2 vêm de uma suíte de coding agentic.

Conhecimento é a única categoria em que há sobreposição, e nela o benchlm coloca o GLM-5.2 à frente, por 59.6 a 56.4. Quando duas páginas de comparação divergem sobre esse confronto, a explicação mais comum é que avaliaram variantes diferentes em suítes diferentes. Confie no número cuja variante e cuja data correspondam ao que você pretende chamar.

Profissionais descrevem essa divisão da mesma forma que ela apareceu na minha medição. Em uma thread do r/opencodeCLI, alguém que rodou a mesma tarefa nos dois modelos resumiu:

O GLM 5.2 raciocina pesado em tudo. O V4 escala isso, quase não perde tempo na correção simples; o GLM 5.2 passa à frente em qualquer coisa que não seja banalmente [simples] …

Essa é a troca em uma frase: o raciocínio do GLM-5.2 é uma vantagem em problemas difíceis e puro custo adicional nos fáceis.

A diferença de custo vai além da tabela de preços

Comece pelos preços de tabela, ambos verificados nas páginas dos próprios fornecedores em 2026-07-31.

Por 1M de tokensDeepSeek V4 FlashGLM-5.2Multiplicador do GLM
Entrada (sem cache)$0.14$1.4010.0x
Entrada (com cache)$0.0028$0.2692.9x
Saída$0.28$4.4015.7x
Saída máxima384K128K—
Linhas de preço na documentação da API DeepSeek: cache hit $0.0028, cache miss $0.14, saída $0.28 por 1M de tokens Tabela de preços da Z.ai mostrando GLM-5.2 a $1.4 de entrada, $0.26 de entrada em cache e $4.4 de saída por 1M de tokens

Ao aplicar essas tarifas aos tokens que cada modelo realmente consumiu nas quatro tarefas, a diferença supera a relação de 15.7x do preço de saída. O motivo é simples: além de mais caro, o GLM-5.2 também é mais verboso.

TarefaEntrada→saída FlashCusto FlashEntrada→saída GLM-5.2Custo GLM-5.2Multiplicador
t1 correção de bug165→361$0.000124170→990$0.00459437.0x
t2 implementação182→2,525$0.000732196→16,000$0.07067496.5x
t3 JSON estrito171→327$0.000116177→826$0.00388233.5x
t4 contexto longo45,225→172$0.00638044,164→317$0.0632249.9x
As quatro45,743→3,385$0.00735244,707→18,133$0.14237519.4x

Todos os prompts foram enviados sem cache, portanto toda a entrada foi cobrada pela tarifa de cache miss. Para reproduzir qualquer valor, basta multiplicar as colunas acima pelos preços da tabela anterior.

Gráfico de barras com o custo do GLM-5.2 dividido pelo custo do DeepSeek V4 Flash por tarefa, de 9.9x a 96.5x

Em t4, a diferença foi a menor: 9.9x. Quando o trabalho é dominado por tokens de entrada, a relação de 10x na entrada prevalece e a verbosidade da saída deixa de pesar tanto. É o formato de carga em que o prêmio do GLM-5.2 fica mais contido.

A página de preços da DeepSeek informa que a API “em breve adotará uma política de preços de pico/fora de pico”, com 2x em todos os itens de cobrança entre 09:00–12:00 e 14:00–18:00 no horário de Pequim, UTC+8; a data de início ainda depende de anúncio. Isso reduziria a vantagem do Flash na saída para cerca de 5x durante o horário comercial asiático. Na direção oposta, a entrada com cache do Flash, a $0.0028, é 93x mais barata que os $0.26 do GLM-5.2, ampliando a diferença ao reutilizar um grande prefixo estável. E, se o uso for especificamente para programação, o Coding Plan da Z.ai começa em $18/month, inclui GLM-5.2 e oferece uso fora de pico pela metade da tarifa; essa é uma cobrança diferente das tarifas por token mostradas acima.

Qual modelo usar em cada tipo de carga

Carga de trabalhoEscolhaMotivo
Edições de código simples a intermediárias em alto volumeV4 FlashMesma resposta que o GLM-5.2 em t1, 3.8x mais rápido e 37x mais barato
Saída estruturada ou formato rígido em escalaV4 FlashResultado idêntico byte a byte por 1/34 do custo
Recuperação em contexto longo sobre documentos grandesV4 FlashMesma resposta correta; menor diferença de custo, mas ainda 9.9x
Coding agentic difícil ou código em múltiplos arquivosGLM-5.251 contra 40 no Intelligence Index, e é em sua própria suíte agentic que ele pontua
Qualquer tarefa com max_tokens apertadoV4 FlashO GLM-5.2 não retornou nada com limites de 8K e 16K na minha t2
Saída acima de 128K tokens em uma única chamadaV4 FlashSaída máxima de 384K, contra 128K do GLM-5.2

Trate isso como uma estratégia padrão de roteamento por custo que precisa ser validada, não como uma regra definitiva: a conclusão se apoia em uma única rodada de quatro tarefas. Encaminhe para o Flash e escale para o GLM-5.2 o subconjunto de tarefas em que uma resposta errada custa mais que 19x o gasto com tokens. Se for usar GLM-5.2, dê espaço para ele: um limite generoso para o Flash pode resultar em uma não resposta paga no GLM-5.2.

Há algo que esta comparação não resolve: desde que a 0731 foi lançada hoje, ainda não surgiu nenhuma nova avaliação de terceiros para o Flash. Portanto, a diferença de 51 contra 40 descreve a build de abril. A distância atual de capacidade não foi medida, e a única maneira de dimensioná-la para sua carga de trabalho é rodar suas próprias avaliações contra os dois aliases.

Perguntas frequentes

DeepSeek V4 Flash 0731 é um modelo novo ou uma atualização?

É uma atualização do modelo existente, não um modelo novo. A documentação da DeepSeek lista a versão como DeepSeek-V4-Flash-0731 e informa que a forma de invocação não mudou. Assim, deepseek-v4-flash continua apontando para a build mais recente sem exigir alteração no seu código.

O DeepSeek V4 Flash venceu o GLM-5.2?

Não em capacidade: a Artificial Analysis dá 51 ao GLM-5.2 (max), contra 40 para o DeepSeek V4 Flash (Reasoning, Max Effort). O Flash venceu em custo por tarefa resolvida, empatando três das quatro tarefas avaliadas com custo total 19.4x menor.

O GLM-5.3 já foi lançado?

Não em 2026-07-31: o GLM-5.2 é a entrada mais recente tanto na tabela de preços da Z.ai quanto na lista de modelos do Coding Plan, e nenhuma delas inclui uma linha 5.3.

Qual é mais barato para uma tarefa com contexto de 1M tokens?

O DeepSeek V4 Flash: ele custa 10x menos na entrada sem cache e 93x menos na entrada com cache. Minha tarefa de recuperação com ~45K tokens custou $0.006380 no Flash, contra $0.063224 no GLM-5.2.

Posso usar os dois no Claude Code?

Sim. Os dois fornecedores documentam um endpoint no formato Anthropic. A DeepSeek lista https://api.deepseek.com/anthropic ao lado de sua base URL no formato OpenAI, e o guia de Claude Code da Z.ai orienta definir ANTHROPIC_BASE_URL como https://api.z.ai/api/anthropic e mapear os slots Sonnet e Opus para glm-5.2[1m].

Leituras relacionadas

  • DeepSeek V4 Flash vs DeepSeek V4 Pro
  • API do GLM-5.2

Fontes

  • Modelos e preços da DeepSeek — nota sobre a versão 0731, preços, política de pico/fora de pico, verificados em 2026-07-31
  • Preços da Z.ai — tarifas do GLM-5.2, verificadas em 2026-07-31
  • Z.ai Coding Plan — níveis de assinatura e cobertura do GLM-5.2, verificados em 2026-07-31
  • Z.ai: configuração do Claude Code — base URL compatível com Anthropic e mapeamento de modelos
  • Índice de notícias da DeepSeek — consultado em 2026-07-31, sem entrada de julho de 2026
  • Artificial Analysis: GLM-5.2 vs DeepSeek V4 Flash — Intelligence Index, parâmetros
  • benchlm: DeepSeek V4 Flash Base vs GLM-5.2 — cobertura de benchmarks compartilhados, pontuações de conhecimento
  • r/opencodeCLI: DeepSeek V4 vs GLM 5.2 para programação — relato de profissional

>_Diretório de modelos AIReiter

Acesso API rápido aos modelos relacionados a este guia

Kimi K3

Chat

Um modelo de raciocínio de contexto longo para programação, escrita, análise e fluxos de trabalho de agentes.

moonshotCriar API Key >

Gemini 3.6 Flash

Chat

Um modelo Gemini rápido para raciocínio avançado, codificação e tarefas agentivas.

GoogleCriar API Key >

Claude Fable 5

Chat

Um modelo premium Claude para raciocínio profundo e trabalhos complexos de longo formato.

AnthropicCriar API Key >

Claude Opus 4.8

Chat

Um modelo Claude de alta capacidade para raciocínio exigente e trabalho profissional.

AnthropicCriar API Key >

Claude Opus 5

Chat

Um modelo premium do Claude para raciocínio complexo, programação e trabalho profissional com contexto longo.

anthropicCriar API Key >

Posts recentes

Corte de preço do GPT-5.6: quanto Luna e Terra custam agora

2026-07-31

Chave de API inválida: diagnostique erros 401 e 403 antes de corrigir

2026-07-31

Como corrigir o erro 429 no OpenRouter: provider ou limite de taxa?

2026-07-31

Inteligência de anúncios B2B só vem do HTML: como criar um parser que resiste a redesigns

2026-07-31
AIREITER

Dúvidas? Entre em contato em
[email protected]

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 Pro

Vídeo IA

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0

Imagem IA

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 Pro

Blog

Ver Tudo →

Empresa

Política de PrivacidadeTermos de ServiçoPolítica de Reembolso

© 2026 AIReiter. Todos os direitos reservados.