AIREITER

Imagen IA

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 ProSeedream V5 liteSeedream V4.5Más

Video IA

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0Grok Imagine 1.5Veo 3.1Más

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 ProClaude Opus 5Claude Fable 5Más
PróximamenteSeedance 2.5
Super ResolutionLyric Video GeneratorGPT Image 2 1K GeneratorGPT Image 2 Product Mockup GeneratorUse GPT-5.6 Online
DOCS APIPRECIOS
BlogActualizacionesLLM API GuideClaude API GuideKimi K3 API Guide
PLANTILLAS
  • AIReiter
  • Blog
  • DeepSeek V4 Flash vs GLM-5.2: prueba tras la actualización 0731

DeepSeek V4 Flash vs GLM-5.2: prueba tras la actualización 0731

Última actualización: 2026-07-31 07:32:08

DeepSeek actualizó hoy sin hacer ruido deepseek-v4-flash. En cuatro tareas evaluadas, empató con GLM-5.2 en tres, ganó la cuarta y costó 19x menos de ejecutar. Eso no convierte a Flash en el modelo más capaz sobre el papel: GLM-5.2 sigue puntuando más alto, y su fallo en mi cuarta prueba expone una trampa muy concreta que puede activarse deliberadamente.

La trampa es el presupuesto de razonamiento. En el endpoint que probé, GLM-5.2 razonó extensamente incluso ante prompts breves; en una tarea cargada de especificaciones agotó 16,000 tokens de salida sin llegar a emitir una respuesta. Flash resolvió esa misma tarea con 2,525 tokens.

Qué cambia con la actualización 0731 de deepseek-v4-flash

La documentación de la API de DeepSeek ya identifica la versión de deepseek-v4-flash como DeepSeek-V4-Flash-0731. El método de invocación no cambia y el alias sigue apuntando a la compilación más reciente: no se rompe nada en tu código, pero tampoco hay aviso de que el modelo subyacente ha cambiado.

Documentación de la API de DeepSeek que muestra la versión DeepSeek-V4-Flash-0731, contexto de 1M y salida máxima de 384K

La página de precios no incluye una entrada de changelog para esta actualización, y el índice de noticias de DeepSeek no mostraba ninguna publicación de julio de 2026 cuando lo revisé el 2026-07-31. Esto importa al interpretar cualquier comparativa: una puntuación publicada de Flash corresponde a la compilación activa cuando se ejecutó la prueba. Conviene revisar tanto la fecha de evaluación como la variante, porque "Flash Base", "Flash (Reasoning)" y "Flash (Reasoning, Max Effort)" son tres filas distintas con cifras diferentes.

La misma página de documentación confirma las especificaciones relevantes para esta comparación: 1M de contexto, 384K de salida máxima, modo thinking activado por defecto con un modo sin razonamiento disponible, y un límite de concurrencia de 2,500 frente a los 500 de Pro. Por ahora, la Responses API solo admite deepseek-v4-flash; deepseek-v4-pro está previsto para principios de agosto de 2026.

Cuatro tareas idénticas: así respondieron ambos modelos

El 2026-07-31 envié a ambos modelos los mismos prompts mediante un relay compatible con OpenAI. Dejé thinking en su configuración predeterminada y fijé max_tokens en 8,000, salvo donde se indique lo contrario. La evaluación fue mecánica, no visual: las dos tareas de programación se ejecutaron contra casos de prueba ocultos, 6 y 8 respectivamente; la tarea JSON se verificó clave por clave contra el esquema solicitado; y la tarea de recuperación tenía una única cadena correcta.

TareaDeepSeek V4 Flash (0731)GLM-5.2
t1 — detectar y corregir un caso límite al fusionar intervalos6/6 pruebas, 5.0s, 361 de salida6/6 pruebas, 19.0s, 990 de salida
t2 — implementar next_version() según una especificación de 8 reglas8/8 pruebas, 29.9s, 2,525 de salidasin respuesta devuelta
t3 — JSON estricto, claves exactas y sin bloque de códigoaprobado, 5.2s, 327 de salidaaprobado, 11.2s, 826 de salida
t4 — recuperar y combinar 3 datos de ~45K tokenscorrecto, 5.2s, 172 de salidacorrecto, 9.7s, 317 de salida

Tres de las cuatro pruebas fueron empates reales. Ambos encontraron el mismo bug en t1: un < estricto que no fusiona intervalos contiguos como (1,4) y (4,5); los dos aplicaron la misma corrección de un carácter. También resolvieron el JSON estricto de forma idéntica byte a byte. En t4, ambos combinaron un secreto oculto en el registro 211 con una regla del registro 1290 para devolver quartz-mallard-90.

Gráfico de barras agrupadas con los segundos de reloj por tarea: DeepSeek V4 Flash frente a GLM-5.2

t2 es la excepción, y merece precisión antes que una vuelta de victoria. GLM-5.2 no respondió mal: no respondió. Con un límite de 8,000 tokens consumió los 8,000 en razonamiento y devolvió contenido vacío tras 110s. Lo repetí con 16,000 para descartar que el problema fuese mi propio límite: consumió 16,000 tokens, siguió sin devolver contenido y tardó 214s. Un tercer intento con 24,000 terminó en error después de 301s. Flash generó una función que superó los ocho casos, incluidos los tres que debían lanzar ValueError.

Conviene dejar claras las limitaciones: esto es n=1 por tarea en un único endpoint relay, no un benchmark. Aquí los tokens de razonamiento se facturan dentro de completion_tokens, y el endpoint oficial de Z.ai podría transmitirlos o contabilizarlos de otra forma. Lo que sí sostendría con estos datos es la tendencia, no una proporción exacta: GLM-5.2 invierte muchos más tokens y más tiempo de reloj por tarea.

En qué aspectos GLM-5.2 sí va por delante

GLM-5.2 es el modelo más fuerte según las métricas que usa la industria, y sería un error interpretar mis resultados como una victoria barata en todos los frentes. Artificial Analysis sitúa a GLM-5.2 (max) en 51 en su Intelligence Index, frente a 40 de DeepSeek V4 Flash (Reasoning, Max Effort): una diferencia de 11 puntos con un modelo mucho mayor, 753B totales y ~40B activos, frente a los 284B totales y 13B activos de Flash.

Las cifras publicadas por Z.ai para GLM-5.2 encajan con las de un modelo insignia: SWE-bench Pro 62.1%, Terminal-Bench 2.1 81.0, AIME 2026 99.2%, GPQA Diamond 91.2% y HLE con herramientas 54.7%. Son resultados comunicados por el proveedor, y Flash no cuenta con una entrada comparable en la mayoría de ellos.

Esta ausencia es la conclusión honesta sobre los benchmarks: los dos modelos prácticamente no comparten evaluaciones. El sitio de seguimiento de modelos benchlm los compara, pero evita declarar un ganador porque no tienen ninguna fila equivalente. Las cifras públicas de Flash proceden de una batería para modelos base —MMLU 88.7%, HumanEval 69.5%, GSM8K 90.8%—, mientras que las de GLM-5.2 proceden de una suite de programación agéntica.

El conocimiento es la única categoría en la que coinciden, y allí benchlm coloca a GLM-5.2 por delante, 59.6 frente a 56.4. Cuando dos páginas comparativas discrepan sobre este enfrentamiento, la causa habitual es que evaluaron variantes distintas con suites diferentes. Quédate con la cifra cuya variante y fecha coincidan con lo que piensas invocar.

Los usuarios describen esta división de la misma forma en que apareció en mi prueba. En un hilo de r/opencodeCLI donde ejecutaron la misma tarea con los dos:

GLM 5.2 reasons hard on everything. V4 scales it, almost no wind-up on the simple fix, GLM 5.2 pulls ahead on anything that is not banally [simple] …

Ahí está el intercambio resumido: el razonamiento de GLM-5.2 aporta valor en problemas difíciles y se convierte en sobrecarga pura en los sencillos.

La diferencia de coste supera a la de la tarifa

Empecemos por los precios de lista, ambos verificados en las páginas de los proveedores el 2026-07-31.

Por 1M de tokensDeepSeek V4 FlashGLM-5.2Multiplicador de GLM
Entrada (sin caché)$0.14$1.4010.0x
Entrada (con caché)$0.0028$0.2692.9x
Salida$0.28$4.4015.7x
Salida máxima384K128K—
Filas de precios de la documentación de la API de DeepSeek: caché $0.0028, sin caché $0.14 y salida $0.28 por 1M de tokens Tabla de precios de Z.ai que muestra GLM-5.2 a $1.4 por entrada, $0.26 por entrada en caché y $4.4 por salida por 1M de tokens

Al aplicar esas tarifas a los tokens que realmente consumió cada modelo en mis cuatro tareas, la distancia supera la relación de 15.7x en salida, porque el modelo más caro también es más verboso:

TareaEntrada→salida FlashCoste FlashEntrada→salida GLM-5.2Coste GLM-5.2Multiplicador
t1 corrección de bug165→361$0.000124170→990$0.00459437.0x
t2 implementación182→2,525$0.000732196→16,000$0.07067496.5x
t3 JSON estricto171→327$0.000116177→826$0.00388233.5x
t4 contexto largo45,225→172$0.00638044,164→317$0.0632249.9x
Las cuatro45,743→3,385$0.00735244,707→18,133$0.14237519.4x

Todos los prompts se enviaron en frío, por lo que toda la entrada se factura a la tarifa sin caché. Puedes reproducir cualquier cifra multiplicando las columnas anteriores por la tabla de tarifas.

Gráfico de barras del coste de GLM-5.2 dividido por el coste de DeepSeek V4 Flash en cada tarea, con valores entre 9.9x y 96.5x

t4 presenta la brecha más estrecha, 9.9x: cuando una carga de trabajo depende sobre todo de tokens de entrada, domina la relación de 10x en input y la verbosidad de salida deja de pesar tanto. Es el único perfil de carga en el que el sobreprecio de GLM-5.2 se mantiene contenido.

La página de precios de DeepSeek indica que la API "adoptará próximamente una política de precios de hora punta y hora valle" con un multiplicador de 2x para todos los conceptos facturables entre las 09:00–12:00 y las 14:00–18:00, hora de Pekín (UTC+8); la fecha efectiva queda pendiente de anuncio. Eso reduciría la ventaja de Flash en salida a aproximadamente 5x durante el horario laboral asiático. En sentido contrario, la entrada con caché de Flash a $0.0028 es 93x más barata que los $0.26 de GLM-5.2, así que reutilizar un prefijo grande y estable amplía la diferencia. Y si tu uso es específicamente programación, el Coding Plan de Z.ai parte de $18/mes, incluye GLM-5.2 y ofrece uso en hora valle a mitad de precio: es una factura distinta de las tarifas por token anteriores.

Qué modelo elegir según la carga de trabajo

Carga de trabajoElecciónMotivo
Ediciones de código simples o intermedias a gran volumenV4 FlashMisma respuesta que GLM-5.2 en mi t1, 3.8x más rápido y 37x más barato
Salida estructurada o de formato estricto a escalaV4 FlashResultado idéntico byte a byte por 1/34 del coste
Recuperación en contexto largo sobre documentos extensosV4 FlashMisma respuesta correcta; la menor brecha de coste, pero aún 9.9x
Programación agéntica difícil o en múltiples archivosGLM-5.251 frente a 40 en el Intelligence Index, y su propia suite agéntica es donde destaca
Cualquier tarea con max_tokens ajustadoV4 FlashGLM-5.2 no devolvió nada con límites de 8K y 16K en mi t2
Salida de más de 128K tokens en una llamadaV4 FlashSalida máxima de 384K frente a los 128K de GLM-5.2

Tómalo como una regla inicial de enrutamiento por coste que debes validar, no como un veredicto cerrado: se apoya en una ejecución de cuatro tareas. Envía las tareas a Flash por defecto y escala a GLM-5.2 el subconjunto en el que una respuesta incorrecta cuesta más de 19x el gasto en tokens. Si ejecutas GLM-5.2, dale margen: un límite generoso para Flash puede acabar produciendo una no respuesta facturada.

Hay una cuestión que esta comparación no puede resolver: desde que 0731 llegó hoy, no ha aparecido ninguna reevaluación independiente de Flash. Por tanto, la diferencia de 51 frente a 40 describe la compilación de abril. La distancia actual de capacidad no está medida, y la única forma de calcularla para tu carga de trabajo es ejecutar tus propias evaluaciones contra ambos alias.

Preguntas frecuentes

¿DeepSeek V4 Flash 0731 es un modelo nuevo o una actualización?

Es una actualización del modelo existente, no un modelo nuevo. La documentación de DeepSeek lista la versión como DeepSeek-V4-Flash-0731 e indica que el método de invocación no cambia, por lo que deepseek-v4-flash sigue resolviendo la compilación más reciente sin que tengas que modificar código.

¿DeepSeek V4 Flash superó a GLM-5.2?

No en capacidad: Artificial Analysis puntúa a GLM-5.2 (max) con 51, frente a 40 para DeepSeek V4 Flash (Reasoning, Max Effort). Flash ganó en coste por tarea resuelta: empató tres de las cuatro tareas evaluadas con un coste total 19.4x menor.

¿Ya está disponible GLM-5.3?

No a fecha de 2026-07-31: GLM-5.2 es la entrada más reciente tanto en la tabla de precios de Z.ai como en la lista de modelos de su Coding Plan; ninguna incluye una fila para 5.3.

¿Cuál es más barato para una tarea con 1M de tokens de contexto?

DeepSeek V4 Flash: es 10x más barato en entrada sin caché y 93x más barato en entrada con caché. Mi tarea de recuperación de ~45K tokens costó $0.006380 con Flash frente a $0.063224 con GLM-5.2.

¿Puedo usar ambos con Claude Code?

Sí. Ambos proveedores documentan un endpoint compatible con el formato Anthropic. DeepSeek lista https://api.deepseek.com/anthropic junto a su URL base con formato OpenAI, y la guía de Claude Code de Z.ai indica configurar ANTHROPIC_BASE_URL como https://api.z.ai/api/anthropic y asignar las ranuras Sonnet y Opus a glm-5.2[1m].

Lecturas relacionadas

  • DeepSeek V4 Flash vs DeepSeek V4 Pro
  • API de GLM-5.2

Fuentes

  • Modelos y precios de DeepSeek — nota de versión 0731, precios, política de hora punta y hora valle, verificado el 2026-07-31
  • Precios de Z.ai — tarifas de GLM-5.2, verificado el 2026-07-31
  • Z.ai Coding Plan — niveles de suscripción y cobertura de GLM-5.2, verificado el 2026-07-31
  • Z.ai: configuración de Claude Code — URL base compatible con Anthropic y asignación de modelos
  • Índice de noticias de DeepSeek — revisado el 2026-07-31, sin entrada de julio de 2026
  • Artificial Analysis: GLM-5.2 vs DeepSeek V4 Flash — Intelligence Index, parámetros
  • benchlm: DeepSeek V4 Flash Base vs GLM-5.2 — cobertura de benchmarks compartidos, puntuaciones de conocimiento
  • r/opencodeCLI: DeepSeek V4 vs GLM 5.2 para programación — informe de usuarios

>_Directorio de modelos AIReiter

Acceso API rápido a modelos relacionados con esta guía

Kimi K3

Chat

Un modelo de razonamiento de contexto largo para programación, escritura, análisis y flujos de trabajo de agentes.

moonshotCrear API Key >

Gemini 3.6 Flash

Chat

Un modelo Gemini rápido para razonamiento avanzado, programación y tareas agénticas.

GoogleCrear API Key >

Claude Fable 5

Chat

Un modelo premium de Claude para razonamiento profundo y trabajo complejo de formato largo.

AnthropicCrear API Key >

Claude Opus 4.8

Chat

Un modelo Claude de alta capacidad para tareas que exigen razonamiento y trabajo profesional.

AnthropicCrear API Key >

Claude Opus 5

Chat

Un modelo premium de Claude para razonamiento complejo, programación y trabajo profesional con contexto largo.

anthropicCrear API Key >

Publicaciones recientes

Recorte de precios de GPT-5.6: cuánto cuestan ahora Luna y Terra

2026-07-31

API key inválida: diagnostica el 401 y el 403 antes de corregir nada

2026-07-31

Cómo resolver el error 429 de OpenRouter: ¿proveedor o límite de tasa?

2026-07-31

La inteligencia publicitaria B2B solo sale del HTML: cómo crear un parser que resista rediseños

2026-07-31
AIREITER

¿Preguntas? Contáctanos en
[email protected]

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 Pro

Video IA

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0

Imagen IA

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 Pro

Blog

Ver todo →

Compañía

Política de privacidadTérminos de servicioPolítica de reembolso

© 2026 AIReiter. Todos los derechos reservados.