DeepSeek actualizó hoy sin hacer ruido deepseek-v4-flash. En cuatro tareas evaluadas, empató con GLM-5.2 en tres, ganó la cuarta y costó 19x menos de ejecutar. Eso no convierte a Flash en el modelo más capaz sobre el papel: GLM-5.2 sigue puntuando más alto, y su fallo en mi cuarta prueba expone una trampa muy concreta que puede activarse deliberadamente.
La trampa es el presupuesto de razonamiento. En el endpoint que probé, GLM-5.2 razonó extensamente incluso ante prompts breves; en una tarea cargada de especificaciones agotó 16,000 tokens de salida sin llegar a emitir una respuesta. Flash resolvió esa misma tarea con 2,525 tokens.
Qué cambia con la actualización 0731 de deepseek-v4-flash
La documentación de la API de DeepSeek ya identifica la versión de deepseek-v4-flash como DeepSeek-V4-Flash-0731. El método de invocación no cambia y el alias sigue apuntando a la compilación más reciente: no se rompe nada en tu código, pero tampoco hay aviso de que el modelo subyacente ha cambiado.
La página de precios no incluye una entrada de changelog para esta actualización, y el índice de noticias de DeepSeek no mostraba ninguna publicación de julio de 2026 cuando lo revisé el 2026-07-31. Esto importa al interpretar cualquier comparativa: una puntuación publicada de Flash corresponde a la compilación activa cuando se ejecutó la prueba. Conviene revisar tanto la fecha de evaluación como la variante, porque "Flash Base", "Flash (Reasoning)" y "Flash (Reasoning, Max Effort)" son tres filas distintas con cifras diferentes.
La misma página de documentación confirma las especificaciones relevantes para esta comparación: 1M de contexto, 384K de salida máxima, modo thinking activado por defecto con un modo sin razonamiento disponible, y un límite de concurrencia de 2,500 frente a los 500 de Pro. Por ahora, la Responses API solo admite deepseek-v4-flash; deepseek-v4-pro está previsto para principios de agosto de 2026.
Cuatro tareas idénticas: así respondieron ambos modelos
El 2026-07-31 envié a ambos modelos los mismos prompts mediante un relay compatible con OpenAI. Dejé thinking en su configuración predeterminada y fijé max_tokens en 8,000, salvo donde se indique lo contrario. La evaluación fue mecánica, no visual: las dos tareas de programación se ejecutaron contra casos de prueba ocultos, 6 y 8 respectivamente; la tarea JSON se verificó clave por clave contra el esquema solicitado; y la tarea de recuperación tenía una única cadena correcta.
| Tarea | DeepSeek V4 Flash (0731) | GLM-5.2 |
|---|---|---|
| t1 — detectar y corregir un caso límite al fusionar intervalos | 6/6 pruebas, 5.0s, 361 de salida | 6/6 pruebas, 19.0s, 990 de salida |
t2 — implementar next_version() según una especificación de 8 reglas | 8/8 pruebas, 29.9s, 2,525 de salida | sin respuesta devuelta |
| t3 — JSON estricto, claves exactas y sin bloque de código | aprobado, 5.2s, 327 de salida | aprobado, 11.2s, 826 de salida |
| t4 — recuperar y combinar 3 datos de ~45K tokens | correcto, 5.2s, 172 de salida | correcto, 9.7s, 317 de salida |
Tres de las cuatro pruebas fueron empates reales. Ambos encontraron el mismo bug en t1: un < estricto que no fusiona intervalos contiguos como (1,4) y (4,5); los dos aplicaron la misma corrección de un carácter. También resolvieron el JSON estricto de forma idéntica byte a byte. En t4, ambos combinaron un secreto oculto en el registro 211 con una regla del registro 1290 para devolver quartz-mallard-90.
t2 es la excepción, y merece precisión antes que una vuelta de victoria. GLM-5.2 no respondió mal: no respondió. Con un límite de 8,000 tokens consumió los 8,000 en razonamiento y devolvió contenido vacío tras 110s. Lo repetí con 16,000 para descartar que el problema fuese mi propio límite: consumió 16,000 tokens, siguió sin devolver contenido y tardó 214s. Un tercer intento con 24,000 terminó en error después de 301s. Flash generó una función que superó los ocho casos, incluidos los tres que debían lanzar ValueError.
Conviene dejar claras las limitaciones: esto es n=1 por tarea en un único endpoint relay, no un benchmark. Aquí los tokens de razonamiento se facturan dentro de completion_tokens, y el endpoint oficial de Z.ai podría transmitirlos o contabilizarlos de otra forma. Lo que sí sostendría con estos datos es la tendencia, no una proporción exacta: GLM-5.2 invierte muchos más tokens y más tiempo de reloj por tarea.
En qué aspectos GLM-5.2 sí va por delante
GLM-5.2 es el modelo más fuerte según las métricas que usa la industria, y sería un error interpretar mis resultados como una victoria barata en todos los frentes. Artificial Analysis sitúa a GLM-5.2 (max) en 51 en su Intelligence Index, frente a 40 de DeepSeek V4 Flash (Reasoning, Max Effort): una diferencia de 11 puntos con un modelo mucho mayor, 753B totales y ~40B activos, frente a los 284B totales y 13B activos de Flash.
Las cifras publicadas por Z.ai para GLM-5.2 encajan con las de un modelo insignia: SWE-bench Pro 62.1%, Terminal-Bench 2.1 81.0, AIME 2026 99.2%, GPQA Diamond 91.2% y HLE con herramientas 54.7%. Son resultados comunicados por el proveedor, y Flash no cuenta con una entrada comparable en la mayoría de ellos.
Esta ausencia es la conclusión honesta sobre los benchmarks: los dos modelos prácticamente no comparten evaluaciones. El sitio de seguimiento de modelos benchlm los compara, pero evita declarar un ganador porque no tienen ninguna fila equivalente. Las cifras públicas de Flash proceden de una batería para modelos base —MMLU 88.7%, HumanEval 69.5%, GSM8K 90.8%—, mientras que las de GLM-5.2 proceden de una suite de programación agéntica.
El conocimiento es la única categoría en la que coinciden, y allí benchlm coloca a GLM-5.2 por delante, 59.6 frente a 56.4. Cuando dos páginas comparativas discrepan sobre este enfrentamiento, la causa habitual es que evaluaron variantes distintas con suites diferentes. Quédate con la cifra cuya variante y fecha coincidan con lo que piensas invocar.
Los usuarios describen esta división de la misma forma en que apareció en mi prueba. En un hilo de r/opencodeCLI donde ejecutaron la misma tarea con los dos:
GLM 5.2 reasons hard on everything. V4 scales it, almost no wind-up on the simple fix, GLM 5.2 pulls ahead on anything that is not banally [simple] …
Ahí está el intercambio resumido: el razonamiento de GLM-5.2 aporta valor en problemas difíciles y se convierte en sobrecarga pura en los sencillos.
La diferencia de coste supera a la de la tarifa
Empecemos por los precios de lista, ambos verificados en las páginas de los proveedores el 2026-07-31.
| Por 1M de tokens | DeepSeek V4 Flash | GLM-5.2 | Multiplicador de GLM |
|---|---|---|---|
| Entrada (sin caché) | $0.14 | $1.40 | 10.0x |
| Entrada (con caché) | $0.0028 | $0.26 | 92.9x |
| Salida | $0.28 | $4.40 | 15.7x |
| Salida máxima | 384K | 128K | — |
Al aplicar esas tarifas a los tokens que realmente consumió cada modelo en mis cuatro tareas, la distancia supera la relación de 15.7x en salida, porque el modelo más caro también es más verboso:
| Tarea | Entrada→salida Flash | Coste Flash | Entrada→salida GLM-5.2 | Coste GLM-5.2 | Multiplicador |
|---|---|---|---|---|---|
| t1 corrección de bug | 165→361 | $0.000124 | 170→990 | $0.004594 | 37.0x |
| t2 implementación | 182→2,525 | $0.000732 | 196→16,000 | $0.070674 | 96.5x |
| t3 JSON estricto | 171→327 | $0.000116 | 177→826 | $0.003882 | 33.5x |
| t4 contexto largo | 45,225→172 | $0.006380 | 44,164→317 | $0.063224 | 9.9x |
| Las cuatro | 45,743→3,385 | $0.007352 | 44,707→18,133 | $0.142375 | 19.4x |
Todos los prompts se enviaron en frío, por lo que toda la entrada se factura a la tarifa sin caché. Puedes reproducir cualquier cifra multiplicando las columnas anteriores por la tabla de tarifas.
t4 presenta la brecha más estrecha, 9.9x: cuando una carga de trabajo depende sobre todo de tokens de entrada, domina la relación de 10x en input y la verbosidad de salida deja de pesar tanto. Es el único perfil de carga en el que el sobreprecio de GLM-5.2 se mantiene contenido.
La página de precios de DeepSeek indica que la API "adoptará próximamente una política de precios de hora punta y hora valle" con un multiplicador de 2x para todos los conceptos facturables entre las 09:00–12:00 y las 14:00–18:00, hora de Pekín (UTC+8); la fecha efectiva queda pendiente de anuncio. Eso reduciría la ventaja de Flash en salida a aproximadamente 5x durante el horario laboral asiático. En sentido contrario, la entrada con caché de Flash a $0.0028 es 93x más barata que los $0.26 de GLM-5.2, así que reutilizar un prefijo grande y estable amplía la diferencia. Y si tu uso es específicamente programación, el Coding Plan de Z.ai parte de $18/mes, incluye GLM-5.2 y ofrece uso en hora valle a mitad de precio: es una factura distinta de las tarifas por token anteriores.
Qué modelo elegir según la carga de trabajo
| Carga de trabajo | Elección | Motivo |
|---|---|---|
| Ediciones de código simples o intermedias a gran volumen | V4 Flash | Misma respuesta que GLM-5.2 en mi t1, 3.8x más rápido y 37x más barato |
| Salida estructurada o de formato estricto a escala | V4 Flash | Resultado idéntico byte a byte por 1/34 del coste |
| Recuperación en contexto largo sobre documentos extensos | V4 Flash | Misma respuesta correcta; la menor brecha de coste, pero aún 9.9x |
| Programación agéntica difícil o en múltiples archivos | GLM-5.2 | 51 frente a 40 en el Intelligence Index, y su propia suite agéntica es donde destaca |
Cualquier tarea con max_tokens ajustado | V4 Flash | GLM-5.2 no devolvió nada con límites de 8K y 16K en mi t2 |
| Salida de más de 128K tokens en una llamada | V4 Flash | Salida máxima de 384K frente a los 128K de GLM-5.2 |
Tómalo como una regla inicial de enrutamiento por coste que debes validar, no como un veredicto cerrado: se apoya en una ejecución de cuatro tareas. Envía las tareas a Flash por defecto y escala a GLM-5.2 el subconjunto en el que una respuesta incorrecta cuesta más de 19x el gasto en tokens. Si ejecutas GLM-5.2, dale margen: un límite generoso para Flash puede acabar produciendo una no respuesta facturada.
Hay una cuestión que esta comparación no puede resolver: desde que 0731 llegó hoy, no ha aparecido ninguna reevaluación independiente de Flash. Por tanto, la diferencia de 51 frente a 40 describe la compilación de abril. La distancia actual de capacidad no está medida, y la única forma de calcularla para tu carga de trabajo es ejecutar tus propias evaluaciones contra ambos alias.
Preguntas frecuentes
¿DeepSeek V4 Flash 0731 es un modelo nuevo o una actualización?
Es una actualización del modelo existente, no un modelo nuevo. La documentación de DeepSeek lista la versión como DeepSeek-V4-Flash-0731 e indica que el método de invocación no cambia, por lo que deepseek-v4-flash sigue resolviendo la compilación más reciente sin que tengas que modificar código.
¿DeepSeek V4 Flash superó a GLM-5.2?
No en capacidad: Artificial Analysis puntúa a GLM-5.2 (max) con 51, frente a 40 para DeepSeek V4 Flash (Reasoning, Max Effort). Flash ganó en coste por tarea resuelta: empató tres de las cuatro tareas evaluadas con un coste total 19.4x menor.
¿Ya está disponible GLM-5.3?
No a fecha de 2026-07-31: GLM-5.2 es la entrada más reciente tanto en la tabla de precios de Z.ai como en la lista de modelos de su Coding Plan; ninguna incluye una fila para 5.3.
¿Cuál es más barato para una tarea con 1M de tokens de contexto?
DeepSeek V4 Flash: es 10x más barato en entrada sin caché y 93x más barato en entrada con caché. Mi tarea de recuperación de ~45K tokens costó $0.006380 con Flash frente a $0.063224 con GLM-5.2.
¿Puedo usar ambos con Claude Code?
Sí. Ambos proveedores documentan un endpoint compatible con el formato Anthropic. DeepSeek lista https://api.deepseek.com/anthropic junto a su URL base con formato OpenAI, y la guía de Claude Code de Z.ai indica configurar ANTHROPIC_BASE_URL como https://api.z.ai/api/anthropic y asignar las ranuras Sonnet y Opus a glm-5.2[1m].
Lecturas relacionadas
Fuentes
- Modelos y precios de DeepSeek — nota de versión 0731, precios, política de hora punta y hora valle, verificado el 2026-07-31
- Precios de Z.ai — tarifas de GLM-5.2, verificado el 2026-07-31
- Z.ai Coding Plan — niveles de suscripción y cobertura de GLM-5.2, verificado el 2026-07-31
- Z.ai: configuración de Claude Code — URL base compatible con Anthropic y asignación de modelos
- Índice de noticias de DeepSeek — revisado el 2026-07-31, sin entrada de julio de 2026
- Artificial Analysis: GLM-5.2 vs DeepSeek V4 Flash — Intelligence Index, parámetros
- benchlm: DeepSeek V4 Flash Base vs GLM-5.2 — cobertura de benchmarks compartidos, puntuaciones de conocimiento
- r/opencodeCLI: DeepSeek V4 vs GLM 5.2 para programación — informe de usuarios