Hy3 vs DeepSeek V4 Flash: Precios, contexto, opiniones reales

Última actualización: 2026-07-14 13:15:28

Si tu carga de trabajo es un agente de codificación que se mantiene por debajo de aproximadamente 150K tokens de contexto, Hy3 es el modelo más inteligente y cuesta aproximadamente lo mismo por token de entrada. Si tus sesiones duran mucho, tu repositorio es grande o necesitas alta concurrencia en producción, DeepSeek V4 Flash gana en tres cifras que Hy3 no puede igualar: una ventana de contexto de 1M tokens, un precio documentado de $0.0028 para aciertos de caché y un techo de concurrencia de 2,500 solicitudes. Esa es la versión breve de la decisión entre hy3 y deepseek v4 flash. La evidencia detrás de esto: precios verificados el 14 de julio de 2026 frente a la documentación oficial de DeepSeek y los listados en vivo de OpenRouter, datos de benchmarks de terceros y lo que informan los desarrolladores en Hacker News y Reddit después de usar ambos a diario.

Dos modelos, dos apuestas diferentes

Tencent lanzó la versión final de Hy3 el 6 de julio de 2026, actualizando la versión preliminar que había estado disponible desde el 23 de abril. Según ese anuncio, es un modelo Mixture-of-Experts con 295B parámetros totales y 21B activos, construido alrededor de lo que Tencent llama un pensamiento híbrido rápido y lento: el modelo decide por solicitud cuánta capacidad de razonamiento dedicar. El contexto alcanza un máximo de 256K tokens. Los pesos son abiertos bajo Apache 2.0, y la API funciona en Tencent Cloud TokenHub.

DeepSeek V4 Flash se lanzó en abril de 2026 como la capa rápida de la familia V4. También es un MoE de pesos abiertos (284B en total, 13B activos, según Artificial Analysis), pero con licencia MIT y ajustado para un objetivo diferente: ofrecer 1M tokens de contexto de forma económica. Admite tanto modos de razonamiento como sin razonamiento (el modo de razonamiento es el predeterminado), con una salida máxima de 384K tokens.

Los conteos de parámetros parecen similares. Los objetivos de diseño no lo son. Hy3 gasta su presupuesto en la calidad del razonamiento por token; Flash lo gasta en la longitud del contexto, la eficiencia de la caché y el rendimiento. La mayoría de las diferencias prácticas que se indican a continuación se remontan a esa división.

Especificación (verificada 2026-07-14)Hy3DeepSeek V4 Flash
Parámetros295B total / 21B activo284B total / 13B activo
Ventana de contexto256K1M (384K salida máxima)
RazonamientoPensamiento híbrido rápido/lentoModos con y sin pensamiento
LicenciaApache 2.0MIT
Lanzado6 de julio de 2026 (vista previa 23 de abr.)abril de 2026
API oficialTencent Cloud TokenHubapi.deepseek.com (formatos OpenAI + Anthropic)

Lo que realmente muestran los benchmarks

En el Artificial Analysis Intelligence Index v4.1, Hy3 obtiene 41 frente a 37 para DeepSeek V4 Flash en modo de razonamiento con alto esfuerzo. Cuatro puntos en ese índice marcan una diferencia real, aproximadamente la distancia entre Flash y los modelos un nivel por debajo, pero no es una diferencia de clase. Ambos modelos se sitúan en la franja de "muy capaces, no de frontera".

Artificial Analysis comparison cards showing Hy3 at 41 and DeepSeek V4 Flash at 37 on the Intelligence Index

Dos advertencias antes de darle demasiado peso a esa puntuación.

Primero, los benchmarks de programación agéntica cuentan una historia más dura sobre ambos modelos. Un comentarista en el hilo de lanzamiento de Hacker News rescató el resultado de DeepSWE de Hy3: 28%, frente al 52% de GPT-5.4 con el máximo esfuerzo. Ninguno de los modelos chinos está cerca de la programación agéntica de frontera; compiten entre sí, no con la cima de la clasificación.

En segundo lugar, trate las tablas de benchmarks publicadas por cualquiera de las dos empresas con escepticismo habitual. Los números de lanzamiento de Hy3 suscitaron acusaciones inmediatas de "benchmaxxed" en el hilo de HN, y las propias tablas de DeepSeek solo cubren las evaluaciones que eligió ejecutar. Los números de terceros de arriba son en los que yo me apoyaría, y dicen lo siguiente: Hy3 es algo más inteligente, y la diferencia es lo bastante pequeña como para que el precio y el contexto puedan cambiar la decisión.

Precios: el precio de etiqueta es una distracción

Dos hojas de precios, verificadas el 14 de julio de 2026, y que conviene mantener separadas. DeepSeek publica precios exactos por token de primera parte en la documentación de su API. Tencent no publica una tarjeta de tarifas equivalente en inglés para el Hy3 final — su comunicado de prensa sitúa la vista previa de entrada de Hy3 en aproximadamente $0.18 por millón de tokens en TokenHub — por lo que la columna de Hy3 a continuación usa las tarifas publicadas por OpenRouter, un precio de mercado y no uno de primera parte.

Por 1M tokensHy3 (OpenRouter marketplace)DeepSeek V4 Flash (first-party API)
Entrada$0.14$0.14 (cache miss)
Entrada, en caché$0.035$0.0028 (cache hit)
Salida$0.58$0.28
DeepSeek official pricing table showing $0.0028 per 1M cached input tokens

Los precios de entrada son idénticos. La decisión está en las otras dos filas.

El multiplicador de aciertos de caché

El precio de acierto de caché de DeepSeek es 50 veces más barato que su precio de fallo de caché, y 12,5 veces más barato que la tarifa en caché de Hy3 en OpenRouter. (Tenga en cuenta que las dos tarifas de caché no son estrictamente equivalentes — el de DeepSeek es un precio de API de primera parte, el de Hy3 es lo que los proveedores subyacentes de OpenRouter cobran por las lecturas de caché — pero son las tarifas que realmente pagaría hoy). Esto importa más que cualquier otro número en esta página si ejecuta agentes. Un bucle de agente reenvía el mismo contexto creciente en cada turno — prompt del sistema, definiciones de herramientas, contenido de archivos, historial de la conversación. En una sesión de 40 turnos, la gran mayoría de sus tokens de entrada son repeticiones. Con una tasa de acierto de caché del 90%, el precio efectivo de entrada de Flash baja de $0.14 a unos $0.017 por millón de tokens. El de Hy3 baja a unos $0.045 — sigue siendo barato, pero casi 3 veces más, y la diferencia se amplía cuanto más duran sus sesiones.

Los tokens de salida es donde Hy3 se vuelve caro

Ambos son modelos de razonamiento, lo que significa que ambos facturan sus tokens de pensamiento como salida. La tarifa de salida de Hy3 de $0.58 es más del doble que la de Flash, de $0.28, así que cada cadena de razonamiento extendida les cuesta a los usuarios de Hy3 aproximadamente el doble. Flash también tiene una válvula de escape que Hy3 no tiene: cambiar al modo sin pensamiento para tareas mecánicas (formato, extracción, ediciones simples) y dejar de pagar por un razonamiento que no necesitas. El desglose de deepseek-v4-flash-vs-deepseek-v4-pro explica cómo funciona ese cambio de modo en la práctica.

El nivel gratuito

Una ventaja genuina de Hy3: OpenRouter enumera una variante tencent/hy3:free sin costo, con límite de tasa pero real. Para evaluar el modelo antes de comprometerse, eso supera a Flash, que no tiene un nivel de API gratuito. La vista previa de Hy3 también sigue listada a $0.063/$0.21 — por debajo del precio de la versión final — si puedes vivir con el punto de control de abril.

El impuesto de la ventana de contexto

El contexto de 256K de Hy3 suena a mucho hasta que ejecutas un agente sobre una base de código real. Un usuario de Reddit en r/hermesagent, que ejecutó ambos modelos en el mismo harness, describió Hy3 como "casi idéntico excepto por el tamaño del contexto, así que hay compactación frecuente." La compactación es más que una molestia: cada ciclo de compactación consume tokens de salida para resumir, descarta detalles e invalida tu caché de prompt, lo que significa que pagas la tasa de cache-miss para reconstruirla.

La brecha se vuelve estructural si lo autohospedas. El diseño de atención dispersa de la arquitectura V4 (DeepSeek llama al mecanismo un indexador relámpago) hace que su caché KV sea drásticamente más ligera que la atención convencional de Hy3. Estos son informes de usuarios individuales, no benchmarks, pero las cifras en el hilo de HN son contundentes: un comentarista que ejecutaba ambos en un par de DGX Sparks informó que podía alojar 3M tokens de caché KV junto con DeepSeek V4 Flash, frente a aproximadamente 130K tokens con Hy3 cuantizado a FP4. Otro estimó que, una vez que llama.cpp admita plenamente el indexador, el contexto completo de 1M de Flash debería requerir solo unos 6GB de RAM. Flash también tiene un historial de sobrevivir a una cuantización agresiva: varios usuarios en el mismo hilo informan que se mantiene coherente incluso a 2-bit, un resultado que aún no se ha demostrado para Hy3.

Si tu caso de uso se mantiene muy por debajo de 200K tokens, toda esta sección no te cuesta nada, y los cuatro puntos extra de inteligencia de Hy3 son gratis. Si no, el impuesto de contexto se acumula: más compactación, más invalidación de caché, más memoria por sesión.

Informes de campo desde el lanzamiento

La señal más útil que encontré no está en ninguna tabla de benchmarks. Es la diferencia de carácter que los desarrolladores describen cuando ejecutan ambos modelos dentro de agentes de codificación.

Un usuario en el mismo hilo de Hacker News, que pasó a DeepSeek V4 Flash y Pro como modelos de uso diario después de cancelar su suscripción a Anthropic y luego probó Hy3, describió Flash de esta manera: la velocidad es excelente, pero "a menudo construye un modelo mental completamente incorrecto y se lanza por el camino equivocado", necesitando correcciones regulares y compactación del historial. Hy3, en su experiencia, "no es tan rápido, pero hasta ahora parece mantenerse en el camino mucho más confiablemente" y se degrada menos a medida que crece el contexto. Otros en el mismo hilo elogiaron el conocimiento del mundo y la calidad de la prosa de Hy3 como mejores que los de Flash para su tamaño.

La situación en Reddit se inclina en el otro sentido para la salida de código en bruto. Una comparación de la misma tarea en r/LLMDevs clasificó "DeepSeek V4 Flash > Hy3 > GLM" y, aun así, describió a Hy3 como "prometedor para flujos de trabajo de programación prácticos." En r/opencode, la opinión recurrente es que Flash es "más que suficiente" para el trabajo diario con agentes.

También hay que considerar el historial operativo. La demanda del lanzamiento de Hy3 superó la capacidad de servicio de Tencent: usuarios en el hilo de HN informaron una fuerte limitación de tasa, y uno que sigue los rankings públicos de uso de OpenRouter señaló que el modelo pasó del primer puesto al 8.º–9.º en un mes, atribuyendo la caída directamente a esos límites. DeepSeek, en cambio, documenta un tope de concurrencia de 2,500 solicitudes para Flash en su API oficial — cinco veces lo que permite para V4 Pro. Para el tráfico de producción, uno de estos proveedores ha publicado garantías de capacidad y el otro tiene un historial de congestión.

Cómo elegir

  • Codificación de agentes, sesiones de menos de ~150K tokens: Hy3. Mayor calidad de razonamiento, se mantiene mejor en la tarea, y los costos de entrada coinciden con el precio de lista de Flash. (150K en lugar del 256K completo porque el contexto del agente crece rápido, y quieres margen antes de que entre en acción la compactación.)
  • Sesiones largas, repositorios grandes, RAG sobre documentos extensos: Flash suele ser la mejor opción. La ventana de 1M más el descuento de caché de 50x pertenecen a una clase de costo distinta, y la sobrecarga de compactación de Hy3 se come su ventaja de inteligencia.
  • APIs de producción de alto volumen: Flash. Concurrencia documentada de 2,500, historial de servicio estable y modo no pensante para llamadas masivas baratas.
  • Escritura, investigación, tareas de conocimiento del mundo: Hy3. Los informes de la comunidad y las evaluaciones de conocimiento AA lo favorecen a este tamaño.
  • Despliegue local: Flash para la mayoría del hardware. Su eficiencia de caché KV y su resiliencia a la cuantización tienen mucha más evidencia de campo; la propia guía de servicio de Tencent para Hy3, citada en el hilo de lanzamiento, es de ocho GPUs de clase H20.
  • Evaluar antes de comprometerse: el nivel gratuito de OpenRouter de Hy3 no cuesta nada probarlo. Ejecuta tus propias tareas a través de él antes de creer la tabla de benchmarks de cualquiera, incluida esta.

Dónde ejecutarlos

DeepSeek V4 Flash: la API oficial ofrece endpoints en formato OpenAI (api.deepseek.com) y en formato Anthropic (api.deepseek.com/anthropic), lo que significa que se integra en herramientas compatibles con Claude con un cambio de base-URL. Tenga en cuenta la fecha límite de migración en esa misma página de precios: los antiguos nombres de modelo deepseek-chat y deepseek-reasoner quedan obsoletos el 24 de julio de 2026, y se asignan respectivamente a los modos sin razonamiento y con razonamiento de Flash. OpenRouter lo ofrece a $0.09/$0.18, ligeramente por debajo de la tarifa oficial, aunque sin los precios por acierto de caché de la API oficial.

Hy3: Tencent Cloud TokenHub es la ruta de primera parte. OpenRouter ofrece la versión final, el punto de control de vista previa más barato y el nivel gratuito. SiliconFlow ha ofrecido promociones de lanzamiento. El autoalojamiento funciona bajo Apache 2.0 si tienes las GPUs. La guía de configuración de la API de Hy3 explica cómo obtener una clave y realizar la primera llamada.

Preguntas frecuentes

¿Hy3 es gratis para usar?

Parcialmente. OpenRouter enumera un nivel con límite de tasa tencent/hy3:free sin costo, y los productos de consumo de Tencent (Yuanbao, ima) usan Hy3 sin cargo. El acceso a la API de producción a través de TokenHub o del nivel de pago de OpenRouter se factura por token.

¿Hy3 es lo mismo que Tencent Hunyuan?

Sí — Hy3 es la tercera generación de la línea de modelos Hunyuan de Tencent, que Tencent ahora comercializa como "Tencent Hy". La vista previa se lanzó el 23 de abril de 2026 y la versión final el 6 de julio de 2026.

¿Cuál es mejor para programar, Hy3 o DeepSeek V4 Flash?

Resultados de la comunidad divididos por tipo de tarea. En comparaciones de Reddit de la misma tarea, la salida bruta de Flash se clasificó por encima de la de Hy3, mientras que los usuarios de agentes en sesiones largas informan que Hy3 se mantiene en el camino con mayor fiabilidad. Las tareas cortas y bien acotadas favorecen la velocidad de Flash; las sesiones de agente de varias horas en las que salirse del rumbo tiene un costo favorecen a Hy3, siempre que tu contexto se mantenga cómodamente dentro de su ventana de 256K.

¿Puedo ejecutar DeepSeek V4 Flash localmente?

Sí, y de forma más práctica que Hy3. Los pesos tienen licencia MIT, la KV cache de la arquitectura es inusualmente ligera y los usuarios informan de una calidad utilizable incluso con cuantización de 2 bits en máquinas con ~96GB de RAM.

¿Por qué la comparación de precios entre hy3 y deepseek v4 flash es tan confusa?

Porque hay al menos cuatro hojas de precios: Tencent TokenHub, las listas final y de vista previa de Hy3 de OpenRouter, y la API oficial de DeepSeek con su tasa de aciertos de caché separada. Compare el precio efectivo para su propio patrón de tráfico: la entrada en caché domina las cargas de trabajo de agentes, y ahí es donde la tarifa de DeepSeek de $0.0028 es difícil de superar.

Conclusión

Hy3 es el modelo más sólido según la evidencia de terceros disponible; DeepSeek V4 Flash es el servicio más sólido. Para cargas de trabajo de API en producción, Flash es mi opción predeterminada: su economía de caché, ventana de contexto y concurrencia publicada se combinan de formas que una ventaja de cuatro puntos en un benchmark no puede compensar. Recurre a Hy3 cuando la calidad del razonamiento por prompt importe más que la escala — y prueba primero su nivel gratuito, ya que no cuesta nada compararlo con tus propias tareas.

Lecturas relacionadas