DeepSeek's V4 Pro ahora cuesta $0.435 por millón de tokens de entrada y $0.87 por millón de salida en la API oficial. El mismo modelo en Azure AI Foundry sigue cotizado en $1.74 y $3.48, exactamente el precio anterior al recorte. Esa diferencia de 4x, verificada el 14 de julio de 2026, es el dato más importante sobre la dinámica de costos de IA empresarial de DeepSeek ahora mismo: lo que paga su empresa depende menos del modelo y más de la puerta por la que entra para الوصول to it.
Este artículo pone números con fecha a la API directa y Azure, prueba una ruta de distribuidor, ejecuta la misma carga de trabajo a través de ambos modelos V4 y termina con un marco de decisión, además de una fecha límite: los alias antiguos deepseek-chat y deepseek-reasoner se retiran el 24 de julio de 2026.
Precios de DeepSeek V4 hoy: los números que importan
Aquí está la lista oficial de precios de la documentación de la API de DeepSeek, verificada el 14 de julio de 2026:
| Modelo | Entrada (acierto de caché) | Entrada (fallo de caché) | Salida | Contexto | Límite de concurrencia |
|---|---|---|---|---|---|
| deepseek-v4-flash | $0.0028/M | $0.14/M | $0.28/M | 1M tokens | 2,500 |
| deepseek-v4-pro | $0.003625/M | $0.435/M | $0.87/M | 1M tokens | 500 |
Tres detalles en esa tabla importan más que las tasas principales:
- El precio de cache-hit es el precio real para las cargas de trabajo de agentes. Un cache hit en V4 Pro cuesta $0.003625 por millón de tokens, 120x más barato que un cache miss. Los sistemas de agentes que reenvían el mismo system prompt y las definiciones de herramientas en cada llamada viven casi por completo en territorio de caché, y DeepSeek aplica el caching automáticamente, sin configuración.
- No hay asterisco promocional. La reducción del 75% que comenzó como una promoción de lanzamiento ahora es el precio de lista. La página de precios no tiene fecha de vencimiento. La cobertura de InfoWorld atribuyó la permanencia a la ingeniería de V4 Pro: aproximadamente una cuarta parte del cómputo por token de su predecesor a largo contexto, por lo que el recorte es estructural, no un subsidio.
- La fecha límite del alias es real. Los nombres de modelo
deepseek-chatydeepseek-reasonerquedan obsoletos el 24 de julio de 2026 a las 15:59 UTC. El código de producción que todavía llame a esos nombres necesita una migración de una línea adeepseek-v4-flashodeepseek-v4-pro. Como los nuevos valores predeterminados se ejecutan en modo thinking, el conteo de tokens de salida (y las facturas) cambiará si no configuras el modo explícitamente.
Ambos modelos ofrecen una ventana de contexto de 1M tokens y hasta 384K tokens de salida, y la API ahora ofrece un formato compatible con Anthropic en api.deepseek.com/anthropic junto con el formato de OpenAI, lo que es importante si su equipo quiere integrar DeepSeek en herramientas creadas para Claude.
La reducción del 75% no llegó a todos los canales
Azure AI Foundry vende el mismo DeepSeek-V4 Pro a $1.74 de entrada y $3.48 de salida por millón de tokens (despliegue global, Centro de EE. UU., verificado el 14 de julio de 2026). Ese es el precio previo al recorte, sin cambios. V4 Flash en Azure cuesta $0.19/$0.51: una prima del 36% en la entrada y una prima del 82% en la salida sobre la tasa de fallo de caché de la API directa.
En la página de precios de Azure que revisamos (despliegue global, Centro de EE. UU., 14 de julio de 2026), no aparece ningún elemento de línea de entrada en caché para ningún modelo de DeepSeek; confírmelo con su equipo de cuenta de Microsoft, ya que los precios del marketplace pueden ir por detrás de los del proveedor. En la API directa, una carga de trabajo de agente con un alto uso compartido de prefijos paga fracciones de centavo por millón de tokens de entrada; en Azure, cada uno de esos tokens se factura al precio completo. Para las cargas de trabajo con mucho uso de caché, la diferencia efectiva no es de 4x; puede superar 100x en el lado de la entrada.
Para ser justos con Azure, no estás comprando exactamente lo mismo. El hosting de Foundry mantiene el tráfico dentro de la nube de Microsoft, bajo los términos de procesamiento de datos de Microsoft, con SLA de Azure y sin que los datos salgan hacia servidores operados por una empresa china, que para muchos equipos de cumplimiento es precisamente el objetivo. Microsoft se está posicionando exactamente de esta manera al integrar DeepSeek en el enrutamiento multimodelo de Copilot. Pero esa prima de gobernanza ahora es cuantificable: para la carga de trabajo de referencia a continuación, la diferencia es entre $31 y $209 al mes por carga de trabajo, y los equipos de compras deberían valorarla como una partida específica, no asumirla como un valor predeterminado invisible.
Los agregadores y revendedores de API se sitúan en el medio. Plataformas como OpenRouter transmiten precios cercanos a la tarifa oficial, y los informes de la comunidad señalan que la caché global de DeepSeek sigue aplicándose a través de ellos. El inconveniente es la visibilidad; más sobre eso abajo, porque lo probamos.
Cuánto cuesta una carga de trabajo empresarial real
Las tarifas de papel solo se convierten en decisiones cuando las multiplicas por una carga de trabajo. Toma un asistente empresarial de tamaño mediano: 100M tokens de entrada al mes (50% de aciertos de caché, una tasa conservadora para el tráfico de agentes que reenvía los prompts del sistema constantemente) más 10M tokens de salida. Aquí está esa misma carga de trabajo valorada en seis canales, usando tarifas verificadas el 14 de julio de 2026:
| Canal | Costo mensual |
|---|---|
| DeepSeek V4 Flash, API directa | $9.94 |
| Azure V4 Flash Global | $24.10 |
| DeepSeek V4 Pro, API directa | $30.63 |
| GPT-5.6-Luna (OpenAI) | $115.00 |
| Azure V4 Pro Global | $208.80 |
| GPT-5.6-Sol (OpenAI) | $575.00 |
Las matemáticas detrás de la tabla son reutilizables: costo mensual = miss_tokens x miss_rate + hit_tokens x hit_rate + output_tokens x output_rate. La proporción de caché domina esto. La misma carga de trabajo de 100M entradas en V4 Pro cuesta directamente $52.20 al mes con 0% de aciertos de caché, $30.63 con 50% y $13.38 con 90% - mientras que en Azure se mantiene en $208.80 en los tres casos, porque no se publica ningún descuento por caché.
Dos lecturas de esa tabla. Primero, el canal DeepSeek más barato y el canal frontier más caro difieren 58x en tráfico idéntico. Segundo, y menos obvio: DeepSeek V4 Pro de Azure cuesta más que GPT-5.6-Luna de OpenAI. Si tu resumen de compras dice "estandarizamos en DeepSeek para ahorrar dinero" pero la implementación es Azure Global, el ahorro puede ser menor de lo que ofrecería un modelo de gama media de OpenAI.
El multiplicador que rompe los presupuestos es la amplificación agentic. Un chatbot de un solo turno factura aproximadamente una llamada por pregunta del usuario; un agente de producción encadena planificación, recuperación, llamadas a herramientas y verificación, y la proporción entre entrada y facturación puede llegar a 1:700, una cifra que el análisis de VentureBeat de julio de 2026 sobre la economía de los agentes llama el "problema de 100x". A esa proporción, nuestra carga de trabajo de referencia de 100M tokens es lo que genera una sola función de agente moderadamente ocupada, no el tráfico de toda una empresa. El precio barato por token no es una licencia para omitir los controles de costos; es lo que hace que los productos agentic sean viables mientras los construyes.
Ejecutamos el mismo trabajo en V4 Flash y V4 Pro
Las páginas de precios no responden la pregunta que harán sus ingenieros: ¿cuánto cuesta una sola solicitud y cuánto tiempo tarda? El 14 de julio de 2026 enviamos la misma tarea de programación —"Escribe una función de Python que analice una cadena de duración ISO 8601 y la convierta en segundos totales, con 3 casos de prueba"— a ambos modelos V4 con la configuración predeterminada (modo de pensamiento activado, máximo 4.000 tokens de salida) a través de un endpoint de revendedor compatible con OpenAI. Dejamos al revendedor sin nombrar porque el punto es el comportamiento de la categoría, no el de un proveedor concreto; las respuestas en bruto contenían el campo reasoning_content de DeepSeek, que es cómo confirmamos el modelo subyacente:
| V4 Flash | V4 Pro | |
|---|---|---|
| Tiempo de reloj | 15.5s | 35.1s |
| Tokens de finalización (incluido el razonamiento) | 1,690 | 1,902 |
| Velocidad efectiva de salida | ~109 tok/s | ~54 tok/s |
| Costo a tarifas oficiales | ~$0.0005 | ~$0.0017 |
Advertencias expresadas claramente: esta es una sola muestra, y la latencia incluye la sobrecarga del relay, así que trate los números de tiempo real como un límite superior más que como un benchmark de la API directa. Ambas respuestas devolvieron el campo distintivo reasoning_content de DeepSeek: ambos modelos ejecutan el modo de pensamiento de forma predeterminada, y esos tokens de razonamiento se facturan como salida. Flash gastó 2,703 caracteres razonando sobre una función de análisis antes de responder. Si su carga de trabajo no necesita chain-of-thought, desactivar thinking es una de las optimizaciones más baratas disponibles. Para una comparación más profunda sobre cuándo la calidad extra de Pro justifica 3x el precio, ejecutamos ambos modelos a través de una comparación completa en DeepSeek V4 Flash vs V4 Pro.
La prueba reveló un hallazgo que no hemos visto documentado en otros lugares: los informes de uso del canal de reenvío no contenían ningún desglose de caché. Enviamos el mismo prefijo de 824 tokens dos veces seguidas, una cache hit de manual si el revendedor conserva el almacenamiento en caché de prefijos de DeepSeek, y la respuesta de la API informó solo prompt_tokens, completion_tokens y total_tokens, sin desglosar prompt_cache_hit_tokens. En la API directa, ese campo es la forma de auditar si el descuento de caché de 120x está llegando a tu factura. A través de un intermediario, puedes recibir el descuento sin poder verificarlo, o no recibirlo en absoluto. Si compras DeepSeek a través de cualquier revendedor, pregunta específicamente si el precio por cache hit se traslada y cómo aparece en tu factura.
API directa, Azure o un agregador: cómo elegir
La decisión del canal se reduce a una breve tabla:
| API directa | Azure AI Foundry | Agregador/revendedor | |
|---|---|---|---|
| Precio de V4 Pro (entrada/salida por M) | $0.435 / $0.87 | $1.74 / $3.48 | Varía; normalmente cerca del oficial |
| Descuento por acierto de caché | Sí, automático, auditable | No listado | A veces; a menudo no auditable |
| Residencia de datos | Servidores de DeepSeek | Cloud de Microsoft, tu tenant | Infraestructura del revendedor |
| Contrato/cumplimiento | Entidad china | Acuerdo de Azure existente | Términos del revendedor |
| Concurrencia | 500 (Pro) / 2,500 (Flash) | PTU provisioning disponible | Agrupado, varía |
| Consolidación multimodelo | Solo DeepSeek | Catálogo de Foundry | Catálogo amplio, una sola factura |
En la práctica: la API directa gana en economía pura: ningún canal iguala el precio de cache-hit de $0.003625 por millón, y es el único canal donde puedes auditar ese descuento. Azure gana cuando tu equipo legal no aprueba el tráfico hacia la propia infraestructura de DeepSeek; estás pagando aproximadamente 7x la tarifa efectiva por gobernanza, y esa compensación puede ser completamente racional si la haces conscientemente. Los agregadores ganan cuando DeepSeek es uno de varios modelos detrás de un router y la facturación consolidada vale un margen estrecho; verifica el pass-through de cache antes de comprometer volumen.
Sea cual sea el canal que elijas, las reglas de enrutamiento que mantienen estables las facturas de DeepSeek no son muy glamorosas: asigna por defecto la clasificación, la extracción y el resumen a Flash; reserva Pro para la generación de código con varios archivos y el razonamiento de contexto largo; desactiva el modo de pensamiento para tareas deterministas (esos tokens de razonamiento se facturan como salida); y limita la profundidad del bucle del agente por flujo de trabajo. Un router bien ajustado importa más que la diferencia de 3x entre Flash y Pro.
Por qué DeepSeek puede tener un precio tan bajo — y si se mantiene
Los precios no son una maniobra de liderazgo a pérdida. La arquitectura de V4 es un diseño de mezcla de expertos con 1,6 billones de parámetros totales, pero solo unos 49 mil millones activos por cada pasada hacia adelante: aplicas inferencia con un coste de computación equivalente al de un modelo de tamaño mediano mientras obtienes una capacidad de clase frontier (80,6% en SWE-bench Verified, según los resultados publicados por DeepSeek). La revisión V4 Pro atacó específicamente el coste del contexto largo, razón por la cual la empresa convirtió su promoción del 75% en el precio estándar en lugar de dejarla expirar.
La dirección de viaje favorece a los compradores. Según la mayoría de las estimaciones de la industria, los costos unitarios de inferencia de frontera han estado cayendo aproximadamente 3x por año, y el recorte de DeepSeek en un año, mientras la longitud de contexto crecía a 1M tokens, supera incluso esa curva. OpenAI se movió en la dirección opuesta durante el mismo período, reposicionando su nivel insignia al alza con GPT-5.6-Sol a $5/$30.
El contrapeso es Jevons: una inferencia más barata produce, de forma fiable, más inferencia. La observación de New Street Research —citada desde la era V3— de que una mayor competencia rara vez reduce el gasto total se ha mantenido durante todo el auge de la IA. La adopción de agentes multiplica las llamadas por usuario más rápido de lo que bajan los precios por token, y por eso las empresas que mantienen planos los presupuestos son las que tratan el routing, el caching y la disciplina de prompts como ingeniería de primer nivel, no las que eligieron el modelo más barato. Entender estas dinámicas de costes, no solo el precio de lista, es lo que separa una implementación de DeepSeek que sigue siendo barata de una que crece silenciosamente de forma desmesurada.
Preguntas frecuentes
¿Cómo es DeepSeek V4 tan barato?
Arquitectura de mezcla de expertos: 1.6T de parámetros totales, ~49B activos por token. El costo de cómputo por token se asemeja al de un modelo mucho más pequeño, y la ingeniería de contexto largo de V4 Pro redujo el cómputo por token a aproximadamente una cuarta parte del de su predecesor. El precio es estructural, no promocional.
¿Cuánto fue el recorte de precio de DeepSeek V4 Pro?
75%: de $1.74/$3.48 por millón de tokens (entrada/salida) a $0.435/$0.87. Comenzó como una promoción limitada y se convirtió en el precio de lista permanente.
¿Se aplica la reducción del precio del 75% en Azure?
No. A fecha de 14 de julio de 2026, Azure AI Foundry lista DeepSeek-V4 Pro Global a $1.74/$3.48, la tarifa previa al recorte, sin que se haya publicado un precio de entrada en caché. Para cargas de trabajo con mucho uso de caché, la diferencia efectiva frente a la API directa puede superar 4x; consulte las tarifas actuales con Microsoft, ya que los precios del marketplace pueden ir por detrás de los recortes del proveedor.
¿DeepSeek es gratuito para uso empresarial?
La API se paga por token, pero los pesos del modelo tienen licencia MIT, así que alojarlo por tu cuenta es legal para uso comercial. A la escala de V4 necesitarías una infraestructura de GPU seria; para la mayoría de los equipos, el precio por token de la API rebaja ampliamente el TCO de una solución autoalojada.
¿Cómo se compara el costo de DeepSeek con ChatGPT?
En cuanto a precios de API, DeepSeek V4 Pro ($0.435/$0.87) cuesta aproximadamente 11 veces menos que GPT-5.6-Sol ($5/$30) en entrada y 34 veces menos en salida. Las suscripciones de ChatGPT ($20–$200/mes por asiento) son un producto diferente; para cargas de trabajo programáticas, la comparación API a API es la que tiene sentido.
Qué hacer antes del 24 de julio
Tres acciones, en orden de urgencia:
1. Migre los alias de modelo ahora. deepseek-chat y deepseek-reasoner dejarán de resolverse el 24 de julio de 2026 a las 15:59 UTC. Fije explícitamente deepseek-v4-flash o deepseek-v4-pro, y establezca el modo de pensamiento deliberadamente; el valor predeterminado cambió, y los tokens de razonamiento se facturan como salida. 2. Reevalúe el precio de su canal. Si está en Azure por motivos de gobernanza, confirme que sigue siendo una decisión consciente con un costo 4x de lista y sin descuento de caché. Si está con un revendedor, obtenga por escrito el traspaso de caché. 3. Audite su tasa de aciertos de caché. En la API directa, verifique prompt_cache_hit_tokens en sus datos de uso. Si el tráfico de su agente está por debajo del 50% de aciertos de caché, reestructure los prompts para que el contenido estático vaya primero: con una diferencia de 120x entre acierto y fallo, el orden de los prompts es una decisión de presupuesto.
El modelo se volvió barato. La dinámica de quién captura esa baratura (el proveedor, la nube, el revendedor o tú) es donde se gana y se pierde el dinero empresarial este año.
Lectura relacionada: DeepSeek V4 Flash vs V4 Pro · GLM 5.2 vs DeepSeek V4 Pro · Guía de precios de OpenRouter
