El deepseek-v4-flash-vision-exp endpoint incorpora entrada de imágenes a la línea V4 Flash, pero la etiqueta experimental es importante: las pruebas de lanzamiento citadas no demuestran que sea fiable en producción. Antes de convertirlo en la opción predeterminada, úsalo en un piloto monitorizado y con un sistema alternativo preparado.
La decisión sobre la API, en 30 segundos
DeepSeek V4 Flash Vision Exp encaja bien cuando un flujo existente basado en V4 Flash necesita interpretar capturas de pantalla, gráficos, documentos u otras imágenes mediante una interfaz compatible con la API. Para decisiones visuales relacionadas con la identidad o de alto riesgo, conserva un sistema alternativo y valida la tarea por separado.
| Situación | Mejor método de entrada | Motivo |
|---|---|---|
| Imagen local pequeña que se usa una sola vez | URL de datos Base64 | No hace falta alojarla públicamente |
| Imagen ya alojada públicamente | URL externa | El cuerpo de la solicitud es pequeño |
| Imagen grande o reutilizada varias veces | Files API file_id | Permite reutilizar la carga y admite hasta 64 MiB por imagen referenciada |
| Quieres reducir el nivel de detalle para una tarea general | detail: "low" | Reduce la imagen a 512 x 512 antes de la inferencia |
La cadena exacta del modelo es deepseek-v4-flash-vision-exp. DeepSeek lo presenta como experimental y afirma que está disponible en la plataforma API desde el 21 de agosto de 2026, según su registro oficial de cambios. La nota de lanzamiento indica que iguala a V4 Flash en capacidades exclusivamente de texto y que mejora notablemente en benchmarks de agentes que requieren comprensión visual.
Envía una imagen con Chat Completions
La solicitud de Chat Completions compatible con OpenAI coloca el texto y la imagen en un array content dentro de un mensaje user. La guía oficial de Vision documenta el comportamiento específico de este modelo; si envías una imagen a deepseek-v4-flash, la API devuelve un error 400.
import base64
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
with open("chart.png", "rb") as image_file:
encoded = base64.b64encode(image_file.read()).decode("utf-8")
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Extract the three trends from this chart."},
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{encoded}",
"detail": "original",
},
},
],
}
],
)
print(response.choices[0].message.content)
En Chat Completions, las imágenes se admiten en los mensajes de usuario. Mantén la imagen y la instrucción dentro del mismo array content para que el modelo reciba a la vez el contexto visual y la tarea.
Elige cómo transportar la imagen
Base64 para un archivo local pequeño
Base64 es la opción más sencilla para una imagen local que solo vas a usar una vez. Evita tener que alojarla públicamente, pero los datos codificados cuentan para el límite de 48 MiB del cuerpo de la solicitud y la imagen original no puede superar los 32 MiB.
Úsalo para cargas puntuales de usuarios o workers, no para imágenes que vayas a reutilizar en un lote.
URL pública para recursos alojados
Las URL públicas http o https mantienen pequeñas las solicitudes, pero deben ser accesibles, tener menos de 8.192 caracteres, permitir la descarga en un máximo de 60 segundos y apuntar a una imagen de no más de 32 MiB. Las URL privadas, caducadas o internas pueden fallar antes de que DeepSeek consiga descargar la imagen.
Files API para reutilizar archivos grandes
Sube la imagen mediante Files API y utiliza después el ID devuelto en la solicitud de Vision:
{
"type": "file",
"file_id": "file-api-xxxxxxxxxxxxxxxx"
}
Un archivo referenciado puede ocupar hasta 64 MiB por imagen y evita subir los mismos bytes en cada solicitud. La contrapartida es añadir un paso de carga y gestionar el ciclo de vida del archivo. Guarda el ID devuelto junto con la clave que lo creó; no lo trates como un enlace público para compartir.
Files API es la opción práctica cuando el archivo supera los 32 MiB, la solicitud podría exceder los 48 MiB o varios pasos de un agente necesitan analizar la misma imagen.
Controla el nivel de detalle antes de pagar por él
El campo detail está disponible para las entradas image_url y las partes de imagen de Responses API; el comportamiento siguiente se basa en la guía oficial de Vision de DeepSeek.
| Valor | Comportamiento documentado | Úsalo cuando |
|---|---|---|
low | Reduce la imagen a 512 x 512 | Bastan la composición, la escena general o una clasificación aproximada |
high | Conserva la imagen original | Importan los textos pequeños o los detalles finos |
original | Conserva la imagen original | Quieres solicitar explícitamente el tratamiento con todo el detalle |
auto | Actualmente equivale a original | Aceptas el comportamiento predeterminado actual |
DeepSeek cambia el tamaño de las imágenes antes de la inferencia. La guía de Vision establece un máximo de 384 tokens de imagen por imagen, y cada imagen se contabiliza por separado. Una imagen de origen muy grande no tiene por qué consumir proporcionalmente más tokens de imagen después del redimensionado, aunque los archivos grandes sí pueden alcanzar los límites de carga y tamaño de la solicitud.
La página oficial de Models & Pricing sitúa deepseek-v4-flash-vision-exp en las mismas tarifas por token que V4 Flash: $0.007 por cada 1M de tokens de entrada en caché y $0.22 por cada 1M de tokens de entrada sin acierto de caché durante las horas valle, con tarifas punta de $0.014 y $0.44. La salida cuesta $0.66 en horas valle y $1.32 en horas punta. Los tokens de imagen se facturan como tokens de entrada, así que el número de imágenes y el nivel de detalle también deben entrar en tu cálculo de costes.
Límites que provocan fallos reales en la API
| Restricción | Límite o comportamiento |
|---|---|
| Formatos compatibles | JPEG, PNG, GIF, WebP |
| Tamaño máximo de la solicitud | 48 MiB |
| Tamaño máximo de una imagen Base64 o URL | 32 MiB |
Tamaño máximo de una imagen mediante file_id de Files API | 64 MiB |
| Número máximo de imágenes por solicitud | 600 |
Tamaño total de imágenes sin imágenes mediante file_id | 64 MiB |
Tamaño total de imágenes incluidas las imágenes mediante file_id | 200 MiB |
| Dimensión máxima | 8.192 píxeles por lado |
| Límite de dimensiones con 15 imágenes o más | 4.096 píxeles por lado |
| Longitud de la URL externa | 8.192 caracteres |
| Descarga de imágenes externas | Debe completarse en un máximo de 60 segundos |
Hay dos restricciones que se pasan por alto con facilidad. Solo deepseek-v4-flash-vision-exp acepta imágenes, y los bloques de imagen incluidos en mensajes system o assistant fallan en Chat Completions. Si envías una imagen a un modelo que no admite visión, DeepSeek documenta el mensaje de error 400 como This model does not support image.
El mismo modelo en tres superficies de API
DeepSeek documenta el modelo en tres interfaces dentro de su guía de Vision:
| Interfaz | Bloque de imagen | Acceso al resultado |
|---|---|---|
| Chat Completions | image_url en un array de contenido de usuario | response.choices[0].message.content |
| Responses API | input_image junto con input_text | response.output_text |
| API compatible con Anthropic | image en https://api.deepseek.com/anthropic | Contenido del mensaje de Anthropic |
Las tres admiten Base64, URL públicas y referencias de Files API, pero los tipos de contenido cambian. No copies sin más el bloque de Chat Completions en Responses API.
Qué demuestran las pruebas de lanzamiento —y qué no
El registro de cambios del 21 de agosto de DeepSeek comunica resultados sólidos en los benchmarks de lanzamiento, incluidos 83.9 en Terminal Bench 2.1 y 64.3 en Chartography con p0.95. Son resultados publicados por el proveedor, no una reproducción independiente. Además, la nota señala que V4 Flash, en su versión de solo texto, ignora los elementos multimodales en dos evaluaciones visuales.
Como los resultados de los benchmarks de lanzamiento proceden del propio proveedor, valida las tareas visuales relevantes para tu aplicación antes de dirigir tráfico de producción al modelo.
¿Deberías usarlo en producción?
Usa DeepSeek V4 Flash Vision Exp en un piloto controlado si tu carga de trabajo incluye analizar capturas de pantalla, extraer datos de gráficos, clasificar documentos o gestionar un agente que deba interpretar un estado visual. El precio alineado con Flash y sus tres vías de entrada facilitan una evaluación económica, mientras que el límite de 384 tokens por imagen ofrece un punto de partida concreto para estimar costes.
No lo conviertas en el único backend para verificar identidades, tomar decisiones de seguridad, interpretar información médica u otras decisiones visuales de alto impacto mientras el modelo siga siendo experimental y las pruebas de lanzamiento citadas no demuestren su fiabilidad en esos casos. Coloca un sistema alternativo detrás de la misma interfaz y registra el origen de la imagen, el ajuste detail, el uso de tokens de entrada y salida, la latencia, los reintentos y el éxito de la tarea.
Antes de dirigir tráfico de producción al modelo, prueba como mínimo:
- Texto pequeño en capturas de pantalla con los niveles de detalle
lowyoriginal. - Gráficos con etiquetas, leyendas y ejes densos.
- Varias imágenes en una misma solicitud.
- URL de imágenes privadas y lentas.
- Llamadas a herramientas después de la inspección visual.
- Prompts de identidad incorrectos o ambiguos.
- Comportamiento del sistema alternativo tras un error 400, un tiempo de espera agotado o una respuesta de imagen mal formada.
Preguntas frecuentes sobre la API de DeepSeek V4 Flash Vision Exp
¿Cuál es el nombre exacto del modelo?
Usa deepseek-v4-flash-vision-exp. El registro de cambios de DeepSeek del 21 de agosto de 2026 lo identifica como un modelo multimodal experimental disponible en la plataforma API.
¿Tiene el mismo precio que V4 Flash?
Sí. La página de precios de DeepSeek muestra las mismas tarifas de tokens con acierto de caché, sin acierto de caché y de salida para Vision Exp y V4 Flash. Los tokens de imagen se facturan como tokens de entrada, con un máximo de 384 tokens de imagen por imagen después del redimensionado.
¿Puede generar imágenes?
La guía oficial de Vision documenta la comprensión de imágenes, no su generación. Trata este endpoint como una herramienta de comprensión únicamente, salvo que DeepSeek publique soporte específico para generación.
¿Por qué mi solicitud devuelve un error 400?
Comprueba la cadena del modelo, el rol del mensaje, el tipo de bloque de contenido, el tamaño del archivo y el formato de la imagen. Enviar imágenes a un modelo que no admite visión o colocarlas en roles de mensaje no compatibles puede provocar el error documentado This model does not support image.