AIREITER

Guía de la API de DeepSeek V4 Flash Vision Exp: límites y ejemplos

Última actualización: 2026-08-21 11:48:02

El deepseek-v4-flash-vision-exp endpoint incorpora entrada de imágenes a la línea V4 Flash, pero la etiqueta experimental es importante: las pruebas de lanzamiento citadas no demuestran que sea fiable en producción. Antes de convertirlo en la opción predeterminada, úsalo en un piloto monitorizado y con un sistema alternativo preparado.

Guía de la API de DeepSeek Vision con la documentación oficial de entrada de imágenes

La decisión sobre la API, en 30 segundos

DeepSeek V4 Flash Vision Exp encaja bien cuando un flujo existente basado en V4 Flash necesita interpretar capturas de pantalla, gráficos, documentos u otras imágenes mediante una interfaz compatible con la API. Para decisiones visuales relacionadas con la identidad o de alto riesgo, conserva un sistema alternativo y valida la tarea por separado.

SituaciónMejor método de entradaMotivo
Imagen local pequeña que se usa una sola vezURL de datos Base64No hace falta alojarla públicamente
Imagen ya alojada públicamenteURL externaEl cuerpo de la solicitud es pequeño
Imagen grande o reutilizada varias vecesFiles API file_idPermite reutilizar la carga y admite hasta 64 MiB por imagen referenciada
Quieres reducir el nivel de detalle para una tarea generaldetail: "low"Reduce la imagen a 512 x 512 antes de la inferencia

La cadena exacta del modelo es deepseek-v4-flash-vision-exp. DeepSeek lo presenta como experimental y afirma que está disponible en la plataforma API desde el 21 de agosto de 2026, según su registro oficial de cambios. La nota de lanzamiento indica que iguala a V4 Flash en capacidades exclusivamente de texto y que mejora notablemente en benchmarks de agentes que requieren comprensión visual.

Envía una imagen con Chat Completions

La solicitud de Chat Completions compatible con OpenAI coloca el texto y la imagen en un array content dentro de un mensaje user. La guía oficial de Vision documenta el comportamiento específico de este modelo; si envías una imagen a deepseek-v4-flash, la API devuelve un error 400.

import base64
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

with open("chart.png", "rb") as image_file:
    encoded = base64.b64encode(image_file.read()).decode("utf-8")

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Extract the three trends from this chart."},
                {
                    "type": "image_url",
                    "image_url": {
                        "url": f"data:image/png;base64,{encoded}",
                        "detail": "original",
                    },
                },
            ],
        }
    ],
)

print(response.choices[0].message.content)

En Chat Completions, las imágenes se admiten en los mensajes de usuario. Mantén la imagen y la instrucción dentro del mismo array content para que el modelo reciba a la vez el contexto visual y la tarea.

Elige cómo transportar la imagen

Base64 para un archivo local pequeño

Base64 es la opción más sencilla para una imagen local que solo vas a usar una vez. Evita tener que alojarla públicamente, pero los datos codificados cuentan para el límite de 48 MiB del cuerpo de la solicitud y la imagen original no puede superar los 32 MiB.

Úsalo para cargas puntuales de usuarios o workers, no para imágenes que vayas a reutilizar en un lote.

URL pública para recursos alojados

Las URL públicas http o https mantienen pequeñas las solicitudes, pero deben ser accesibles, tener menos de 8.192 caracteres, permitir la descarga en un máximo de 60 segundos y apuntar a una imagen de no más de 32 MiB. Las URL privadas, caducadas o internas pueden fallar antes de que DeepSeek consiga descargar la imagen.

Files API para reutilizar archivos grandes

Sube la imagen mediante Files API y utiliza después el ID devuelto en la solicitud de Vision:

{
  "type": "file",
  "file_id": "file-api-xxxxxxxxxxxxxxxx"
}

Un archivo referenciado puede ocupar hasta 64 MiB por imagen y evita subir los mismos bytes en cada solicitud. La contrapartida es añadir un paso de carga y gestionar el ciclo de vida del archivo. Guarda el ID devuelto junto con la clave que lo creó; no lo trates como un enlace público para compartir.

Files API es la opción práctica cuando el archivo supera los 32 MiB, la solicitud podría exceder los 48 MiB o varios pasos de un agente necesitan analizar la misma imagen.

Controla el nivel de detalle antes de pagar por él

El campo detail está disponible para las entradas image_url y las partes de imagen de Responses API; el comportamiento siguiente se basa en la guía oficial de Vision de DeepSeek.

ValorComportamiento documentadoÚsalo cuando
lowReduce la imagen a 512 x 512Bastan la composición, la escena general o una clasificación aproximada
highConserva la imagen originalImportan los textos pequeños o los detalles finos
originalConserva la imagen originalQuieres solicitar explícitamente el tratamiento con todo el detalle
autoActualmente equivale a originalAceptas el comportamiento predeterminado actual

DeepSeek cambia el tamaño de las imágenes antes de la inferencia. La guía de Vision establece un máximo de 384 tokens de imagen por imagen, y cada imagen se contabiliza por separado. Una imagen de origen muy grande no tiene por qué consumir proporcionalmente más tokens de imagen después del redimensionado, aunque los archivos grandes sí pueden alcanzar los límites de carga y tamaño de la solicitud.

La página oficial de Models & Pricing sitúa deepseek-v4-flash-vision-exp en las mismas tarifas por token que V4 Flash: $0.007 por cada 1M de tokens de entrada en caché y $0.22 por cada 1M de tokens de entrada sin acierto de caché durante las horas valle, con tarifas punta de $0.014 y $0.44. La salida cuesta $0.66 en horas valle y $1.32 en horas punta. Los tokens de imagen se facturan como tokens de entrada, así que el número de imágenes y el nivel de detalle también deben entrar en tu cálculo de costes.

Límites que provocan fallos reales en la API

RestricciónLímite o comportamiento
Formatos compatiblesJPEG, PNG, GIF, WebP
Tamaño máximo de la solicitud48 MiB
Tamaño máximo de una imagen Base64 o URL32 MiB
Tamaño máximo de una imagen mediante file_id de Files API64 MiB
Número máximo de imágenes por solicitud600
Tamaño total de imágenes sin imágenes mediante file_id64 MiB
Tamaño total de imágenes incluidas las imágenes mediante file_id200 MiB
Dimensión máxima8.192 píxeles por lado
Límite de dimensiones con 15 imágenes o más4.096 píxeles por lado
Longitud de la URL externa8.192 caracteres
Descarga de imágenes externasDebe completarse en un máximo de 60 segundos

Hay dos restricciones que se pasan por alto con facilidad. Solo deepseek-v4-flash-vision-exp acepta imágenes, y los bloques de imagen incluidos en mensajes system o assistant fallan en Chat Completions. Si envías una imagen a un modelo que no admite visión, DeepSeek documenta el mensaje de error 400 como This model does not support image.

El mismo modelo en tres superficies de API

DeepSeek documenta el modelo en tres interfaces dentro de su guía de Vision:

InterfazBloque de imagenAcceso al resultado
Chat Completionsimage_url en un array de contenido de usuarioresponse.choices[0].message.content
Responses APIinput_image junto con input_textresponse.output_text
API compatible con Anthropicimage en https://api.deepseek.com/anthropicContenido del mensaje de Anthropic

Las tres admiten Base64, URL públicas y referencias de Files API, pero los tipos de contenido cambian. No copies sin más el bloque de Chat Completions en Responses API.

Qué demuestran las pruebas de lanzamiento —y qué no

El registro de cambios del 21 de agosto de DeepSeek comunica resultados sólidos en los benchmarks de lanzamiento, incluidos 83.9 en Terminal Bench 2.1 y 64.3 en Chartography con p0.95. Son resultados publicados por el proveedor, no una reproducción independiente. Además, la nota señala que V4 Flash, en su versión de solo texto, ignora los elementos multimodales en dos evaluaciones visuales.

Como los resultados de los benchmarks de lanzamiento proceden del propio proveedor, valida las tareas visuales relevantes para tu aplicación antes de dirigir tráfico de producción al modelo.

¿Deberías usarlo en producción?

Usa DeepSeek V4 Flash Vision Exp en un piloto controlado si tu carga de trabajo incluye analizar capturas de pantalla, extraer datos de gráficos, clasificar documentos o gestionar un agente que deba interpretar un estado visual. El precio alineado con Flash y sus tres vías de entrada facilitan una evaluación económica, mientras que el límite de 384 tokens por imagen ofrece un punto de partida concreto para estimar costes.

No lo conviertas en el único backend para verificar identidades, tomar decisiones de seguridad, interpretar información médica u otras decisiones visuales de alto impacto mientras el modelo siga siendo experimental y las pruebas de lanzamiento citadas no demuestren su fiabilidad en esos casos. Coloca un sistema alternativo detrás de la misma interfaz y registra el origen de la imagen, el ajuste detail, el uso de tokens de entrada y salida, la latencia, los reintentos y el éxito de la tarea.

Antes de dirigir tráfico de producción al modelo, prueba como mínimo:

  1. Texto pequeño en capturas de pantalla con los niveles de detalle low y original.
  2. Gráficos con etiquetas, leyendas y ejes densos.
  3. Varias imágenes en una misma solicitud.
  4. URL de imágenes privadas y lentas.
  5. Llamadas a herramientas después de la inspección visual.
  6. Prompts de identidad incorrectos o ambiguos.
  7. Comportamiento del sistema alternativo tras un error 400, un tiempo de espera agotado o una respuesta de imagen mal formada.

Preguntas frecuentes sobre la API de DeepSeek V4 Flash Vision Exp

¿Cuál es el nombre exacto del modelo?

Usa deepseek-v4-flash-vision-exp. El registro de cambios de DeepSeek del 21 de agosto de 2026 lo identifica como un modelo multimodal experimental disponible en la plataforma API.

¿Tiene el mismo precio que V4 Flash?

Sí. La página de precios de DeepSeek muestra las mismas tarifas de tokens con acierto de caché, sin acierto de caché y de salida para Vision Exp y V4 Flash. Los tokens de imagen se facturan como tokens de entrada, con un máximo de 384 tokens de imagen por imagen después del redimensionado.

¿Puede generar imágenes?

La guía oficial de Vision documenta la comprensión de imágenes, no su generación. Trata este endpoint como una herramienta de comprensión únicamente, salvo que DeepSeek publique soporte específico para generación.

¿Por qué mi solicitud devuelve un error 400?

Comprueba la cadena del modelo, el rol del mensaje, el tipo de bloque de contenido, el tamaño del archivo y el formato de la imagen. Enviar imágenes a un modelo que no admite visión o colocarlas en roles de mensaje no compatibles puede provocar el error documentado This model does not support image.