Qué cambió en DeepSeek V4.1 Flash
V4.1 Flash es una nueva familia de modelos, no un reajuste de V4 Flash. DeepSeek reconstruyó la arquitectura y la entrenó desde cero con 45 billones de tokens multimodales, y el nivel Flash ahora supera a V4 Pro en la mayoría de los benchmarks de agentes.
MoE codificador-decodificador causal
Una mezcla de expertos (MoE) de 552B dividida en un codificador de 20 capas y un decodificador de 20 capas. Solo 8B de parámetros están activos al leer el prompt y 16B al escribir la respuesta, razón por la cual un modelo de este tamaño se mantiene en la franja de precios Flash.
Codificación agéntica superior a V4 Pro
DeepSeek reporta 90.6 en Terminal-Bench 2.1 frente a 82.7 de V4 Flash y 87.9 de V4 Pro, DeepSWE en 74.2 frente a 54.4 y 62.7, y Codeforces en 3471. En Terminal-Bench 3.0 el salto es de 7.6 a 30.0.
Visión integrada desde el entrenamiento, no añadida a posteriori
Un nuevo codificador DeepSeek-ViT fue entrenado conjuntamente con el modelo de texto desde el primer paso del preentrenamiento. V4 Flash era solo de texto y su variante de visión fue un experimento. Capturas de pantalla, gráficos y fotos van en la misma solicitud que el prompt.
Caché KV a un cuarto del tamaño para contexto de 1M
La atención dispersa comprimida y el almacenamiento KV en FP4 reducen la caché global a unos 890 bytes por token, aproximadamente una cuarta parte de V4 Flash. Eso es lo que permite que una ventana de 1M de tokens funcione a coste de Flash y a 214 tokens por segundo en pruebas independientes.
DeepSeek V4.1 Flash vs. V4 Flash
En DeepSeek la migración ya se realizó de forma automática: el id oficial ahora es deepseek-flash, y las solicitudes que todavía indiquen deepseek-v4-flash son atendidas por V4.1. En AIReiter ambos siguen siendo modelos independientes para que puedas fijar cualquiera de los dos.
Menos parámetros activos, puntuaciones más altas
V4 Flash activa 13B de parámetros en cada token. V4.1 Flash activa 8B en prefill y 16B en decode, y aun así lo supera en todos los benchmarks de agentes publicados por DeepSeek. No interpretes el menor número en prefill como una degradación.
El razonamiento ahora está siempre activo
V4 Flash ofrecía modos discretos de razonamiento. V4.1 Flash utiliza un esfuerzo de razonamiento continuo y está configurado por defecto en alto. En esta ruta, una solicitud que envíe thinking desactivado seguirá devolviendo razonamiento; ajusta max_tokens en consecuencia.
La entrada de imágenes forma parte del modelo base
Si antes enrutabas capturas de pantalla a un endpoint de visión independiente junto con V4 Flash, V4.1 Flash maneja ambos en una sola llamada. Envía imágenes como URI de datos base64 en el array estándar de content; esta ruta no obtiene URL de imágenes remotas.
El precio de salida oficial se duplicó, el de la caché no
El precio oficial de salida pasó de $0.28 a $0.60 por millón de tokens. La entrada con acierto de caché se mantiene cerca de $0.003. Las cargas de trabajo con un prefijo largo y estable y respuestas cortas cuestan casi lo mismo que antes; la generación conversacional extensa cuesta más.
Mantén V4 Flash cuando
Una suite de evaluación fijada, un cliente que no pueda manejar reasoning_content en bucles de herramientas o un presupuesto estricto de salida por token aún no estén listos para migrar. De lo contrario, inicia nuevos proyectos en V4.1 Flash.
Precios de la API de DeepSeek V4.1 Flash
Una tarifa plana durante todo el día
Las tres líneas de tokens se facturan aproximadamente a tres cuartas partes de la tarifa valle (off-peak) de DeepSeek. No hay ventana de horas pico en esta ruta, por lo que una tarea ejecutada en horario de oficina de Pekín paga lo mismo que una nocturna. Las cifras en tiempo real se muestran sobre el playground.
Dónde se refleja realmente el ahorro
Frente a la tarifa pico oficial, el precio de AIReiter es de aproximadamente el 38%. Frente a la tarifa valle, es de alrededor del 75%. Si tu tráfico se concentra principalmente en el horario diurno de Europa o EE. UU., que coincide con el pico de DeepSeek, la diferencia es mayor de lo que sugiere el titular.
Los tokens de razonamiento se facturan como salida
El razonamiento no se puede desactivar en esta ruta y V4.1 Flash es extenso con un esfuerzo alto. Las pruebas independientes registraron aproximadamente el doble de tokens de salida respecto a modelos comparables en el mismo conjunto de tareas. Configura max_tokens contemplando el razonamiento más la respuesta.
Los aciertos de caché son la línea más económica
Un token de entrada con cache-hit cuesta alrededor del 2 % de un token con cache-miss. Para bucles de agentes que reenvían el mismo prompt de sistema y esquema de herramientas en cada turno, las lecturas de caché dominan la factura y es donde V4.1 Flash resulta más económico.
Cuándo usar DeepSeek V4.1 Flash (y cuándo no)
Úselo para programación y agentes de terminal
Las ediciones de múltiples archivos, los bucles de prueba y corrección, el triaje de logs de CI y las tareas de computer-use son donde las mejoras publicadas sobre V4 Flash y V4 Pro son mayores. Las trazas largas de herramientas caben en la ventana de 1M sin necesidad de fragmentación.
Úselo para capturas de pantalla y gráficos
El OCR de una captura de interfaz, la lectura de un gráfico o la comprobación de una página renderizada pueden ir directamente en la misma solicitud que la pregunta sobre código. Sin un segundo modelo ni una segunda factura.
Use V4 Pro solo por compatibilidad
DeepSeek mantuvo V4 Pro activo tras el lanzamiento de V4.1 Flash porque los clientes lo pidieron, no porque obtenga mejores puntuaciones. Manténgase en Pro si un contrato o una evaluación congelada lo requieren.
No lo use como una enciclopedia
El modelo base queda por detrás de V4 Pro en SimpleQA-Verified por unos 13 puntos. Para la búsqueda de hechos sin recuperación (retrieval), contextualice el modelo con sus propios documentos o elija un modelo optimizado para recall.
Compárelo en precio con GLM-5.3 Flash
GLM-5.3 Flash es el otro modelo flash multimodal en AIReiter y tiene un precio de lista más económico en salida. Elija V4.1 Flash cuando la tarea sea un bucle de agentes o trabajo con repositorios; elija GLM-5.3 Flash para extracción y clasificación de alto volumen.
Llamar a la API de DeepSeek V4.1 Flash
El playground en esta página y la API comparten un único model id. La única regla de integración que genera fallos en los clientes es cómo se maneja el razonamiento dentro de los bucles de herramientas.
Envíe una tarea de agente real en el playground
Pegue un log con errores junto con el diff y una pregunta. Observe los tokens de salida, que incluyen el razonamiento, y confirme la calidad de la respuesta antes de integrarlo. La entrada de imágenes está disponible a través de la API.
POST /api/v1/chat/completions
Use el modelo "deepseek-v4-1-flash", una API key de AIReiter y el cuerpo estándar de Chat Completions. El streaming funciona. El mismo id también se acepta en /api/v1/messages si su stack utiliza Anthropic Messages.
Reenvíe reasoning_content cuando haya herramientas presentes
Siempre que la solicitud incluya un array tools, cada turno previo del asistente debe incluir de vuelta su reasoning_content, incluso los turnos que no realizaron llamadas a herramientas. Omitirlo devuelve HTTP 400. Esta es la regla que causó fallos en varios frameworks de agentes en V4 y aún sigue aplicando.
Adjunte imágenes en el array content (API)
Use una parte image_url con un URI de datos base64. Se aceptan PNG, JPEG, GIF y WebP. Las URLs de imágenes remotas no se obtienen en esta ruta, así que incluya los bytes en línea. Mantenga la parte de texto primero cuando la imagen sirva como contexto para una pregunta en lugar de ser el tema principal de la misma.
Preguntas sobre la API de DeepSeek V4.1 Flash
Model id, precios, la migración a V4 Flash, entrada de imágenes y la regla de razonamiento que genera errores.
/ 01¿Cuál es el model id de la API de DeepSeek V4.1 Flash?
En AIReiter use deepseek-v4-1-flash. La clave interna es chat-deepseek-v4-1-flash. Directamente en DeepSeek el id oficial es deepseek-flash, y el id anterior deepseek-v4-flash ahora también es atendido por V4.1 Flash.
/ 02¿Cuál es el precio de DeepSeek V4.1 Flash?
DeepSeek lista $0.15 de entrada, $0.60 de salida y $0.003 de entrada con cache-hit por millón de tokens en horas no pico, duplicándose las tres tarifas durante las horas pico de días laborables. AIReiter factura una tarifa plana a todas horas, aproximadamente un 25 % por debajo de la lista en horas no pico y un 62 % por debajo de la lista en horas pico. Los precios de ruta actuales se muestran arriba del playground.
/ 03¿Es V4.1 Flash mejor que V4 Pro?
En los benchmarks de agentes y programación que publicó DeepSeek, sí: Terminal-Bench 2.1 obtiene 90.6 frente a 87.9 y DeepSWE obtiene 74.2 frente a 62.7. V4 Pro sigue liderando en GPQA Diamond y en recuperación de conocimiento. DeepSeek ahora redirige automáticamente a los nuevos usuarios a Flash.
/ 04¿En qué se diferencia de V4 Flash?
Una nueva arquitectura encoder-decoder con 8B a 16B de parámetros activos en lugar de 13B, entrada nativa de imágenes, razonamiento siempre activo, una caché KV de una cuarta parte del tamaño para la ventana de 1M y grandes mejoras en todos los benchmarks de agentes. El precio de lista oficial de salida también aumentó de $0.28 a $0.60.
/ 05¿Puedo desactivar el razonamiento?
No en esta ruta. Las solicitudes que envían thinking desactivado siguen devolviendo reasoning_content, y reasoning_effort no se reenvía. En su lugar, controle los costos con max_tokens y un prompt más ajustado.
/ 06¿Acepta imágenes?
Sí, a través de la API. La visión es nativa en V4.1 Flash y fue verificada en esta ruta. Envíe PNG, JPEG, GIF o WebP como un URI de datos base64 en una parte image_url; las URL remotas no se recuperan. El playground de esta página es solo de texto por ahora.
/ 07¿Por qué mi bucle de tool-calling recibe un error HTTP 400?
Omitió reasoning_content de un mensaje anterior del assistant. Cuando un array de tools está presente, DeepSeek requiere el campo reasoning en cada turno anterior del assistant, incluso en turnos sin una llamada a herramientas (tool call). Almacénelo y reenvíelo sin cambios.
/ 08¿Qué límites de contexto y salida aplican?
DeepSeek documenta una ventana de contexto de 1M de tokens y una salida máxima de 384K. El playground está configurado por defecto en 8192 tokens de salida; auméntelo para ejecuciones largas de agentes y recuerde que los tokens de razonamiento cuentan para este límite.
/ 09¿A qué endpoint debo llamar?
POST https://aireiter.com/api/v1/chat/completions es el contrato principal para este modelo. POST https://aireiter.com/api/v1/messages también funciona con el mismo id para clientes al estilo de Anthropic.
/ 10¿Puedo probarlo antes de integrarlo?
Sí. El playground de esta página ejecuta el mismo model id y ruta que la API, por lo que el recuento de tokens y el comportamiento que ve aquí es lo que devuelve la API.