Un modelo Qwen rápido para programación y tareas extensas
Qwen3.8 Flash es la versión optimizada para velocidad de Qwen3.8 de Alibaba. Está diseñado para programación, agentes que utilizan herramientas y documentos que no caben en un chat breve.
Gran modelo, bajo costo
125 mil millones de parámetros en total, con unos 6 mil millones utilizados en cada token. Por eso se mantiene rápido y lo bastante económico para cargas de trabajo de alto volumen.
1 millón de tokens de contexto
Envía una especificación extensa, un conjunto de archivos o una larga traza de agente en una sola solicitud. Una sola respuesta puede alcanzar hasta 131,072 tokens.
Lee tanto imágenes como texto
El modelo comprende capturas de pantalla, gráficos y documentos, no solo texto plano. Utilízalo cuando la tarea comience a partir de algo en pantalla.
Aproximadamente $0.057 / $0.193
Por millón de tokens, la entrada cuesta unos $0.057 y la salida unos $0.193, casi la mitad del precio de lista oficial. La entrada en caché es más económica. La barra de precios de arriba muestra la tarifa en tiempo real.
Puntos fuertes de Qwen3.8 Flash
La propia ficha técnica de Qwen, publicada con el lanzamiento de agosto de 2026, otorga a Flash la puntuación más alta en programación y uso de herramientas entre los modelos comparados.
Trabajo con repositorios
SWE-bench Pro 62.5. SWE-bench Multilingual 81.0. Utilízalo para encontrar un error, editar varios archivos y verificar el resultado.
Agentes que llaman a herramientas
DeepSWE 58.7. Toolathlon 73.5. Mantiene un bucle de varios pasos: lee el fallo, llama a una herramienta e intenta de nuevo.
Código y preguntas complejas
LiveCodeBench v6 obtiene 91.9. GPQA Diamond obtiene 91.7. La programación competitiva y las preguntas de ciencias están a su alcance.
Análisis de pantalla
Puntuación parcial de OSWorld de 52.3. MathVision 90.6, o 95.7 cuando puede ejecutar código. Las capturas de pantalla y los gráficos pueden incluirse junto con la pregunta.
Flash o Max
Elige Flash
Agentes de programación, ciclos de prueba y corrección, documentos extensos y cualquier carga de trabajo donde el costo sea prioritario. La ventana de 1M abarca un registro extenso sin necesidad de dividirlo.
Elige Max
Qwen3.8 Max es el modelo insignia de 2.4 billones de parámetros. Utilízalo cuando desees el modelo Qwen más potente y el precio por token sea secundario. Ábrelo en /chat/qwen3-8-max.
Misma estructura de solicitud
Ambos modelos aceptan una solicitud estándar de chat completion. Para Flash, establece el modelo en qwen3.8-flash. Aumenta max tokens cuando la respuesta requiera una traza larga. El valor predeterminado es 8,192 y el límite máximo es 131,072.
Preguntas
Contexto, precio, imágenes y cómo se compara con Max.
/ 01¿Para qué sirve Qwen3.8 Flash?
Programación rápida, agentes que usan herramientas y documentos largos. Es el Qwen3.8 más económico y rápido, no una copia reducida de Max.
/ 02¿De cuánto es el contexto?
1 millón de tokens. Una sola respuesta puede tener hasta 131,072 tokens.
/ 03¿Cuánto cuesta?
Aproximadamente $0.057 de entrada y $0.193 de salida por millón de tokens, cerca de la mitad del precio oficial de lista. Leer desde la caché cuesta menos. No hay cargos adicionales por llamada a herramientas. La barra de precios muestra la tarifa en tiempo real.
/ 04¿Puede leer imágenes?
Sí. Las capturas de pantalla, gráficos e imágenes de documentos forman parte del modelo, junto con el texto.
/ 05¿Cuándo debería usar Qwen3.8 Max en su lugar?
Cuando buscas el modelo insignia y puedes pagar más por token. Max es el modelo 2.4T. Flash es la opción ideal para volumen.