AIREITER

Qwen Image 2.1: análisis de VRAM local, licencia y pruebas

Última actualización: 2026-09-20 18:57:45

Qwen Image 2.1 ya no es un simple rumor de acceso anticipado: Qwen anunció el lanzamiento de sus pesos abiertos el 20 de septiembre de 2026. La pregunta importante ahora no es si el modelo existe, sino si su transparencia nativa y su flujo de edición justifican una instalación local de unos 33 GB cuando el uso comercial está restringido.

Qwen Image 2.1: veredicto rápido

Qwen Image 2.1 merece una prueba si buscas un modelo local para generar y editar imágenes, crear recursos transparentes o montar composiciones con varias referencias. No es mi recomendación por defecto para un flujo de producción comercial porque la actual Qwen Research License no permite el uso comercial y el modelo necesita bastante más memoria de la que su etiqueta “7B” podría hacer pensar.

Encaja mejor con creadores o desarrolladores que tengan una GPU NVIDIA de 16 GB–48 GB y valoren controlar todo el flujo. Es una mala opción para equipos que necesiten derechos comerciales inmediatos, un rendimiento predecible en un servicio alojado o un nivel de calidad uniforme sin encargarse de la inferencia local.

Flujo de trabajo de imágenes transparentes con Qwen Image 2.1 y referencias en una GPU local

Qué se lanzó realmente el 20 de septiembre de 2026

El anuncio oficial de Qwen describe Qwen Image 2.1 como un modelo unificado de pesos abiertos para generar y editar imágenes, con un componente compacto de generación visual de 7B. El repositorio oficial documenta la implementación y el flujo de trabajo local, en lugar de limitarse a mostrar imágenes de ejemplo.

Conviene separar tres cuestiones:

PreguntaRespuesta actualPor qué importa
¿Qwen Image 2.1 se ha lanzado oficialmente?Sí, se ha anunciado y distribuido como pesos abiertosPuedes evaluar el modelo real, no un rumor
¿Es “código abierto” en el sentido comercial amplio?No lo des por hechoLa licencia es la condición que marca el límite
¿La instalación completa ocupa 7B?No; el componente visual es de 7B y cuenta con un codificador de texto/visión grande independienteLa planificación de VRAM y almacenamiento debe contemplar todo el flujo

ComfyUI anunció compatibilidad desde el primer día, y el ecosistema también incluye Diffusers y otras integraciones relacionadas. El soporte ayuda, pero no elimina la necesidad de hacer coincidir el flujo, la revisión del checkpoint, la cuantización y la licencia con tu caso de uso.

Las funciones que cambian el flujo de trabajo

Un solo checkpoint para generar y editar

Qwen Image 2.1 utiliza un único pipeline para generar imágenes a partir de texto y editar imágenes condicionadas por una entrada visual. Un prompt puede crear una escena desde cero, mientras que una imagen de entrada aporta el contexto visual para aplicar un cambio guiado por instrucciones. Es más práctico que alternar entre un generador y un editor independiente cuando el flujo combina ambas tareas.

La ventaja práctica es la coherencia: una misma familia de modelos puede crear una escena de producto, revisarla y conservar determinadas referencias visuales. Eso no significa que todas las ediciones mantengan intactos los detalles finos; los primeros usuarios siguen señalando ruido, cambios de contraste y resultados que a veces parecen artificiales.

Transparencia nativa y edición con varias referencias

La función más destacada es la salida RGBA nativa. El anuncio de Qwen y la documentación del ecosistema describen generación y edición transparentes, con salida del canal alfa en lugar de una imagen plana que haya que recortar después. El modelo también admite hasta 10 imágenes de referencia y ediciones locales seleccionadas con máscaras u otras instrucciones espaciales.

La combinación resulta útil para recortes de productos, composiciones, mockups de packaging, fichas de personajes y recursos que deban seguir siendo editables. Una imagen transparente de producto puede revisarse sin convertir antes todo el flujo en un proceso de eliminación de fondos.

Eso no equivale a disponer de un matte perfecto. Los bordes finos, el pelo, el cristal y los objetos semitransparentes aún deben revisarse antes de incorporarlos a una biblioteca de recursos de producción.

Texto, productos y escenas tipo storyboard

El material del lanzamiento destaca mejoras en la representación de texto, personas, fidelidad de productos, panorámicas, infografías y secuencias de estilo storyboard. Son buenos objetivos para las primeras pruebas porque combinan composición, tipografía legible y coherencia entre referencias, en lugar de premiar únicamente un retrato atractivo.

Para una primera evaluación, prueba un mismo prompt en cuatro variantes: un póster con texto exacto, una imagen de producto a partir de dos referencias, una edición local con máscara y un sujeto transparente sobre un fondo de cuadrícula. Así descubrirás fallos mucho más útiles que generando diez paisajes sin relación entre sí.

¿Puede funcionar Qwen Image 2.1 en una GPU de 16 GB?

Sí, pero “puede ejecutarse” y “funciona cómodamente a 2K nativo” son afirmaciones muy distintas. Las pruebas de la comunidad indicaron que una RTX 5070 Ti de 16 GB podía ejecutar un flujo de 1024 píxeles cuadrados con unos 13.9 GB de VRAM máxima y alrededor de 25 segundos para 20 pasos. En otra prueba con una 4090 se registraron unos 30.2 GB residentes en BF16, alrededor de 21 segundos a 1024 píxeles cuadrados y unos 56 segundos a 1536 píxeles cuadrados.

Son mediciones de usuarios, no garantías oficiales de rendimiento. El hardware, la precisión, la estrategia de offload, el número de pasos y las versiones del software pueden cambiar el resultado.

“Estas son mis pruebas de Qwen-Image-2.1 en una GPU NVIDIA 5070 Ti (16 GB de VRAM). Cabe y es bastante rápido. Unos 25 s para una imagen de 1024², 20 pasos.” — @BenjaminDEKR, X

Una guía de hardware razonable sería:

Memoria de la GPUExpectativa práctica
12 GBSolo es posible con cuantización/offload agresivos; espera concesiones
16 GBLas pruebas a 1024 píxeles cuadrados son realistas; 2K puede convertirse en un muro de memoria y velocidad
24 GBMás cómodo, aunque los flujos a máxima precisión aún pueden necesitar optimización
48 GBLa mejor opción para experimentar en BF16 y ejecutar trabajos grandes con muchas referencias

La etiqueta “7B” se queda corta al describir el tamaño real del despliegue porque el pipeline también utiliza un codificador de texto/visión Qwen3-VL y otros componentes. Antes de descargarlo, reserva unos 33 GB de almacenamiento y deja espacio adicional para cachés, variantes cuantizadas y resultados.

La licencia es el verdadero bloqueo para producción

La apertura técnica de Qwen Image 2.1 no implica permiso comercial sin restricciones. Los materiales del lanzamiento identifican una licencia de investigación que limita el uso a fines no comerciales. Las conversaciones de la comunidad señalaron repetidamente este punto como la principal preocupación práctica, sobre todo porque lanzamientos anteriores de imágenes de Qwen habían generado expectativas de condiciones más permisivas.

Eso convierte una prueba local, un experimento académico o un proyecto personal en una decisión muy distinta a la de crear una imagen para un producto de pago, entregar trabajo a un cliente, ofrecer un servicio alojado o construir una biblioteca de recursos comerciales. No des por hecho que los píxeles generados tienen autorización comercial solo porque los pesos se pueden descargar.

Si el trabajo es comercial, consulta a Qwen las condiciones comerciales aplicables o utiliza un modelo y una API cuya licencia cubra explícitamente el uso previsto. Una revisión legal cuesta menos que rehacer un pipeline de imágenes de producción después del lanzamiento.

Qué destacan las primeras pruebas y dónde fallan

Los comentarios iniciales más favorables hablan del control sobre el flujo de trabajo, no de una superioridad visual universal. Los usuarios señalan que el modelo puede ejecutarse en GPUs de consumo, conservar la transparencia, utilizar varias referencias y manejar el texto mejor que muchas alternativas locales. Otro usuario describió cómo convirtió una mala foto de producto tomada con el móvil en una imagen profesional después de aportar varias referencias.

Las limitaciones son igual de importantes. Las pruebas de la comunidad mencionan grano, resultados amarillentos o con demasiado contraste y cambios de detalle durante la restauración o la edición. Además, la evidencia disponible se concentra mucho en las muestras del día del lanzamiento, por lo que aún es pronto para tratar cualquier puntuación de benchmark como una clasificación estable para producción.

El artículo de Qwen-Image-Bench aporta un contexto útil porque evalúa la fidelidad al mundo real y la generación creativa mediante 56 criterios detallados. Sin embargo, la tabla pública de SOTA2 que aparece en los resultados de búsqueda actuales muestra Qwen Image 2.0 y modelos cercanos, no una conclusión independiente y definitiva sobre Qwen Image 2.1. No utilices la puntuación de un modelo vecino como prueba de la calidad de 2.1.

Qwen Image 2.1 frente a las API de imágenes alojadas

La decisión se reduce sobre todo a control local frente a simplicidad operativa, no a la idea de que un modelo abierto siempre supera a uno alojado.

NecesidadMejor punto de partidaMotivo
Entregas comerciales para clientes desde hoyUna API alojada con licencia comercialLos derechos y el rendimiento son más fáciles de definir
Investigación local o experimentos sin conexiónQwen Image 2.1No depende de una API con coste por imagen y permite inspeccionar el flujo
Alfa nativo y ediciones transparentes repetidasQwen Image 2.1, después de probar los bordesLa transparencia forma parte del pipeline previsto
Producción de gran volumen sin un equipo de GPUsAPI alojadaLa capacidad, la facturación y la disponibilidad son más sencillas
Máximo control sobre referencias y nodosQwen Image 2.1Las herramientas locales exponen una mayor parte del flujo

La principal ventaja de Qwen Image 2.1 no es haber superado de forma concluyente a todos los modelos cerrados. Su valor está en que un usuario local puede combinar generación, edición, referencias, máscaras y salida alfa en un único flujo de pesos abiertos. Esa ventaja desaparece si la licencia no cubre la actividad empresarial.

Preguntas frecuentes sobre Qwen Image 2.1

¿Qwen Image 2.1 se ha lanzado oficialmente?

Sí. Qwen anunció el modelo de pesos abiertos el 20 de septiembre de 2026, y el repositorio oficial y las integraciones del ecosistema ofrecen material del lanzamiento. Comprueba la revisión del repositorio y la licencia antes de desplegar un archivo descargado.

¿Cuánta VRAM necesita Qwen Image 2.1?

Según las pruebas de la comunidad, una GPU de 16 GB puede ejecutar un flujo limitado de 1024 píxeles cuadrados, mientras que las pruebas en BF16 con una 4090 utilizaron unos 30.2 GB residentes. La cuantización y el offload cambian el resultado, y 2K nativo exige bastante más.

¿Qwen Image 2.1 puede generar PNG transparentes?

Sí. La salida RGBA nativa es una de las capacidades principales del modelo. Revisa los bordes y los detalles semitransparentes: el canal alfa, por sí solo, no garantiza calidad de producción.

¿Qwen Image 2.1 admite varias imágenes de referencia?

El material oficial del lanzamiento describe compatibilidad con hasta 10 imágenes de referencia. El orden, la resolución y la relación visual entre ellas aún pueden afectar a la coherencia.

¿Qwen Image 2.1 funciona con ComfyUI?

ComfyUI anunció la compatibilidad en torno al lanzamiento. Utiliza el flujo mantenido y el checkpoint exacto que espera la integración; un JSON de workflow cualquiera puede requerir nodos personalizados o revisiones incompatibles.

¿Puedo utilizar Qwen Image 2.1 con fines comerciales?

No lo des por hecho. La licencia de investigación actual no permite el uso comercial, por lo que necesitarás un permiso o una licencia independiente. Que se pueda descargar no significa que exista autorización comercial.

¿Qwen Image 2.1 es mejor que GPT Image 2 u otros modelos alojados?

No existe un ganador único y honesto. Qwen resulta más atractivo para la edición local con control del alfa y varias referencias; los modelos alojados siguen siendo más sencillos para el despliegue comercial, las operaciones predecibles y los equipos sin infraestructura local de GPUs.

¿Qwen Image 2.1 sirve para restaurar fotografías?

Considera la restauración un caso de uso débil o aún no demostrado hasta probarlo con tus propias imágenes. Los primeros comentarios de la comunidad mencionan cambios en detalles finos y grano artificial durante las ediciones de estilo restauración.

El siguiente paso: un piloto que empiece por los derechos de uso

Si el trabajo es personal o exclusivo para investigación, descarga Qwen Image 2.1 y prueba la matriz de cuatro casos: recorte transparente de un producto, composición de producto con dos referencias, edición local con máscara y póster con mucho texto. Registra la VRAM, el tiempo por imagen, los prompts fallidos y la calidad de los bordes.

Si el trabajo es comercial, empieza por revisar la licencia antes de optimizar ComfyUI. Qwen Image 2.1 puede encajar perfectamente desde el punto de vista técnico y seguir siendo la elección equivocada para producción hasta que los derechos comerciales estén claros.