AIREITER

Qwen Image 2.1: recensione, VRAM locale, licenza e test

Ultimo Aggiornamento: 2026-09-20 18:56:33

Qwen Image 2.1 non è più soltanto un progetto di cui si parla in anteprima: Qwen ha annunciato il rilascio open-weight il 20 settembre 2026. La domanda utile, ora, è un’altra: trasparenza nativa ed editing integrato giustificano un’installazione locale da circa 33 GB, considerando che l’uso commerciale è limitato?

Qwen Image 2.1: il verdetto in breve

Vale la pena provare Qwen Image 2.1 se cerchi un modello locale per generare e modificare immagini, creare asset trasparenti o comporre scene a partire da più riferimenti. Non è però la mia scelta predefinita per una pipeline commerciale: l’attuale Qwen Research License è non commerciale e il modello richiede molta più memoria di quanto lasci intendere l’etichetta “7B”.

Il profilo ideale è quello di un creator o sviluppatore con una GPU NVIDIA da 16 GB–48 GB, interessato ad avere il massimo controllo sul workflow. È invece poco adatto a un team che ha bisogno subito di diritti commerciali chiari, throughput prevedibile tramite servizio hosted o una qualità minima costante senza occuparsi dell’inferenza locale.

Workflow trasparente di Qwen Image 2.1 con riferimenti su GPU locale

Che cosa è stato davvero rilasciato il 20 settembre 2026

L’annuncio ufficiale di Qwen descrive Qwen Image 2.1 come un modello open-weight unificato per generazione ed editing, con un componente compatto da 7B dedicato alla generazione visiva. Il repository ufficiale documenta l’implementazione e il workflow locale, senza limitarsi a mostrare immagini dimostrative.

Conviene tenere distinti tre aspetti:

DomandaRisposta attualePerché conta
Qwen Image 2.1 è stato rilasciato ufficialmente?Sì, è stato annunciato e distribuito come open weightPuoi valutare il modello reale, non una semplice indiscrezione
È “open source” nel senso commerciale più ampio?Non darlo per scontatoLa licenza è il vincolo principale
L’installazione completa è da 7B?No; il componente visivo è da 7B, ma c’è anche un encoder testo/visione separato e di grandi dimensioniPer pianificare VRAM e spazio di archiviazione devi considerare l’intera pipeline

ComfyUI ha annunciato il supporto dal Day 0 e l’ecosistema include anche Diffusers e integrazioni correlate. È un buon punto di partenza, ma non elimina la necessità di verificare la compatibilità tra workflow, revisione del checkpoint, quantizzazione e licenza rispetto al caso d’uso.

Le funzioni che cambiano davvero il workflow

Un solo checkpoint per generazione ed editing

Qwen Image 2.1 utilizza un’unica pipeline per la generazione text-to-image e l’editing condizionato da immagini. Un prompt può creare una scena da zero, mentre un’immagine di input fornisce il contesto visivo per applicare una modifica guidata da istruzioni. È più pratico che alternare un generatore e un editor separato quando il workflow richiede entrambe le operazioni.

Il vantaggio concreto è la coerenza: la stessa famiglia di modelli può creare una scena prodotto, modificarla e mantenere alcuni riferimenti visivi. Non significa però che ogni intervento conserverà perfettamente i dettagli: i primi utenti segnalano ancora rumore, variazioni di contrasto e risultati occasionalmente dall’aspetto sintetico.

Trasparenza nativa e editing con più riferimenti

La funzione più interessante è l’output RGBA nativo. L’annuncio di Qwen e la documentazione dell’ecosistema descrivono generazione ed editing trasparenti, con uscita dotata di canale alpha invece di un’immagine piatta da scontornare in un secondo momento. Il modello supporta inoltre fino a 10 immagini di riferimento e modifiche locali selezionate con maschere o altre istruzioni spaziali.

Questa combinazione è utile per scontorni di prodotti, compositing, mockup di packaging, character sheet e asset che devono restare modificabili. Un’immagine prodotto trasparente può essere rivista senza trasformare prima il workflow in una pipeline di rimozione dello sfondo.

Trasparenza nativa, però, non significa scontorno perfetto. Bordi sottili, capelli, vetro e oggetti semitrasparenti vanno comunque controllati prima di inserirli in una libreria di asset destinata alla produzione.

Testo, prodotti e storyboard

Il materiale del rilascio sottolinea i miglioramenti nella resa del testo, delle persone, dei prodotti, dei panorami, delle infografiche e delle sequenze in stile storyboard. Sono obiettivi sensati per i primi test, perché combinano composizione, tipografia leggibile e coerenza dei riferimenti invece di premiare soltanto un ritratto riuscito.

Per una prima valutazione, prova lo stesso prompt in quattro varianti: un poster con testo esatto, un’immagine prodotto ottenuta da due riferimenti, un editing locale con maschera e un soggetto trasparente su sfondo a scacchi. In questo modo emergono problemi più utili rispetto alla generazione di dieci paesaggi senza relazione tra loro.

Una GPU da 16 GB può eseguire Qwen Image 2.1?

Sì, ma “si avvia” e “funziona comodamente alla risoluzione nativa 2K” sono due cose diverse. I test della community riportano che una RTX 5070 Ti da 16 GB può gestire un workflow quadrato a 1024 con circa 13,9 GB di VRAM di picco e circa 25 secondi per 20 step. Un test separato su una 4090 ha registrato circa 30,2 GB residenti in BF16, circa 21 secondi a 1024 quadrati e circa 56 secondi a 1536 quadrati.

Sono misurazioni degli utenti, non garanzie ufficiali sulle prestazioni. Hardware, precisione numerica, strategia di offload, numero di step e versioni software possono modificare sensibilmente il risultato.

“Ecco i miei test di Qwen-Image-2.1 su una GPU NVIDIA 5070 Ti (16 GB di VRAM). Ci sta e va abbastanza veloce. Circa 25 secondi per un’immagine 1024², 20 step.” — @BenjaminDEKR, X

Una guida hardware ragionevole è questa:

Memoria GPUAspettative realistiche
12 GBPossibile solo con quantizzazione o offload aggressivi; bisogna accettare compromessi
16 GBI test a 1024 quadrati sono realistici; il 2K può trasformarsi rapidamente in un limite di memoria e velocità
24 GBEsperienza più comoda, anche se i workflow a precisione piena possono richiedere ottimizzazioni
48 GBLa configurazione migliore per sperimentare in BF16 e gestire lavori più pesanti con molti riferimenti

L’etichetta “7B” riduce all’apparenza l’ingombro reale del deployment, perché la pipeline utilizza anche un encoder testo/visione Qwen3-VL e altri componenti. Prima di scaricare tutto, considera circa 33 GB di spazio e lascia ulteriore margine per cache, varianti quantizzate e immagini generate.

La licenza è il vero ostacolo per la produzione

L’apertura tecnica di Qwen Image 2.1 non equivale a un’autorizzazione commerciale senza restrizioni. I materiali del rilascio indicano una licenza di ricerca che limita l’uso a finalità non commerciali. Le discussioni della community hanno individuato proprio questo come il principale problema pratico, soprattutto perché le versioni precedenti di Qwen Image avevano alimentato aspettative più permissive.

Un test locale, un esperimento accademico o un progetto personale sono quindi casi molto diversi da un’immagine prodotto a pagamento, una consegna per un cliente, un servizio hosted o una libreria di asset commerciali. Non dare per scontato che i pixel generati siano autorizzati all’uso commerciale solo perché i pesi sono scaricabili.

Per il lavoro commerciale, chiedi a Qwen quali siano i termini commerciali applicabili oppure scegli un modello e un’API la cui licenza copra esplicitamente l’uso previsto. Una verifica legale costa meno che ricostruire una pipeline di immagini dopo il lancio.

Che cosa apprezzano i primi test e dove emergono i limiti

I commenti iniziali più positivi riguardano il controllo del workflow, non una superiorità visiva assoluta in ogni scenario. Gli utenti segnalano che il modello può funzionare su GPU consumer, conservare la trasparenza, usare più riferimenti e gestire il testo meglio di molte alternative locali. Un altro utente ha raccontato di aver trasformato una foto prodotto scadente scattata con il telefono in un’immagine professionale dopo aver fornito più riferimenti.

Anche i difetti sono importanti. I test della community citano grana, tonalità giallastre o contrasti eccessivi, oltre a variazioni nei dettagli durante il restauro o l’editing. Le prove disponibili sono inoltre concentrate soprattutto sui campioni dei primi giorni, quindi è ancora presto per considerare ogni punteggio benchmark come una classifica stabile per la produzione.

Il paper Qwen-Image-Bench offre un contesto utile perché valuta la fedeltà al mondo reale e la generazione creativa attraverso 56 criteri dettagliati. Tuttavia, la tabella benchmark SOTA2 pubblica mostrata negli attuali risultati di ricerca elenca Qwen Image 2.0 e modelli vicini, non un verdetto indipendente e definitivo su Qwen Image 2.1. Il punteggio di un modello affine non dimostra la qualità della versione 2.1.

Qwen Image 2.1 o API di immagini hosted?

La scelta riguarda soprattutto il controllo locale contro la semplicità operativa, non la tesi secondo cui “un modello open supera sempre un servizio hosted”.

EsigenzaPunto di partenza miglioreMotivo
Consegne commerciali per clienti oggiUn’API hosted con licenza commercialeDiritti e throughput sono più semplici da definire
Ricerca locale o test offlineQwen Image 2.1Nessuna dipendenza da un’API a consumo e workflow ispezionabile
Alpha nativo e modifiche trasparenti ripetuteQwen Image 2.1, dopo aver verificato i bordiLa trasparenza fa parte della pipeline prevista
Produzione ad alto volume senza un team GPUAPI hostedCapacità, fatturazione e disponibilità sono più semplici da gestire
Controllo massimo su riferimenti e nodiQwen Image 2.1Gli strumenti locali espongono una parte maggiore del workflow

Il vantaggio principale di Qwen Image 2.1 non è aver superato in modo definitivo ogni modello chiuso. È offrire a chi lavora in locale la possibilità di combinare generazione, editing, riferimenti, maschere e output alpha in un unico workflow open-weight. Questo vantaggio viene meno se la licenza non copre l’attività commerciale.

Domande frequenti su Qwen Image 2.1

Qwen Image 2.1 è stato rilasciato ufficialmente?

Sì. Qwen ha annunciato il modello open-weight il 20 settembre 2026, mentre il repository ufficiale e le integrazioni dell’ecosistema forniscono i materiali del rilascio. Prima di usare un file scaricato, controlla la revisione del repository e la licenza.

Quanta VRAM richiede Qwen Image 2.1?

Secondo i test della community, una GPU da 16 GB può eseguire un workflow limitato a 1024 quadrati, mentre i test in BF16 su una 4090 hanno usato circa 30,2 GB residenti. Quantizzazione e offload cambiano il risultato, e il 2K nativo è molto più impegnativo.

Qwen Image 2.1 può generare PNG trasparenti?

Sì. L’output RGBA nativo è una delle funzioni principali del modello. Controlla comunque bordi e dettagli semitrasparenti: la presenza del canale alpha non garantisce automaticamente una qualità adatta alla produzione.

Qwen Image 2.1 supporta più immagini di riferimento?

Il materiale ufficiale del rilascio indica il supporto fino a 10 immagini di riferimento. Ordine, risoluzione e relazione visiva tra i riferimenti possono comunque influire sulla coerenza.

Qwen Image 2.1 funziona con ComfyUI?

ComfyUI ha annunciato il supporto in concomitanza con il rilascio. Usa il workflow mantenuto e il checkpoint esatto previsto dall’integrazione; un JSON casuale può richiedere custom node o revisioni incompatibili.

Posso usare Qwen Image 2.1 per scopi commerciali?

Non darlo per scontato. L’attuale licenza di ricerca è non commerciale, quindi l’uso commerciale richiede un’autorizzazione o una licenza separata. Il fatto che sia scaricabile non equivale a un’autorizzazione commerciale.

Qwen Image 2.1 è migliore di GPT Image 2 o di altri modelli hosted?

Non esiste un vincitore unico e valido in ogni situazione. Qwen è più interessante per l’editing locale con alpha e il controllo di più riferimenti; i modelli hosted restano più semplici per il deployment commerciale, la gestione operativa prevedibile e i team senza infrastruttura GPU locale.

Qwen Image 2.1 è adatto al restauro fotografico?

Considera il restauro un caso d’uso debole o ancora non dimostrato, finché non lo avrai provato sulle tue immagini. I primi report della community segnalano alterazioni dei dettagli fini e grana sintetica durante gli editing in stile restauro.

Il prossimo passo: un pilot che parta dai diritti

Se il lavoro è personale o riservato alla ricerca, scarica Qwen Image 2.1 e prova la matrice in quattro casi: scontorno trasparente di un prodotto, composizione prodotto con due riferimenti, editing locale con maschera e poster ricco di testo. Registra VRAM, tempo per immagine, prompt falliti e qualità dei bordi.

Se il lavoro è commerciale, inizia dalla verifica della licenza prima di ottimizzare ComfyUI. Qwen Image 2.1 può essere tecnicamente perfetto per il tuo caso e restare comunque la scelta sbagliata per la produzione finché i diritti commerciali non saranno espliciti.