Qwen-Image-2.1: cosa sa fare, quanto è potente e perché non puoi usarlo per lavoro

Di Daniele Forciniti

Qwen-Image-2.1: cosa sa fare, quanto è potente e perché non puoi usarlo per lavoro

Qwen-Image-2.1 è il nuovo modello per generare e modificare immagini del team Qwen di Alibaba, pubblicato il 20 settembre 2026 con i pesi scaricabili da chiunque. Fa due cose in uno: crea immagini da testo e le modifica, gestisce la trasparenza in modo nativo e accetta fino a dieci immagini di riferimento. Tutto questo con 7 miliardi di parametri nella parte che genera le immagini, cioè poco per un modello di questo tipo.

Nella classifica pubblicata da Qwen supera Nano Banana 2.0 di Google e GPT Image 1.5 di OpenAI. C’è però un dettaglio che quasi nessun articolo racconta, e che per chi lavora conta più dei benchmark: la licenza è cambiata rispetto alle versioni precedenti, e oggi vieta l’uso commerciale. Vediamo tutto, numeri alla mano.

Perché questa uscita conta

Il punto interessante è la taglia. Il primo Qwen-Image, uscito ad agosto 2025, aveva 20 miliardi di parametri. Questo ne ha 7, in 32 strati di quella che in gergo si chiama architettura DiT, e secondo Qwen va meglio del predecessore. Meno parametri vuol dire meno memoria video, quindi gira su schede grafiche normali invece che su hardware da datacenter.

La seconda cosa che conta è che generazione e modifica stanno nello stesso modello. Fino a poco fa servivano strumenti diversi per creare un’immagine, per ritagliarne un soggetto e per modificarne una parte. Qui è tutto insieme, e con la trasparenza gestita in modo nativo, che per chi fa grafica cambia la giornata.

Il mondo dei modelli aperti si muove veloce: è lo stesso movimento che ho raccontato con Kimi K3 sul fronte dei modelli testuali, dove i cinesi hanno accorciato le distanze pubblicando i pesi.

Cosa sa fare, funzione per funzione

Queste sono le capacità dichiarate nell’annuncio ufficiale, tradotte in cosa ci fai davvero:

FunzioneCosa vuol dire in pratica
Trasparenza nativa (RGBA)Genera direttamente un PNG con lo sfondo trasparente, senza scontornare dopo. Può anche modificare il testo dentro un’immagine trasparente
Estrazione del soggettoDa una foto normale tira fuori il soggetto già ritagliato, pronto da riusare in un altro progetto
Fino a 10 immagini di riferimentoGli dai dieci foto di mobili e ti compone la stanza. Oppure modello, vestito, scarpe, borsa e cappello per una prova virtuale
Modifica localeCerchi la parte da cambiare, la evidenzi col pennello o passi una maschera separata, e modifica solo quella
Fedeltà su volti e prodottiLa faccia resta la stessa faccia dopo la modifica, e il prodotto mantiene scritte, forma e materiali
Panorami, infografiche, storyboardDa un selfie costruisce un panorama, da una foto prodotto una infografica, da un personaggio uno storyboard
Le capacità dichiarate da Qwen nell’annuncio del 20 settembre 2026.

La trasparenza merita una riga in più, perché è la novità vera. A dicembre 2025 Qwen aveva pubblicato un modello separato solo per quello. Adesso è dentro al modello principale, e decide da solo se servirti un’immagine normale o una con il canale trasparente in base a come glielo chiedi.

Sulla velocità hanno lavorato su un punto specifico: quando gli passi molte immagini insieme. Riutilizzano i calcoli già fatti sulle immagini di partenza invece di rifarli a ogni passaggio, e questo riduce sia i tempi sia la memoria occupata.

I numeri, e soprattutto chi li ha misurati

Qui serve leggere con attenzione, perché il titolo “batte i modelli chiusi” gira ovunque ma i numeri hanno un’origine precisa.

Grafico a barre con i punteggi Qwen-Image-Bench: Qwen-Image-2.1 a 60,28, Nano Banana 2.0 a 59,82 e GPT Image 1.5 a 59,65
Tre modelli, meno di mezzo punto di differenza. E la classifica la pubblica chi produce il primo.
ModelloPunteggioDi chi è
Qwen-Image-2.160,28Alibaba, pesi scaricabili
Nano Banana 2.059,82Google, chiuso
GPT Image 1.559,65OpenAI, chiuso
Punteggio complessivo su Qwen-Image-Bench, riportato il 21 settembre 2026.

Due cose vanno dette subito. La prima: Qwen-Image-Bench è il banco di prova di Qwen, pubblicato da Qwen, con il suo repository su GitHub. Non è un arbitro terzo. La seconda: come ha scritto the decoder, al momento mancano verifiche indipendenti.

E poi guarda il distacco: 0,46 punti sul secondo, 0,63 sul terzo. Su una scala da 0 a 100 significa che i tre modelli sono sostanzialmente alla pari. La notizia non è “il migliore del mondo”, è che un modello da 7 miliardi di parametri che puoi scaricare sta allo stesso livello di due modelli chiusi. È lo stesso ragionamento che faccio ogni volta sui benchmark, come per i numeri di Gemini 3.8 Live: il primo posto vende titoli, il distacco racconta la verità.

La licenza: il punto che cambia tutto

Ecco la parte che ho trovato raccontata male quasi ovunque, e che per un professionista è decisiva. Ho aperto il file della licenza, non il riassunto di terzi.

ModelloQuandoLicenzaUso commerciale
Qwen-Image (20 miliardi)agosto 2025Apache 2.0Libero
Qwen-Image-2.1 (7 miliardi)settembre 2026Qwen Research LicenseVietato senza licenza separata
Il cambio di licenza fra la prima versione e questa.

Il testo della licenza parla chiaro: l’uso concesso è «solo per scopi non commerciali», e per usarla al lavoro serve chiedere una licenza commerciale separata, scrivendo a un indirizzo email dedicato. Ci sono anche due obblighi minori: se usi le sue immagini per addestrare altri modelli devi scrivere “Built with Qwen”, e non puoi chiamare “Qwen” un tuo derivato.

Tradotto per chi fa il mio mestiere: non puoi generare con questo modello le immagini del sito di un cliente, né i visual di una campagna, senza prima ottenere quella licenza. Puoi studiarlo, provarlo, confrontarlo. Il resto no.

Attenzione perché in giro si legge il contrario: più di un articolo lo dà per rilasciato sotto Apache 2.0, confondendolo con le versioni vecchie. Apache 2.0 permette l’uso commerciale, questa licenza no. Prima di costruirci sopra un servizio, apri il file e leggilo.

Daniele Forciniti · DF Studio Design

Le immagini del tuo sito hanno un peso, anche legale

Ogni immagine che pubblichi porta con sé una licenza, un peso in kilobyte e un testo alternativo. Sono tre cose che decidono quanto il sito carica veloce, quanto Google lo capisce e quanti guai ti eviti.

Mi chiamo Daniele Forciniti: faccio siti web e posizionamento da dieci anni, e da due lavoro anche sulla GEO. Se vuoi un sito costruito bene dalle fondamenta, ne parliamo.

Sviluppo siti web Posizionamento web SEO

Cosa serve per far girare Qwen-Image-2.1 sul tuo computer

I pesi si scaricano da Hugging Face, da ModelScope e dal repository GitHub, che al momento in cui scrivo ha quasi 700 stelle.

  • Spazio su disco: il pacchetto completo sta intorno ai 33 GB, diviso in tre pezzi. Il più pesante non è il generatore di immagini ma il componente che interpreta il testo.
  • Scheda video: secondo the decoder gira su hardware di fascia consumer come una RTX 3090, cioè 24 GB di memoria video.
  • Se hai meno memoria: il codice ufficiale prevede di spostare parte del modello sulla memoria di sistema, e sono già uscite versioni compresse che abbassano parecchio i requisiti.
  • Risoluzioni: lavora nativamente a 2K, con formati pronti dal quadrato 2048 per 2048 al 16:9 da 2752 per 1536.

Se non hai mai fatto girare un modello in locale, il percorso è lo stesso che ho spiegato nella guida su come installare l’AI sul tuo PC: cambia lo strumento, non il ragionamento su memoria e tempi.

Dove provarlo senza installare niente

Se vuoi solo vedere com’è, il modo più veloce è la chat ufficiale di Qwen, che è gratuita e funziona dal browser. Tieni presente che provarlo lì resta comunque una prova: il vincolo della licenza riguarda l’uso che fai delle immagini, non solo il posto da cui le generi.

Il mio consiglio pratico è di testarlo sulle cose in cui dichiara di essere forte: scontorno di un prodotto su sfondo trasparente, composizione di più riferimenti, testo dentro l’immagine. Sono i casi dove gli altri modelli fanno ancora fatica, e dove capisci in cinque minuti se ti serve o no.

Cosa ne penso

Da oltre dieci anni faccio siti e contenuti, e le immagini le produco o le scelgo ogni settimana. Quello che mi interessa di un modello non è il punteggio: è se mi risparmia passaggi. Qui i passaggi risparmiati sono reali, e sono due: lo scontorno e la composizione da più foto. Chi lavora con schede prodotto sa quante ore se ne vanno lì.

Quello che non mi piace è la direzione della licenza. Qwen aveva costruito la sua reputazione pubblicando modelli sotto Apache 2.0, quindi liberi anche per il lavoro. Questa versione fa un passo indietro e lo fa in silenzio, mentre il comunicato parla di apertura. Chiamarlo “aperto” e poi vietarne l’uso professionale è una forzatura, e chi se ne accorge tardi rischia grosso.

Il consiglio che darei a un cliente è semplice: usalo per capire dove sta andando il mercato, non per produrre. Per la produzione, o aspetti una licenza commerciale, o resti su strumenti dove sai cosa hai comprato. La stessa attenzione che serve sui watermark delle immagini AI: sono dettagli noiosi finché non diventano un problema.

Conclusione

Il nuovo modello di Qwen è una bella notizia tecnica: 7 miliardi di parametri che tengono testa ai modelli chiusi, trasparenza nativa, fino a dieci riferimenti e modifica mirata di una singola zona, il tutto scaricabile e utilizzabile sul proprio computer con una scheda video buona. I numeri però arrivano dal banco di prova di casa e il distacco è di mezzo punto, quindi niente trionfalismi. E soprattutto la licenza consente solo l’uso non commerciale: prima di inserirlo nel flusso di lavoro, leggila.

FAQ

È gratis?

Scaricare i pesi non costa niente e provarlo nella chat ufficiale nemmeno. Ma gratis non vuol dire libero: la licenza permette solo usi non commerciali, quindi per lavorarci serve un accordo separato con Qwen.

Posso usarlo per le immagini del sito di un cliente?

No, non con la licenza attuale. Il testo dice esplicitamente che l’uso è concesso solo per scopi non commerciali e che per l’uso commerciale serve una licenza separata, da richiedere a Qwen.

Che differenza c’è con le versioni precedenti?

Tre differenze: è molto più piccolo (7 miliardi di parametri contro i 20 del primo Qwen-Image), unisce generazione e modifica in un modello solo con la trasparenza gestita in modo nativo, e ha una licenza più restrittiva. La prima versione era Apache 2.0.

Serve una scheda video potente?

Per la versione completa sì: si parla di 24 GB di memoria video, quindi una scheda di fascia alta come una RTX 3090 o superiore, più una trentina di gigabyte liberi su disco. Con le versioni compresse che sta pubblicando la comunità i requisiti scendono.

Genera davvero immagini con lo sfondo trasparente?

Sì, ed è la novità principale. Produce direttamente file con il canale di trasparenza, sa modificare il testo dentro un’immagine trasparente e sa estrarre un soggetto da una foto normale restituendolo già scontornato.

Batte davvero Nano Banana e GPT Image?

Sul banco di prova pubblicato da Qwen sì, ma di 0,46 punti su Nano Banana 2.0 e 0,63 su GPT Image 1.5, su una scala da 0 a 100. Sono numeri di parte e al momento non ci sono verifiche indipendenti, quindi la lettura onesta è che siano alla pari.

Quante immagini di riferimento accetta?

Fino a dieci. Negli esempi ufficiali le usano per comporre una foto di gruppo da sei ritratti, per una prova virtuale di abbigliamento con cinque capi e per arredare una stanza partendo da dieci oggetti.

Leggi anche:
Come installare l’AI sul tuo PC ·
Google toglie il watermark dalle immagini AI ·
Stai pagando l’AI 10 volte troppo

Fonti

Avatar Daniele Forciniti
Contattaci ora