Qwen-Image-2.1: qué sabe hacer, cuánto rinde y por qué no puedes usarlo para trabajar

Qwen-Image-2.1: qué sabe hacer, cuánto rinde y por qué no puedes usarlo para trabajar

Por Daniele Forciniti

Qwen-Image-2.1 es el nuevo modelo para generar y editar imágenes del equipo Qwen de Alibaba, publicado el 20 de septiembre de 2026 con los pesos abiertos para quien quiera descargarlos. Hace dos cosas en una: crea imágenes a partir de texto y las edita, gestiona la transparencia de forma nativa y acepta hasta diez imágenes de referencia. Todo con 7.000 millones de parámetros en la parte que genera las imágenes, que es poco para un modelo de este tipo.

En la clasificación publicada por Qwen supera a Nano Banana 2.0 de Google y a GPT Image 1.5 de OpenAI. Pero hay un detalle que casi ningún artículo cuenta, y que para quien trabaja pesa más que los benchmarks: la licencia ha cambiado respecto a las versiones anteriores y hoy prohíbe el uso comercial. Vamos por partes, con los números delante.

Por qué este lanzamiento importa

Lo interesante es el tamaño. El primer Qwen-Image, de agosto de 2025, tenía 20.000 millones de parámetros. Este tiene 7.000 millones, repartidos en 32 capas de lo que en jerga se llama arquitectura DiT, y según Qwen rinde mejor que su antecesor. Menos parámetros significa menos memoria de vídeo, así que funciona en tarjetas gráficas normales en lugar de hardware de centro de datos.

La segunda cosa que importa es que generación y edición viven en el mismo modelo. Hasta hace poco hacían falta herramientas distintas para crear una imagen, para recortar un sujeto y para modificar una parte. Aquí está todo junto, y con la transparencia gestionada de forma nativa, que para quien hace diseño cambia el día a día.

El mundo de los modelos abiertos se mueve rápido: es el mismo movimiento que conté con Kimi K3 en el terreno de los modelos de texto, donde los chinos acortaron distancias publicando los pesos.

Qué sabe hacer, función por función

Estas son las capacidades declaradas en el anuncio oficial, traducidas a lo que haces con ellas de verdad:

FunciónQué significa en la práctica
Transparencia nativa (RGBA)Genera directamente un PNG con el fondo transparente, sin recortar después. También puede editar el texto dentro de una imagen transparente
Extracción del sujetoDe una foto normal saca el sujeto ya recortado, listo para reutilizar en otro proyecto
Hasta 10 imágenes de referenciaLe das diez fotos de muebles y te compone la habitación. O modelo, ropa, zapatos, bolso y sombrero para un probador virtual
Edición localRodeas la parte que hay que cambiar, la marcas con el pincel o le pasas una máscara aparte, y edita solo eso
Fidelidad en caras y productosLa cara sigue siendo la misma cara después de la edición, y el producto mantiene textos, forma y materiales
Panorámicas, infografías, storyboardsDe un selfie construye una panorámica, de una foto de producto una infografía, de un personaje un storyboard
Las capacidades declaradas por Qwen en el anuncio del 20 de septiembre de 2026.

La transparencia merece una línea más, porque es la novedad de verdad. En diciembre de 2025 Qwen había publicado un modelo aparte solo para eso. Ahora está dentro del modelo principal, y decide solo si darte una imagen normal o una con canal transparente según cómo se lo pidas.

En velocidad han trabajado en un punto concreto: cuando le pasas muchas imágenes a la vez. Reutilizan los cálculos ya hechos sobre las imágenes de partida en lugar de repetirlos en cada paso, y eso reduce tiempos y memoria ocupada.

Los números, y sobre todo quién los ha medido

Aquí hay que leer con atención, porque el titular «supera a los modelos cerrados» está en todas partes, pero las cifras tienen un origen muy concreto.

Gráfico de barras con las puntuaciones de Qwen-Image-Bench: Qwen-Image-2.1 con 60,28, Nano Banana 2.0 con 59,82 y GPT Image 1.5 con 59,65
Tres modelos, menos de medio punto de diferencia. Y la clasificación la publica quien fabrica el primero.
ModeloPuntuaciónDe quién es
Qwen-Image-2.160,28Alibaba, pesos descargables
Nano Banana 2.059,82Google, cerrado
GPT Image 1.559,65OpenAI, cerrado
Puntuación total en Qwen-Image-Bench, recogida el 21 de septiembre de 2026.

Hay que decir dos cosas enseguida. La primera: Qwen-Image-Bench es el banco de pruebas de Qwen, publicado por Qwen, con su propio repositorio en GitHub. No es un árbitro externo. La segunda: como escribió the decoder, de momento faltan verificaciones independientes.

Y mira la distancia: 0,46 puntos sobre el segundo y 0,63 sobre el tercero. En una escala de 0 a 100 eso significa que los tres están prácticamente empatados. La noticia no es «el mejor del mundo», es que un modelo de 7.000 millones de parámetros que puedes descargar se pone al nivel de dos modelos cerrados. Es el mismo razonamiento que hago siempre con los benchmarks, como con las cifras de Gemini 3.8 Live: el primer puesto vende titulares, la distancia cuenta la verdad.

La licencia: el punto que lo cambia todo

Esta es la parte que he visto peor contada casi en todas partes, y que para un profesional es decisiva. He abierto el archivo de la licencia, no el resumen de terceros.

ModeloCuándoLicenciaUso comercial
Qwen-Image (20.000 millones)agosto de 2025Apache 2.0Libre
Qwen-Image-2.1 (7.000 millones)septiembre de 2026Qwen Research LicenseProhibido sin licencia aparte
El cambio de licencia entre la primera versión y esta.

El texto de la licencia es claro: el uso concedido es «solo para fines no comerciales», y para usarlo en el trabajo hay que pedir una licencia comercial aparte, escribiendo a una dirección de correo específica. Hay además dos obligaciones menores: si usas sus imágenes para entrenar otros modelos tienes que indicar «Built with Qwen», y no puedes llamar «Qwen» a un derivado tuyo.

Traducido para quien hace mi oficio: no puedes generar con este modelo las imágenes de la web de un cliente, ni los visuales de una campaña, sin conseguir antes esa licencia. Puedes estudiarlo, probarlo, compararlo. Lo demás no.

Ojo, porque por ahí se lee lo contrario: más de un artículo lo da como publicado bajo Apache 2.0, confundiéndolo con las versiones antiguas. Apache 2.0 permite el uso comercial, esta licencia no. Antes de montar un servicio encima, abre el archivo y léelo.

Daniele Forciniti · DF Studio Design

Las imágenes de tu web pesan, también en lo legal

Cada imagen que publicas lleva detrás una licencia, un peso en kilobytes y un texto alternativo. Tres cosas que deciden lo rápido que carga la web, lo bien que la entiende Google y los líos que te ahorras.

Me llamo Daniele Forciniti: llevo diez años haciendo webs y posicionamiento, y dos trabajando también en GEO. Si quieres una web bien construida desde los cimientos, hablamos.

Diseño web WordPress Consultoría SEO

Qué hace falta para mover Qwen-Image-2.1 en tu ordenador

Los pesos se descargan desde Hugging Face, desde ModelScope y desde el repositorio de GitHub, que mientras escribo ronda las 700 estrellas.

  • Espacio en disco: el paquete completo ronda los 33 GB, repartidos en tres piezas. La más pesada no es el generador de imágenes, sino el componente que interpreta el texto.
  • Tarjeta gráfica: según the decoder funciona en hardware de consumo como una RTX 3090, es decir 24 GB de memoria de vídeo.
  • Si tienes menos memoria: el código oficial permite mover parte del modelo a la memoria del sistema, y ya han salido versiones comprimidas que bajan bastante los requisitos.
  • Resoluciones: trabaja de forma nativa en 2K, con formatos listos desde el cuadrado de 2048 por 2048 hasta el 16:9 de 2752 por 1536.

Si nunca has movido un modelo en local, el camino es el mismo que expliqué en la guía sobre cómo instalar la IA en tu PC: cambia la herramienta, no el razonamiento sobre memoria y tiempos.

Dónde probarlo sin instalar nada

Si solo quieres ver qué tal, lo más rápido es el chat oficial de Qwen, que es gratuito y funciona desde el navegador. Ten en cuenta que probarlo ahí sigue siendo una prueba: el límite de la licencia afecta al uso que haces de las imágenes, no solo al sitio desde el que las generas.

Mi consejo práctico es probarlo en aquello en lo que dice ser fuerte: recortar un producto sobre fondo transparente, componer a partir de varias referencias y meter texto dentro de la imagen. Son los casos donde los demás modelos todavía sufren, y donde entiendes en cinco minutos si te sirve o no.

Qué pienso yo

Llevo más de diez años haciendo webs y contenidos, y las imágenes las produzco o las elijo cada semana. Lo que me interesa de un modelo no es la puntuación: es si me ahorra pasos. Aquí los pasos ahorrados son reales, y son dos: el recorte y la composición a partir de varias fotos. Quien trabaja con fichas de producto sabe cuántas horas se van ahí.

Lo que no me gusta es la dirección de la licencia. Qwen se había hecho un nombre publicando modelos bajo Apache 2.0, libres también para trabajar. Esta versión da un paso atrás y lo hace en silencio, mientras el comunicado habla de apertura. Llamarlo «abierto» y luego prohibir el uso profesional es forzar la palabra, y quien se dé cuenta tarde se expone a un problema serio.

El consejo que le daría a un cliente es simple: úsalo para entender hacia dónde va el mercado, no para producir. Para producir, o esperas una licencia comercial, o te quedas con herramientas donde sabes qué has comprado. La misma atención que hace falta con las marcas de agua de las imágenes con IA: detalles aburridos hasta que se convierten en un problema.

Conclusión

El nuevo modelo de Qwen es una buena noticia técnica: 7.000 millones de parámetros que aguantan el tipo frente a los modelos cerrados, transparencia nativa, hasta diez referencias y edición dirigida de una zona concreta, todo descargable y usable en tu propio ordenador con una buena tarjeta gráfica. Pero las cifras salen de su propio banco de pruebas y la distancia es de medio punto, así que nada de triunfalismos. Y sobre todo, la licencia solo permite el uso no comercial: antes de meterlo en tu flujo de trabajo, léela.

Preguntas frecuentes

¿Es gratis?

Descargar los pesos no cuesta nada y probarlo en el chat oficial tampoco. Pero gratis no quiere decir libre: la licencia solo permite usos no comerciales, así que para trabajar con él hace falta un acuerdo aparte con Qwen.

¿Puedo usarlo para las imágenes de la web de un cliente?

No con la licencia actual. El texto dice de forma explícita que el uso se concede solo para fines no comerciales y que para el uso comercial hace falta una licencia aparte, que hay que pedirle a Qwen.

¿Qué diferencia hay con las versiones anteriores?

Tres: es mucho más pequeño (7.000 millones de parámetros frente a los 20.000 del primer Qwen-Image), une generación y edición en un solo modelo con transparencia nativa, y tiene una licencia más restrictiva. La primera versión era Apache 2.0.

¿Hace falta una tarjeta gráfica potente?

Para la versión completa sí: se habla de 24 GB de memoria de vídeo, o sea una tarjeta de gama alta como una RTX 3090 o superior, más unos treinta gigas libres en disco. Con las versiones comprimidas que está publicando la comunidad los requisitos bajan.

¿Genera de verdad imágenes con fondo transparente?

Sí, y es la novedad principal. Produce directamente archivos con canal de transparencia, sabe editar el texto dentro de una imagen transparente y sabe extraer un sujeto de una foto normal devolviéndolo ya recortado.

¿De verdad supera a Nano Banana y a GPT Image?

En el banco de pruebas publicado por Qwen sí, pero por 0,46 puntos sobre Nano Banana 2.0 y 0,63 sobre GPT Image 1.5, en una escala de 0 a 100. Son cifras de parte y de momento no hay verificaciones independientes, así que la lectura honesta es que están empatados.

¿Cuántas imágenes de referencia acepta?

Hasta diez. En los ejemplos oficiales las usan para componer una foto de grupo a partir de seis retratos, para un probador virtual de ropa con cinco prendas y para amueblar una habitación partiendo de diez objetos.

Leer también:
Cómo instalar la IA en tu PC ·
Google quita la marca de agua de las imágenes con IA ·
Estás pagando la IA 10 veces de más

Fuentes

Avatar de Daniele Forciniti
Contáctanos ahora