Qwen-Image-2.1 publica 7B de pesos con licencia de investigación
Qwen-Image-2.1 reúne 7000 millones de parámetros y transparencia nativa en un modelo de imagen descargable. Su licencia prohíbe el uso comercial sin permiso.
3 min de lectura

En cifras
- parameters in the image generation component
- 7B
- reference images accepted in one edit
- 10
- maximum native resolution
- 2048x2048
El equipo Qwen de Alibaba publicó Qwen-Image-2.1 el 20 de septiembre de 2026 y subió los pesos a Hugging Face y ModelScope. Cualquiera puede descargarlos. La licencia, en cambio, limita lo que se puede hacer después: es una licencia de investigación que prohíbe el uso comercial sin un permiso aparte de Qwen.
Esa distancia entre «descargable» y «utilizable en un producto» es la parte que conviene leer primero. La ficha del modelo llama a esas condiciones Qwen Research License Agreement. The Decoder informa de que las empresas deben obtener un permiso aparte de Qwen antes de lanzar cualquier cosa construida sobre él.
Las dos fuentes describen el lanzamiento de forma distinta, y la diferencia merece mención. The Decoder lo llama modelo open-weight, porque los archivos son públicos. La ficha de Hugging Face presenta la licencia como un acuerdo propietario y no como uno abierto. Ambas describen el mismo lanzamiento desde ángulos diferentes.
Qué hace el modelo
Qwen-Image-2.1 realiza la generación de imágenes a partir de texto y la edición de imágenes en un solo modelo, en lugar de repartir ambas tareas en puntos de control separados.
La capacidad destacada es la transparencia nativa. El modelo genera imágenes RGBA directamente, de modo que la transparencia forma parte de la salida y no es algo que se recorta después. La ficha del modelo describe esto como el reemplazo de los antiguos apaños con el canal alfa.
Para editar admite hasta 10 imágenes de referencia a la vez. Eso permite trabajar con varios sujetos en una misma escena, como retratos de grupo o composiciones de producto. Las ediciones se dirigen a una zona concreta con círculos, marcas pintadas o máscaras separadas.
La resolución nativa llega como máximo a 2048x2048. La ficha del modelo enumera siete relaciones de aspecto: 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 y 9:16.
Qué hay dentro
Los detalles de arquitectura publicados son lo bastante concretos para planificar el hardware.
| Componente | Detalle |
|---|---|
| Generación de imágenes | 7000 millones de parámetros, DiT single-stream de 32 capas |
| Codificador de texto | Qwen3-VL 8B |
| Autocodificador | VAE RGBA de 64 canales, compresión espacial 16x |
| Inferencia por defecto | 40 pasos |
| Eficiencia | Atención de granularidad mixta, reutilización de la caché KV de prefijo |
Un DiT es un diffusion transformer, la arquitectura sobre la que se construyen la mayoría de los modelos de imagen actuales. The Decoder informa de que el modelo funciona en tarjetas gráficas de consumo como la RTX 3090.
El soporte llegó rápido en las herramientas habituales. La ficha del modelo menciona Diffusers, ComfyUI, vLLM-Omni, SGLang y LightX2V. Ejecutarlo requiere torch 2.4.0 o posterior, transformers 5.17 o posterior y diffusers instalado desde git.
La cifra de la prueba exige cautela
Qwen afirma que el modelo supera a la mayoría de los modelos de código cerrado. The Decoder informa de que ese resultado procede de la prueba propietaria de la propia Qwen y de que la validación independiente aún está pendiente.
Eso limita de verdad lo que la cifra demuestra. Una prueba creada por el equipo al que se mide no puede zanjar la comparación con competidores cerrados. Trate la afirmación como una cifra del fabricante hasta que alguien ajeno a Qwen la reproduzca.
Qué significa esto para los desarrolladores
Lea la licencia antes de escribir código contra este modelo. Una licencia de investigación significa que un prototipo vale y un producto no, y esa distinción se descubre con facilidad demasiado tarde. Si el plan implica ingresos, el trabajo empieza con una solicitud de permiso a Qwen, no con una descarga. Es un patrón que conviene seguir: GLM-5.3 lanzó sus pesos con una licencia propia a comienzos de este año. «Puedes descargarlo» ha dejado de ser una señal fiable de lo que se puede construir.
Si su uso es investigación o evaluación interna, el atractivo práctico es la transparencia. Generar RGBA directamente elimina un paso de recorte de fondo en las cadenas de diseño y de recursos, y ese paso es una fuente habitual de bordes irregulares. Pruébelo con sus propios materiales y no con las muestras, porque es justo en la calidad del borde donde estos modelos se diferencian.
En hardware, la cifra con la que dimensionar no es solo el 7B del titular. Son 7000 millones del componente de generación más 8000 millones del codificador de texto. Cuente ambos antes de dar por buena una tarjeta de 24 GB.
Por último, espere pruebas externas antes de comprometerse con una migración. La lista de capacidades es concreta y comprobable hoy. La comparación con los modelos cerrados todavía no lo es.
Fuentes
Artículos relacionados

Los pesos de GLM-5.3 llegan con licencia propia y piden ocho GPU
Los pesos del modelo estrella GLM-5.3 de Z.ai están en Hugging Face tras un retraso por revisión de seguridad. La licencia no es MIT y el modelo necesita al menos ocho GPU de gama alta.

Laya responde a Jev con un modelo abierto de 421M
Laya devuelve decisiones tipadas en 32,8 milisegundos con 421 millones de parámetros y licencia Apache 2.0. Sin ajuste, su acierto roza el azar.

Salesforce Koa parte de pesos abiertos pero sale cerrado
Salesforce dice que Koa comete tres veces menos errores en su propio CRM Bench, pero los pesos son propietarios y el modelo solo corre en su infraestructura.