Skip to content

Qwen-Image-2.1 publica 7B de pesos con licencia de investigación

Qwen-Image-2.1 reúne 7000 millones de parámetros y transparencia nativa en un modelo de imagen descargable. Su licencia prohíbe el uso comercial sin permiso.

Por Tech AI Wire Team

3 min de lectura

XLinkedIn
A browser window showing a Hugging Face model page for Qwen/Qwen-Image-2.1, with the Qwen Research License listed in the sidebar.

En cifras

parameters in the image generation component
7B
reference images accepted in one edit
10
maximum native resolution
2048x2048

El equipo Qwen de Alibaba publicó Qwen-Image-2.1 el 20 de septiembre de 2026 y subió los pesos a Hugging Face y ModelScope. Cualquiera puede descargarlos. La licencia, en cambio, limita lo que se puede hacer después: es una licencia de investigación que prohíbe el uso comercial sin un permiso aparte de Qwen.

Esa distancia entre «descargable» y «utilizable en un producto» es la parte que conviene leer primero. La ficha del modelo llama a esas condiciones Qwen Research License Agreement. The Decoder informa de que las empresas deben obtener un permiso aparte de Qwen antes de lanzar cualquier cosa construida sobre él.

Las dos fuentes describen el lanzamiento de forma distinta, y la diferencia merece mención. The Decoder lo llama modelo open-weight, porque los archivos son públicos. La ficha de Hugging Face presenta la licencia como un acuerdo propietario y no como uno abierto. Ambas describen el mismo lanzamiento desde ángulos diferentes.

Qué hace el modelo

Qwen-Image-2.1 realiza la generación de imágenes a partir de texto y la edición de imágenes en un solo modelo, en lugar de repartir ambas tareas en puntos de control separados.

La capacidad destacada es la transparencia nativa. El modelo genera imágenes RGBA directamente, de modo que la transparencia forma parte de la salida y no es algo que se recorta después. La ficha del modelo describe esto como el reemplazo de los antiguos apaños con el canal alfa.

Para editar admite hasta 10 imágenes de referencia a la vez. Eso permite trabajar con varios sujetos en una misma escena, como retratos de grupo o composiciones de producto. Las ediciones se dirigen a una zona concreta con círculos, marcas pintadas o máscaras separadas.

La resolución nativa llega como máximo a 2048x2048. La ficha del modelo enumera siete relaciones de aspecto: 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 y 9:16.

Qué hay dentro

Los detalles de arquitectura publicados son lo bastante concretos para planificar el hardware.

ComponenteDetalle
Generación de imágenes7000 millones de parámetros, DiT single-stream de 32 capas
Codificador de textoQwen3-VL 8B
AutocodificadorVAE RGBA de 64 canales, compresión espacial 16x
Inferencia por defecto40 pasos
EficienciaAtención de granularidad mixta, reutilización de la caché KV de prefijo

Un DiT es un diffusion transformer, la arquitectura sobre la que se construyen la mayoría de los modelos de imagen actuales. The Decoder informa de que el modelo funciona en tarjetas gráficas de consumo como la RTX 3090.

El soporte llegó rápido en las herramientas habituales. La ficha del modelo menciona Diffusers, ComfyUI, vLLM-Omni, SGLang y LightX2V. Ejecutarlo requiere torch 2.4.0 o posterior, transformers 5.17 o posterior y diffusers instalado desde git.

La cifra de la prueba exige cautela

Qwen afirma que el modelo supera a la mayoría de los modelos de código cerrado. The Decoder informa de que ese resultado procede de la prueba propietaria de la propia Qwen y de que la validación independiente aún está pendiente.

Eso limita de verdad lo que la cifra demuestra. Una prueba creada por el equipo al que se mide no puede zanjar la comparación con competidores cerrados. Trate la afirmación como una cifra del fabricante hasta que alguien ajeno a Qwen la reproduzca.

Qué significa esto para los desarrolladores

Lea la licencia antes de escribir código contra este modelo. Una licencia de investigación significa que un prototipo vale y un producto no, y esa distinción se descubre con facilidad demasiado tarde. Si el plan implica ingresos, el trabajo empieza con una solicitud de permiso a Qwen, no con una descarga. Es un patrón que conviene seguir: GLM-5.3 lanzó sus pesos con una licencia propia a comienzos de este año. «Puedes descargarlo» ha dejado de ser una señal fiable de lo que se puede construir.

Si su uso es investigación o evaluación interna, el atractivo práctico es la transparencia. Generar RGBA directamente elimina un paso de recorte de fondo en las cadenas de diseño y de recursos, y ese paso es una fuente habitual de bordes irregulares. Pruébelo con sus propios materiales y no con las muestras, porque es justo en la calidad del borde donde estos modelos se diferencian.

En hardware, la cifra con la que dimensionar no es solo el 7B del titular. Son 7000 millones del componente de generación más 8000 millones del codificador de texto. Cuente ambos antes de dar por buena una tarjeta de 24 GB.

Por último, espere pruebas externas antes de comprometerse con una migración. La lista de capacidades es concreta y comprobable hoy. La comparación con los modelos cerrados todavía no lo es.

Fuentes

  1. Qwen/Qwen-Image-2.1 model card - Hugging Face
  2. Alibaba's open-weight Qwen-Image-2.1 claims to beat closed models in image generation with just 7 billion parameters - The Decoder
  3. QwenLM/Qwen-Image-2.1 - GitHub

Artículos relacionados