Qwen-Image-2.1 liefert 7B-Gewichte unter Forschungslizenz
Qwen-Image-2.1 packt 7 Milliarden Parameter und native Transparenz in ein herunterladbares Bildmodell. Die Lizenz untersagt kommerzielle Nutzung ohne Erlaubnis.
3 Min. Lesezeit

Die Zahlen
- parameters in the image generation component
- 7B
- reference images accepted in one edit
- 10
- maximum native resolution
- 2048x2048
Alibabas Qwen-Team veröffentlichte Qwen-Image-2.1 am 20. September 2026 und stellte die Gewichte auf Hugging Face und ModelScope bereit. Herunterladen darf sie jeder. Die Lizenz schrÀnkt jedoch ein, was danach erlaubt ist: Es ist eine Forschungslizenz, die kommerzielle Nutzung ohne gesonderte Erlaubnis von Qwen untersagt.
Diese LĂŒcke zwischen "herunterladbar" und "im Produkt nutzbar" ist der Teil, den Entwickler zuerst lesen sollten. Die Modellkarte nennt die Bedingungen Qwen Research License Agreement. The Decoder berichtet, dass Unternehmen eine gesonderte Erlaubnis von Qwen einholen mĂŒssen, bevor sie etwas darauf Aufbauendes ausliefern.
Die beiden Quellen beschreiben die Veröffentlichung unterschiedlich, und der Unterschied ist erwÀhnenswert. The Decoder nennt das Modell open-weight, weil die Dateien öffentlich sind. Die Hugging-Face-Modellkarte stellt die Lizenz als proprietÀre Vereinbarung dar, nicht als offene. Beide beschreiben dieselbe Veröffentlichung aus verschiedenen Blickwinkeln.
Was das Modell kann
Qwen-Image-2.1 erledigt Text-zu-Bild-Erzeugung und Bildbearbeitung in einem einzigen Modell, statt beide Aufgaben auf getrennte Checkpoints zu verteilen.
Die auffĂ€lligste FĂ€higkeit ist native Transparenz. Das Modell erzeugt RGBA-Bilder direkt. Die Transparenz ist also Teil der Ausgabe und nicht etwas, das man hinterher freistellt. Die Modellkarte beschreibt dies als Ersatz fĂŒr frĂŒhere Behelfslösungen mit dem Alphakanal.
Zum Bearbeiten nimmt es bis zu 10 Referenzbilder gleichzeitig an. Das unterstĂŒtzt Arbeiten mit mehreren Motiven in einer Szene, etwa GruppenportrĂ€ts oder Produktkompositionen. Bearbeitungen lassen sich mit Kreisen, gemalten Markierungen oder separaten Masken auf einen Bereich richten.
Die native Auflösung endet bei 2048x2048. Die Modellkarte nennt sieben SeitenverhÀltnisse: 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 und 9:16.
Was darin steckt
Die veröffentlichten Architekturdetails sind konkret genug, um Hardware danach zu planen.
| Komponente | Detail |
|---|---|
| Bilderzeugung | 7 Milliarden Parameter, 32-lagiger Single-Stream-DiT |
| Text-Encoder | Qwen3-VL 8B |
| Autoencoder | 64-Kanal-RGBA-VAE, 16-fache rÀumliche Kompression |
| Standard-Inferenz | 40 Schritte |
| Effizienz | Mixed-Granularity-Attention, Wiederverwendung des Prefix-KV-Cache |
Ein DiT ist ein Diffusion Transformer, die Architektur hinter den meisten aktuellen Bildmodellen. The Decoder berichtet, das Modell laufe auf Consumer-Grafikkarten wie der RTX 3090.
Die UnterstĂŒtzung in gĂ€ngigen Werkzeugen kam schnell. Die Modellkarte nennt Diffusers, ComfyUI, vLLM-Omni, SGLang und LightX2V. Zum Betrieb braucht es torch ab 2.4.0, transformers ab 5.17 und ein aus git installiertes diffusers.
Die Benchmark-Angabe braucht Vorsicht
Qwen erklĂ€rt, das Modell schlage die meisten Closed-Source-Modelle. The Decoder berichtet, dieses Ergebnis stamme aus Qwens eigenem proprietĂ€rem Benchmark und eine unabhĂ€ngige PrĂŒfung stehe noch aus.
Das begrenzt, was die Zahl belegt. Ein Benchmark, den das gemessene Team selbst gebaut hat, kann den Vergleich mit geschlossenen Konkurrenten nicht entscheiden. Behandeln Sie die Angabe als Herstellerzahl, bis sie jemand auĂerhalb von Qwen reproduziert.
Was das fĂŒr Entwickler bedeutet
Lesen Sie die Lizenz, bevor Sie Code gegen dieses Modell schreiben. Eine Forschungslizenz heiĂt: Ein Prototyp ist in Ordnung, ein Produkt nicht. Dieser Unterschied fĂ€llt leicht zu spĂ€t auf. Geht es um Umsatz, beginnt die Arbeit mit einer Anfrage bei Qwen, nicht mit einem Download. Das wird zu einem Muster, das man verfolgen sollte. GLM-5.3 lieferte seine Gewichte ebenfalls unter einer eigenen Lizenz aus. "Du kannst es herunterladen" ist kein verlĂ€ssliches Signal mehr dafĂŒr, was man bauen darf.
FĂŒr Forschung oder interne Bewertung ist die TransparenzunterstĂŒtzung der praktische Reiz. RGBA direkt zu erzeugen spart einen Freistellungsschritt in Design- und Asset-Pipelines. Genau dieser Schritt erzeugt hĂ€ufig ausgefranste Kanten. Testen Sie es mit eigenen Motiven statt mit den Beispielen, denn bei der KantenqualitĂ€t unterscheiden sich diese Modelle am deutlichsten.
Bei der Hardware ist nicht die 7B-Schlagzeile allein die maĂgebliche Zahl, sondern 7B Bildteil plus 8B Text-Encoder. Rechnen Sie beides ein, bevor Sie eine 24-GB-Karte fĂŒr ausreichend halten.
Warten Sie schlieĂlich externe Benchmarks ab, bevor Sie sich auf eine Migration festlegen. Die Liste der FĂ€higkeiten ist konkret und heute ĂŒberprĂŒfbar. Der Vergleich mit geschlossenen Modellen ist es noch nicht.
Quellen
Ăhnliche Artikel

GLM-5.3-Gewichte kommen mit eigener Lizenz und brauchen acht GPUs
Die Gewichte des Spitzenmodells GLM-5.3 von Z.ai liegen nach einer Verzögerung durch die SicherheitsprĂŒfung auf Hugging Face. Die Lizenz ist nicht MIT, und das Modell braucht mindestens acht Hochleistungs-GPUs.

Laya ist eine offene Antwort auf Jev mit 421M Parametern
Laya liefert typisierte Entscheidungen in 32,8 Millisekunden aus 421 Millionen Parametern unter Apache 2.0. Ohne Feinabstimmung liegt die Trefferquote nahe am Zufall.

Salesforce Koa baut auf offenen Gewichten, liefert aber geschlossen
Salesforce sagt, Koa mache auf dem eigenen CRM Bench dreimal weniger Fehler, doch die Gewichte sind proprietÀr und das Modell lÀuft nur auf Salesforce-Infrastruktur.