Skip to content

Qwen-Image-2.1 liefert 7B-Gewichte unter Forschungslizenz

Qwen-Image-2.1 packt 7 Milliarden Parameter und native Transparenz in ein herunterladbares Bildmodell. Die Lizenz untersagt kommerzielle Nutzung ohne Erlaubnis.

Von Tech AI Wire Team

3 Min. Lesezeit

XLinkedIn
A browser window showing a Hugging Face model page for Qwen/Qwen-Image-2.1, with the Qwen Research License listed in the sidebar.

Die Zahlen

parameters in the image generation component
7B
reference images accepted in one edit
10
maximum native resolution
2048x2048

Alibabas Qwen-Team veröffentlichte Qwen-Image-2.1 am 20. September 2026 und stellte die Gewichte auf Hugging Face und ModelScope bereit. Herunterladen darf sie jeder. Die Lizenz schrÀnkt jedoch ein, was danach erlaubt ist: Es ist eine Forschungslizenz, die kommerzielle Nutzung ohne gesonderte Erlaubnis von Qwen untersagt.

Diese LĂŒcke zwischen "herunterladbar" und "im Produkt nutzbar" ist der Teil, den Entwickler zuerst lesen sollten. Die Modellkarte nennt die Bedingungen Qwen Research License Agreement. The Decoder berichtet, dass Unternehmen eine gesonderte Erlaubnis von Qwen einholen mĂŒssen, bevor sie etwas darauf Aufbauendes ausliefern.

Die beiden Quellen beschreiben die Veröffentlichung unterschiedlich, und der Unterschied ist erwÀhnenswert. The Decoder nennt das Modell open-weight, weil die Dateien öffentlich sind. Die Hugging-Face-Modellkarte stellt die Lizenz als proprietÀre Vereinbarung dar, nicht als offene. Beide beschreiben dieselbe Veröffentlichung aus verschiedenen Blickwinkeln.

Was das Modell kann

Qwen-Image-2.1 erledigt Text-zu-Bild-Erzeugung und Bildbearbeitung in einem einzigen Modell, statt beide Aufgaben auf getrennte Checkpoints zu verteilen.

Die auffĂ€lligste FĂ€higkeit ist native Transparenz. Das Modell erzeugt RGBA-Bilder direkt. Die Transparenz ist also Teil der Ausgabe und nicht etwas, das man hinterher freistellt. Die Modellkarte beschreibt dies als Ersatz fĂŒr frĂŒhere Behelfslösungen mit dem Alphakanal.

Zum Bearbeiten nimmt es bis zu 10 Referenzbilder gleichzeitig an. Das unterstĂŒtzt Arbeiten mit mehreren Motiven in einer Szene, etwa GruppenportrĂ€ts oder Produktkompositionen. Bearbeitungen lassen sich mit Kreisen, gemalten Markierungen oder separaten Masken auf einen Bereich richten.

Die native Auflösung endet bei 2048x2048. Die Modellkarte nennt sieben SeitenverhÀltnisse: 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 und 9:16.

Was darin steckt

Die veröffentlichten Architekturdetails sind konkret genug, um Hardware danach zu planen.

KomponenteDetail
Bilderzeugung7 Milliarden Parameter, 32-lagiger Single-Stream-DiT
Text-EncoderQwen3-VL 8B
Autoencoder64-Kanal-RGBA-VAE, 16-fache rÀumliche Kompression
Standard-Inferenz40 Schritte
EffizienzMixed-Granularity-Attention, Wiederverwendung des Prefix-KV-Cache

Ein DiT ist ein Diffusion Transformer, die Architektur hinter den meisten aktuellen Bildmodellen. The Decoder berichtet, das Modell laufe auf Consumer-Grafikkarten wie der RTX 3090.

Die UnterstĂŒtzung in gĂ€ngigen Werkzeugen kam schnell. Die Modellkarte nennt Diffusers, ComfyUI, vLLM-Omni, SGLang und LightX2V. Zum Betrieb braucht es torch ab 2.4.0, transformers ab 5.17 und ein aus git installiertes diffusers.

Die Benchmark-Angabe braucht Vorsicht

Qwen erklĂ€rt, das Modell schlage die meisten Closed-Source-Modelle. The Decoder berichtet, dieses Ergebnis stamme aus Qwens eigenem proprietĂ€rem Benchmark und eine unabhĂ€ngige PrĂŒfung stehe noch aus.

Das begrenzt, was die Zahl belegt. Ein Benchmark, den das gemessene Team selbst gebaut hat, kann den Vergleich mit geschlossenen Konkurrenten nicht entscheiden. Behandeln Sie die Angabe als Herstellerzahl, bis sie jemand außerhalb von Qwen reproduziert.

Was das fĂŒr Entwickler bedeutet

Lesen Sie die Lizenz, bevor Sie Code gegen dieses Modell schreiben. Eine Forschungslizenz heißt: Ein Prototyp ist in Ordnung, ein Produkt nicht. Dieser Unterschied fĂ€llt leicht zu spĂ€t auf. Geht es um Umsatz, beginnt die Arbeit mit einer Anfrage bei Qwen, nicht mit einem Download. Das wird zu einem Muster, das man verfolgen sollte. GLM-5.3 lieferte seine Gewichte ebenfalls unter einer eigenen Lizenz aus. "Du kannst es herunterladen" ist kein verlĂ€ssliches Signal mehr dafĂŒr, was man bauen darf.

FĂŒr Forschung oder interne Bewertung ist die TransparenzunterstĂŒtzung der praktische Reiz. RGBA direkt zu erzeugen spart einen Freistellungsschritt in Design- und Asset-Pipelines. Genau dieser Schritt erzeugt hĂ€ufig ausgefranste Kanten. Testen Sie es mit eigenen Motiven statt mit den Beispielen, denn bei der KantenqualitĂ€t unterscheiden sich diese Modelle am deutlichsten.

Bei der Hardware ist nicht die 7B-Schlagzeile allein die maßgebliche Zahl, sondern 7B Bildteil plus 8B Text-Encoder. Rechnen Sie beides ein, bevor Sie eine 24-GB-Karte fĂŒr ausreichend halten.

Warten Sie schließlich externe Benchmarks ab, bevor Sie sich auf eine Migration festlegen. Die Liste der FĂ€higkeiten ist konkret und heute ĂŒberprĂŒfbar. Der Vergleich mit geschlossenen Modellen ist es noch nicht.

Quellen

  1. Qwen/Qwen-Image-2.1 model card - Hugging Face
  2. Alibaba's open-weight Qwen-Image-2.1 claims to beat closed models in image generation with just 7 billion parameters - The Decoder
  3. QwenLM/Qwen-Image-2.1 - GitHub

Ähnliche Artikel