Qwen-Image-2.1、7Bの重みを研究用ライセンスで公開
Qwen-Image-2.1は70億パラメータとネイティブな透過(トランスペアレンシー)対応をダウンロード可能な画像モデルにまとめた。ただしライセンスは許諾なしの商用利用を禁じている。
3 分で読めます

数字で見る
- parameters in the image generation component
- 7B
- reference images accepted in one edit
- 10
- maximum native resolution
- 2048x2048
Alibabaのチームは2026年9月20日にQwen-Image-2.1を公開し、重みをHugging FaceとModelScopeに置いた。誰でもダウンロードできる。ただしライセンスは、その先にできることを制限する。研究用ライセンスであり、Qwenからの個別の許諾なしに商用利用することを禁じている。
「ダウンロードできる」と「製品に使える」の間にあるこの差こそ、開発者が最初に読むべき部分だ。モデルカードはその条件をQwen Research License Agreementと呼んでいる。The Decoderによれば、企業がこれを使って何かを出荷するには、事前にQwenから個別の許諾を得る必要がある。
2つの情報源はこのリリースを異なる言葉で説明しており、その違いは記しておく価値がある。The Decoderはファイルが公開されている点をとらえ、オープンウェイトと呼ぶ。Hugging Faceのモデルカードは、ライセンスをオープンなものではなくプロプライエタリな契約として提示している。どちらも同じリリースを別の角度から述べている。
モデルができること
Qwen-Image-2.1は、テキストからの画像生成と画像編集を1つのモデルで扱う。2つの仕事を別々のチェックポイントに分けない。
目玉となる機能はネイティブな透過だ。このモデルはRGBA画像を直接生成する。つまり透過は出力の一部であり、あとから切り抜くものではない。モデルカードは、これが従来のアルファチャンネルの回避策に取って代わると説明している。
編集では、一度に最大10枚の参照画像を受け付ける。これにより、1つの場面に複数の被写体がいる作業に対応できる。集合写真や商品の構成などだ。編集は、円、塗りによる印、別のマスクを使って特定の範囲に向けられる。
ネイティブ解像度の上限は2048x2048である。モデルカードは7つのアスペクト比を挙げている。1:1、4:3、3:4、3:2、2:3、16:9、9:16だ。
内部の構成
公開されているアーキテクチャの詳細は、ハードウェアを見積もれる程度に具体的だ。
| 構成要素 | 内容 |
|---|---|
| 画像生成 | 70億パラメータ、32層のsingle-stream DiT |
| テキストエンコーダ | Qwen3-VL 8B |
| オートエンコーダ | 64チャンネルのRGBA VAE、16倍の空間圧縮 |
| 既定の推論 | 40ステップ |
| 効率化 | mixed-granularity attention、prefix KV cacheの再利用 |
DiTとはdiffusion transformerのことで、現在の画像モデルの多くが採る構成だ。The Decoderは、このモデルがRTX 3090のようなコンシューマー向けグラフィックスカードで動くと報じている。
周辺ツールの対応は早かった。モデルカードはDiffusers、ComfyUI、vLLM-Omni、SGLang、LightX2Vを挙げている。実行にはtorch 2.4.0以上、transformers 5.17以上、そしてgitから導入したdiffusersが必要だ。
ベンチマークの主張は慎重に
Qwenは、このモデルがほとんどのクローズドソースのモデルを上回ると述べている。The Decoderは、この結果がQwen自身の独自ベンチマークによるものであり、第三者による検証はまだ出ていないと報じている。
これはその数値が示せる範囲に対する現実的な制約だ。測られる側が作ったベンチマークでは、クローズドな競合と比べてどうかは決められない。Qwenの外部で誰かが再現するまでは、ベンダーの数値として扱うべきだ。
開発者にとっての意味
このモデルに対してコードを書き始める前に、ライセンスを読んでほしい。研究用ライセンスとは、試作はよいが製品は認められない、という意味だ。この区別は、気づくのが遅れやすい。収益が絡む計画なら、作業の出発点はダウンロードではなくQwenへの許諾申請になる。これは追う価値のある流れだ。GLM-5.3も今年、独自ライセンスで重みを公開した。「ダウンロードできる」は、何を作ってよいかの確かな目印ではなくなった。
用途が研究や社内評価であれば、実用的な魅力は透過への対応だ。RGBAを直接生成できると、デザインや素材のパイプラインから背景除去の工程が1つ消える。この工程は、輪郭が粗くなる原因としてよく知られている。サンプルではなく自分の素材で試してほしい。輪郭の品質こそ、こうしたモデルの差が出るところだからだ。
ハードウェアについては、70億という見出しの数字だけでなく、生成部の7Bにテキストエンコーダの8Bを足した規模で見積もるべきだ。24GBのカードで足りると決める前に、両方を勘定に入れてほしい。
最後に、移行を決める前に外部のベンチマークを待ちたい。機能の一覧は今日すぐ確かめられる具体的なものだ。クローズドなモデルとの比較は、まだそうではない。
出典
関連記事

GLM-5.3の重みは独自ライセンスで公開、動かすにはGPU8枚が必要
Z.aiの旗艦モデルGLM-5.3の重みが、安全性審査による遅れの後にHugging Faceで公開された。ライセンスはMITではなく、動作には高性能GPUが最低8枚必要だ。

LayaはJevに対する4億2100万パラメータの公開モデル
Layaは4億2100万パラメータでApache 2.0のもと、32.8ミリ秒で型付きの判断を返す。ただし追加学習なしの正解率は偶然に近い。

Salesforce Koa、開いた重みの上に閉じた製品
Salesforceは自社のCRM Benchで誤りが3分の1になるとしていますが、重みは非公開で、モデルはSalesforceの基盤の中でしか動きません。