Skip to content

Qwen-Image-2.1、7Bの重みを研究用ライセンスで公開

Qwen-Image-2.1は70億パラメータとネイティブな透過(トランスペアレンシー)対応をダウンロード可能な画像モデルにまとめた。ただしライセンスは許諾なしの商用利用を禁じている。

著者 Tech AI Wire Team

3 分で読めます

ブラウザーに表示されたQwen/Qwen-Image-2.1のHugging Faceモデルページ。サイドバーにQwen Research Licenseが示されている。

数字で見る

parameters in the image generation component
7B
reference images accepted in one edit
10
maximum native resolution
2048x2048

Alibabaのチームは2026年9月20日にQwen-Image-2.1を公開し、重みをHugging FaceとModelScopeに置いた。誰でもダウンロードできる。ただしライセンスは、その先にできることを制限する。研究用ライセンスであり、Qwenからの個別の許諾なしに商用利用することを禁じている。

「ダウンロードできる」と「製品に使える」の間にあるこの差こそ、開発者が最初に読むべき部分だ。モデルカードはその条件をQwen Research License Agreementと呼んでいる。The Decoderによれば、企業がこれを使って何かを出荷するには、事前にQwenから個別の許諾を得る必要がある。

2つの情報源はこのリリースを異なる言葉で説明しており、その違いは記しておく価値がある。The Decoderはファイルが公開されている点をとらえ、オープンウェイトと呼ぶ。Hugging Faceのモデルカードは、ライセンスをオープンなものではなくプロプライエタリな契約として提示している。どちらも同じリリースを別の角度から述べている。

モデルができること

Qwen-Image-2.1は、テキストからの画像生成と画像編集を1つのモデルで扱う。2つの仕事を別々のチェックポイントに分けない。

目玉となる機能はネイティブな透過だ。このモデルはRGBA画像を直接生成する。つまり透過は出力の一部であり、あとから切り抜くものではない。モデルカードは、これが従来のアルファチャンネルの回避策に取って代わると説明している。

編集では、一度に最大10枚の参照画像を受け付ける。これにより、1つの場面に複数の被写体がいる作業に対応できる。集合写真や商品の構成などだ。編集は、円、塗りによる印、別のマスクを使って特定の範囲に向けられる。

ネイティブ解像度の上限は2048x2048である。モデルカードは7つのアスペクト比を挙げている。1:1、4:3、3:4、3:2、2:3、16:9、9:16だ。

内部の構成

公開されているアーキテクチャの詳細は、ハードウェアを見積もれる程度に具体的だ。

構成要素内容
画像生成70億パラメータ、32層のsingle-stream DiT
テキストエンコーダQwen3-VL 8B
オートエンコーダ64チャンネルのRGBA VAE、16倍の空間圧縮
既定の推論40ステップ
効率化mixed-granularity attention、prefix KV cacheの再利用

DiTとはdiffusion transformerのことで、現在の画像モデルの多くが採る構成だ。The Decoderは、このモデルがRTX 3090のようなコンシューマー向けグラフィックスカードで動くと報じている。

周辺ツールの対応は早かった。モデルカードはDiffusers、ComfyUI、vLLM-Omni、SGLang、LightX2Vを挙げている。実行にはtorch 2.4.0以上、transformers 5.17以上、そしてgitから導入したdiffusersが必要だ。

ベンチマークの主張は慎重に

Qwenは、このモデルがほとんどのクローズドソースのモデルを上回ると述べている。The Decoderは、この結果がQwen自身の独自ベンチマークによるものであり、第三者による検証はまだ出ていないと報じている。

これはその数値が示せる範囲に対する現実的な制約だ。測られる側が作ったベンチマークでは、クローズドな競合と比べてどうかは決められない。Qwenの外部で誰かが再現するまでは、ベンダーの数値として扱うべきだ。

開発者にとっての意味

このモデルに対してコードを書き始める前に、ライセンスを読んでほしい。研究用ライセンスとは、試作はよいが製品は認められない、という意味だ。この区別は、気づくのが遅れやすい。収益が絡む計画なら、作業の出発点はダウンロードではなくQwenへの許諾申請になる。これは追う価値のある流れだ。GLM-5.3も今年、独自ライセンスで重みを公開した。「ダウンロードできる」は、何を作ってよいかの確かな目印ではなくなった。

用途が研究や社内評価であれば、実用的な魅力は透過への対応だ。RGBAを直接生成できると、デザインや素材のパイプラインから背景除去の工程が1つ消える。この工程は、輪郭が粗くなる原因としてよく知られている。サンプルではなく自分の素材で試してほしい。輪郭の品質こそ、こうしたモデルの差が出るところだからだ。

ハードウェアについては、70億という見出しの数字だけでなく、生成部の7Bにテキストエンコーダの8Bを足した規模で見積もるべきだ。24GBのカードで足りると決める前に、両方を勘定に入れてほしい。

最後に、移行を決める前に外部のベンチマークを待ちたい。機能の一覧は今日すぐ確かめられる具体的なものだ。クローズドなモデルとの比較は、まだそうではない。

出典

  1. Qwen/Qwen-Image-2.1 model card - Hugging Face
  2. Alibaba's open-weight Qwen-Image-2.1 claims to beat closed models in image generation with just 7 billion parameters - The Decoder
  3. QwenLM/Qwen-Image-2.1 - GitHub

関連記事