Skip to content
Tech AI Wire

Qwen3.8-Flash-Next は1250億パラメーターを持ち、動かすのは60億だけ

アリババが2026年8月26日に公開。1250億のうちトークンごとに60億を使い、100万入力トークンあたり0.16ドル。Qwen4 のアーキテクチャを先取りする。

著者 Tech AI Wire Team

3 分で読めます

The Hugging Face model page for Qwen3.8-Flash-Next, showing its qwen-community-1.0 licence tag and parameter counts.

数字で見る

parameters active per token, out of 125B
6B
per million input tokens on QwenCloud
$0.16
token context with YaRN extension
1M

アリババの Qwen チームは2026年8月26日、Qwen3.8-Flash-Next を公開した。このモデルは1250億のパラメーターを持つが、任意のトークンに対して使うのはそのうち60億だけである。この比率のおかげで、100万入力トークンあたり0.16ドルで提供できる。推論コストを気にする開発者にとって、そこが要点だ。

今回の公開は、同チームの次のモデル群である Qwen4 の背後にあるアーキテクチャのプレビューでもある。Qwen は完成した製品群を出す前に設計上の変更を公開し、コミュニティが先に精査できるようにしている。

実行コストが安く保たれる仕組み

Qwen3.8-Flash-Next は Mixture-of-Experts モデルである。ネットワークが多数の専門区画に分かれており、ルーターがトークンごとに小さな部分集合を選ぶ。残りの重みは使われないままだ。したがってメモリーの負担は大きく、計算の負担は小さくなる。

チェックポイント全体は、見出しの数字が示すよりも大きい。MarkTechPost はその内訳を、1250億のバックボーン、510億の N-gram 埋め込みテーブル、40億のマルチトークン予測モジュールとし、ディスク上では約1800億パラメーターになると説明する。

Qwen チーム自身のリポジトリによれば、今回の公開を支える設計変更は四つある。

変更点内容
Gated DeltaNet + Qwen Sparse Attention4層のうち3層が Gated DeltaNet、4層目が疎な注意機構
Gated Residual層と層のあいだの信号の渡し方を変える
N-gram 埋め込み2000万エントリーの参照表で、容量を安価に増やす
Muon オプティマイザー改良された訓練用オプティマイザー

コンテキスト長はネイティブで262,144トークン。DataCamp と MarkTechPost はいずれも、YaRN を使えば約100万トークンまで伸ばせると伝えている。YaRN は、訓練した長さを超えてモデルを拡張する手法だ。

Qwen はまた、訓練コストが前世代の Qwen3.7-Plus のおよそ9分の1だったとしている。この数字は Qwen の自己申告であり、第三者による検証はない。

ベンチマークが示すもの、そして誰が測ったか

以下の数値はすべてアリババ自身による報告である。独立した研究機関による確認は取れていない。

ベンチマークQwen3.8-Flash-NextClaude Opus 4.6 Max
SWE-bench Pro62.553.4
LiveCodeBench v691.9記載なし
AndroidWorld84.5記載なし
MathVision95.7記載なし
推論35.940.0

個々の数字より、傾向のほうが役に立つ。このモデルはコーディングとエージェント作業で先行し、最先端の推論では後れを取る。MarkTechPost は推論で35.9対40.0と記録している。Qwen の公式文書自体も限界を挙げている。長いエージェントの連鎖では脆くなり、知識集約型の評価では見劣りする、というものだ。

このライセンスは、ふつうの「オープンウェイト」とは違う

重みは Hugging Face と ModelScope からダウンロードできる。FP8 のチェックポイントは172.78 GiB、BF16 版は335.28 GiB ある。ノートパソコン向けではなく、サーバー級のダウンロードだ。

利用条件は注意深く読む価値がある。MarkTechPost によれば、今回の公開は qwen-community-1.0 ライセンスを使っており、商用利用の前に認証手続きが必要になる。ダウンロードすればそのまま出荷できる Apache 2.0 や MIT とは、意味のある隔たりがある。ここでの「オープンウェイト」は、検査して実行してよいという意味であって、断りなく商用展開してよいという意味ではない。

これが開発者にとって意味すること

総数ではなく、アクティブなパラメーター数で見積もること。トークンごとに60億が動く1250億のモデルは、遅延とコストでは小さなモデルのように、メモリーでは大きなモデルのようにふるまう。ハードウェアを見積もるなら、チェックポイントの大きさが GPU の台数を、アクティブな数がスループットを決める。

これを土台にする前にライセンスを読むこと。qwen-community-1.0 の認証手続きが自社製品に当てはまるかを確かめ、統合コードを書いた後ではなく前に答えを出しておく。遅れて気づくと、ここがいちばん高くつく。

ベンチマーク表を額面どおりに受け取らないこと。ベンダー自身による評価は有利な課題を選ぶ。ここでの正直な読み方は、コードに強く推論に弱いモデル、というものだ。自分の課題で、とりわけ Qwen 自身が脆さを認める長いエージェントの連鎖で試してほしい。

戦略的な要点は価格圧力である。入力100万トークンあたり0.16ドル、出力0.47ドルという水準は、この種のオープンウェイト MoE が引く下限であり、ホスト型の最先端モデルはそれに答えねばならない。最終的にどのモデルを選ぶにせよ、推論費用を払う人すべてにとって good なことだ。

出典

  1. Qwen3.8-Flash-Next - GitHub - QwenLM
  2. Alibaba's Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture - MarkTechPost
  3. Qwen3.8-Flash-Next: Features, Benchmarks, and Pricing - DataCamp

関連記事