Xiaomi、1兆パラメーターのMiMo-V2.6-ProをMITライセンスのオープンウェイトで公開
Xiaomi(シャオミ)のMiMo-V2.6-Proは、パラメーター数が1.02兆、うちアクティブなものが420億で、100万トークンのコンテキストを持ち、重みはMITライセンスです。ただし、約680GBのGPUメモリーが必要です。
3 分で読めます

数字で見る
- total parameters in MiMo-V2.6-Pro
- 1.02T
- parameters active per token
- 42B
- token context window
- 1M
- GPU memory needed to serve it with vLLM
- 680 GB
Xiaomiは、MiMo-V2.6-ProとMiMo-V2.6-Flashをリリースしました。どちらもAIモデルで、その重みはMITライセンスのもと、誰でもダウンロードできます。Proモデルのパラメーターは1.02兆個です。パラメーターとは、モデルが学習中に身につける内部の値です。DataNorthはリリース日を2026年9月21日としていますが、ForkastとLLM Rumorsは9月22日としています。
オープンウェイトとは、企業が自社のハードウェアでモデルを動かし、自由に変更できることを意味します。ただし、LLM Rumorsが言うように、「オープンウェイト」だからといって、セルフホスティングが簡単になるわけではありません。Proモデルを動かすには、約680GBのGPUメモリーが必要です。
Xiaomiが公開したもの
どちらのモデルも、混合エキスパート(Mixture of Experts)という設計を採用しています。この設計では、モデルの中に、エキスパートと呼ばれる専門のサブネットワークが多数あります。そして、トークンごとにそのうちのごく一部だけを使います。トークンとは、文章の短いかたまりです。そのため、回答1件あたりのコストは、全体の規模から想像されるよりはるかに低く抑えられます。
| MiMo-V2.6-Pro | MiMo-V2.6-Flash | |
|---|---|---|
| 総パラメーター数 | 1.02兆 | 3,090億 |
| トークンあたりのアクティブ数 | 420億 | 150億 |
| 入力100万トークンあたりのAPI価格 | 0.435ドル | 0.14ドル |
| 出力100万トークンあたりのAPI価格 | 0.87ドル | 0.28ドル |
DataNorthによると、どちらのモデルもテキスト、画像、音声、動画を入力として受け取り、テキストを出力します。コンテキストウィンドウは1,048,576トークンです。コンテキストウィンドウとは、モデルが一度に考慮できる文章の量です。重みはHugging Faceで公開されています。モデルはXiaomi AI Studio、XiaomiのMiMo API、OpenRouterでも動きます。
Forkastは、設計についてさらに詳しく伝えています。Forkastによると、ルーターを固定した混合エキスパートで、ハイブリッドアテンションを備え、さらに5層の投機的デコーダーを持っています。投機的デコーダーは、数トークン先までを下書きします。これにより、モデルはより速く文章を生成できます。
ベンチマークのスコア
DataNorthとForkastは、Proモデルについて次の結果を伝えています。
| ベンチマーク | スコア |
|---|---|
| Artificial Analysis Intelligence Index v4.3 | 46.32(Grok 4.7と同点) |
| Terminal Bench 2.1 | 89.9 |
| DeepSWE v1.1 | 71.9 |
| AutomationBench | 53.1 |
| CyberGym | 94.0(Forkastによる) |
Artificial Analysisの指標は、多くのテストを1つのスコアにまとめたものです。そこでGrok 4.7と並んだことで、MITライセンスのモデルが、この尺度ではxAIのモデルと同じ水準に立ったことになります。
一緒に公開された学習キット
ForkastとLLM Rumorsによると、Xiaomiは重みと合わせて、7,000を超える強化学習のタスク環境を公開しました。強化学習は、タスクでよい結果を出したときに報酬を与えることで、モデルを訓練する手法です。これらの環境が、そのタスクにあたります。
Forkastによると、学習フレームワークは完全に非同期で、強化学習の手法であるGRPOをベースにしています。1,568件の学習用プロンプトと、1ステップあたり16回の試行(ロールアウト)を使いました。LLM Rumorsはさらに、Xiaomiがmimoagentというリポジトリーも公開したと伝えています。中身は、エージェント用の構成要素と評価ツールです。
動かすために必要なもの
Proモデルのセルフホスティングは、データセンター規模の仕事です。LLM Rumorsによると、チェックポイントは566GBです。人気の推論サーバーであるvLLMで提供するには、合計で約680GBのGPUメモリーが必要です。同メディアによると、これはおよそNvidia H200なら8基、AMD MI355Xなら4基のアクセラレーターに相当します。別のサーバーであるSGLangを使う構成では、2台のマシンに分散させます。
DataNorthは、Xiaomi自身はハードウェアの目安も速度の数値も示していないと指摘しています。
これが開発者にとって意味すること
自前のGPUではなく、APIから始めましょう。入力100万トークンあたり0.435ドル、出力100万トークンあたり0.87ドルなので、ホスト版のProモデルは安く試せます。ハードウェアについて考える前に、XiaomiのAPIかOpenRouterで、自分たちのタスクを実行してみてください。
大量の処理には、Flashを試しましょう。アクティブなパラメーターが150億で、価格が100万トークンあたり0.14ドルと0.28ドルのFlashは、分類や抽出など、最高の品質よりコストが重要な作業に向いています。
セルフホスティングの予算は、正直に見積もりましょう。H200クラスのGPU 8基は、購入するにもレンタルするにも大きな出費です。セルフホスティングを選ぶのは、データを自社のマシンにとどめる必要がある場合か、処理量が多くてAPIの方がハードウェアより高くつく場合だけにしてください。
ライセンスを法務担当者と確認し、そのうえで使いましょう。MITは最も制限の緩いライセンスの1つです。そのためMiMo-V2.6は、ファインチューニングして商用製品に組み込むのが簡単です。リリースに含まれるライセンスファイルが、想定どおりの内容かを確認してください。
モデルを使わない場合でも、学習環境は活用しましょう。独自のエージェントを作るチームは、7,000を超えるタスク環境と公開されたフレームワークを再利用して、ほかのモデルのテストや学習に使えます。
出典
関連記事

Qwen3.8-Omni-Flash、音声入力の費用を98%削減
Alibabaの新しいomnimodal(オムニモーダル)モデルは、テキスト、画像、音声、動画を100万トークンの文脈で読み、音声入力の価格を98%以上下げます。

AstaBrief 8B:引用付きの研究レポートを書くAi2のオープンモデル
Ai2は、Qwen3-8BをベースにしたApache 2.0ライセンスのモデル、AstaBrief 8B(アスタブリーフ)を公開しました。引用付きの研究レポートを51.1秒で書き、AstaのThinkingモードより3.5倍高速です。

OpenAI、推論抽出キャンペーンをMoonshot AIに関連付け
OpenAIによると、Kimiを開発するMoonshot AI(ムーンショットAI)に関係するユーザーが7月、4,000人を超えるユーザーから16,000件の抽出リクエストを送り、OpenAIのモデルの隠された推論をコピーしようとしました。