Aleph Alpha Kolibri 1:ドイツ語と英語向けのオープンなMoEモデル
Aleph Alphaは10月3日、Kolibri(コリブリ)1を公開しました。総パラメータ数781億、うちアクティブは34億6000万のオープンモデルで、ドイツ語と英語向けに作られ、Apache 2.0ライセンスで提供されます。
4 分で読めます

数字で見る
- total parameters
- 78.1B
- parameters active per token
- 3.46B
- size of the FP8 weights
- ~78 GB
- Nvidia B200 GPUs used for training
- 768
ドイツのAI企業Aleph Alphaは2026年10月3日、Kolibri 1を公開しました。ドイツ語と英語向けに作られたオープンウェイトの言語モデルです。パラメータ数は781億ですが、各トークンの処理に使われるのは34億6000万だけです。そのため、規模の割に高速に動きます。重みはApache 2.0ライセンスのもと、無料でダウンロードして商用利用できます。Aleph Alphaはこのモデルを、政府や規制対象の企業に売り込んでいます。文書を外部のプロバイダーに送る代わりに、自前のハードウェアでAIを動かしたい組織です。
Kolibri 1とは
Kolibriは混合エキスパート(MoE)モデルです。1つの大きなネットワークの代わりに、小さな「エキスパート」を多数持っています。ルーターが、トークンごとにその中からいくつかを選びます。Hugging Faceのモデルカードによると、50の層があり、各層に384のエキスパートがあります。すべてのトークンを、ルーティングされる6つのエキスパートと、1つの共有エキスパートが処理します。
| 仕様 | Kolibri 1 |
|---|---|
| 総パラメータ数 | 781億 |
| トークンあたりのアクティブ数 | 34億6000万 |
| 層/エキスパート | 50層、各層384エキスパート |
| コンテキストウィンドウ | 最大1,048,576トークン |
| 語彙 | 128,000トークン |
| 重み | FP8、約78GB |
| ライセンス | Apache 2.0 |
| 知識のカットオフ | 2026年6月18日 |
コンテキストの数字には注意が必要です。モデルカードは、ネイティブのコンテキストを1,048,576トークン、つまり約100万としています。最も長い学習段階で使われたのは262,144トークンです。RuntimeWireとtej.asのブログは、262,144をネイティブとし、100万全体はテスト済みだと説明しています。
学習の方法
同社の発表によると、Aleph AlphaはNvidia B200 GPU 768基でKolibriを21日間学習させました。使ったのは、ドイツとフィンランドのデータセンターです。モデルカードによると、学習トークンは合計で約23.6兆です。最初の事前学習で、そのうち20兆を使っています。
そのうちドイツ語がどれだけを占めるかは、情報源によって異なります。Aleph Alphaのブログは21.3%、約4.3兆トークンとしています。モデルカードは、事前学習データの23.9%としています。いずれにしても、学習データの5分の1以上がドイツ語でした。
その重点は、トークナイザーに表れています。テキストを断片に分割する部分です。RuntimeWireによると、Kolibriはドイツの基本法を35,190トークンに分割します。GPT-4oとGPT-5が使うトークナイザーでは、同じテキストに41,482トークンが必要です。トークンが少なければ、コストが下がり、コンテキストウィンドウの余裕も増えます。
スコア
Aleph Alphaとtej.asのブログは、次の結果を挙げています。
| ベンチマーク | Kolibri 1 | 比較 |
|---|---|---|
| AIME 2025(英語) | 96.9% | |
| AIME 2025(ドイツ語) | 87.5% | Nemotron 3 Nano:84.4% |
| 総合(ドイツ語) | 70.8% | Qwen3.5 35B-A3B:69.8% |
| 総合(英語) | 75.5% | |
| GPQA Diamond(英語) | 84.3% | |
| HumanEval+ | 92.7% | |
| ロングコンテキスト、100万トークン | 63.2% | Nemotron 3 Nano:57.5% |
Aleph Alphaはまた、知らないことを認めるようにモデルを学習させたと述べています。「Kolibriは、答えがコンテキストにないときに『わかりません』と言うよう学習されています」と同社は書いています。tej.asによると、このモデルはさらに「ドイツ語のプロンプトにはドイツ語で推論する」とのことです。
誰のためのモデルか
Aleph Alphaは、規制の厳しい分野での「主権的でミッションクリティカルな」業務をKolibriの対象にしています。たとえば行政、航空宇宙、製造業です。売りは管理権です。顧客は、ドイツと欧州の法律のもとで、自社のサーバー上でモデルを動かせます。tej.asの記事は、この主張を「展開の完全な自由と知的財産の安全」とまとめています。
Kolibriは、オープンモデルにとって慌ただしい週に登場しました。Ai2は10月2日、引用付きの研究レポート向けの小型モデルAstaBrief 8Bを公開しました。
開発者にとっての意味
ハードウェアは、34億6000万のアクティブパラメータではなく、78GB全体を基準に計画してください。tej.asが言うように、「各トークンで働くのは約35億パラメータだけですが、780億すべてをメモリーに置かなければなりません」。読み込んでしまえば、モデルは高速に動きます。ただし、FP8の重みだけで78GBを超えるアクセラレーターのメモリーが必要です。さらに、コンテキスト用の余裕も要ります。
製品がドイツ語の話者を対象にしているなら、実際のドイツ語テキストで、Kolibriを現在のモデルと比べてテストしてください。トークナイザーによる節約だけでも、コストを削減できます。また、ドイツ語のスコアは、tej.asが比較している2つのオープンモデルをわずかに上回っています。ベンチマークだけでなく、自社の文書で回答の品質を測ってください。
Apache 2.0ライセンスなので、導入は簡単です。ファインチューニングも、製品への組み込みも、完全なオフラインでの実行もできます。公共部門や医療分野のチームにとっては、多くのホスト型モデルの妨げになっているデータ転送の問題がなくなります。
100万トークンのコンテキストは慎重に扱ってください。最も長い学習段階で使われたのは262,144トークンです。100万トークンでのスコアが63.2%であることは、最大長では想起の精度が下がることを示しています。自社のワークロードでより長い入力をテストするまでは、重要な資料を25万トークン以内に収めてください。
出典
- Kolibri Has Landed: A Sovereign Open-Weight Model - Aleph Alpha
- Aleph-Alpha/Kolibri-1 - Hugging Face
- Aleph Alpha releases German AI model with 78 GB of FP8 weights - RuntimeWire
- Aleph Alpha Kolibri: How the Sovereign German LLM Works - tej.as
関連記事

Xiaomi、1兆パラメーターのMiMo-V2.6-ProをMITライセンスのオープンウェイトで公開
Xiaomi(シャオミ)のMiMo-V2.6-Proは、パラメーター数が1.02兆、うちアクティブなものが420億で、100万トークンのコンテキストを持ち、重みはMITライセンスです。ただし、約680GBのGPUメモリーが必要です。

AstaBrief 8B:引用付きの研究レポートを書くAi2のオープンモデル
Ai2は、Qwen3-8BをベースにしたApache 2.0ライセンスのモデル、AstaBrief 8B(アスタブリーフ)を公開しました。引用付きの研究レポートを51.1秒で書き、AstaのThinkingモードより3.5倍高速です。
