本文へスキップ

Aleph Alpha Kolibri 1:ドイツ語と英語向けのオープンなMoEモデル

Aleph Alphaは10月3日、Kolibri(コリブリ)1を公開しました。総パラメータ数781億、うちアクティブは34億6000万のオープンモデルで、ドイツ語と英語向けに作られ、Apache 2.0ライセンスで提供されます。

著者 Tech AI Wire Team

4 分で読めます

Hugging Face上のAleph-Alpha/Kolibri-1のモデルページのスクリーンショット。タグ、Apache 2.0ライセンス、78Bというパラメータ数が表示されています。

数字で見る

total parameters
78.1B
parameters active per token
3.46B
size of the FP8 weights
~78 GB
Nvidia B200 GPUs used for training
768

ドイツのAI企業Aleph Alphaは2026年10月3日、Kolibri 1を公開しました。ドイツ語と英語向けに作られたオープンウェイトの言語モデルです。パラメータ数は781億ですが、各トークンの処理に使われるのは34億6000万だけです。そのため、規模の割に高速に動きます。重みはApache 2.0ライセンスのもと、無料でダウンロードして商用利用できます。Aleph Alphaはこのモデルを、政府や規制対象の企業に売り込んでいます。文書を外部のプロバイダーに送る代わりに、自前のハードウェアでAIを動かしたい組織です。

Kolibri 1とは

Kolibriは混合エキスパート(MoE)モデルです。1つの大きなネットワークの代わりに、小さな「エキスパート」を多数持っています。ルーターが、トークンごとにその中からいくつかを選びます。Hugging Faceのモデルカードによると、50の層があり、各層に384のエキスパートがあります。すべてのトークンを、ルーティングされる6つのエキスパートと、1つの共有エキスパートが処理します。

仕様Kolibri 1
総パラメータ数781億
トークンあたりのアクティブ数34億6000万
層/エキスパート50層、各層384エキスパート
コンテキストウィンドウ最大1,048,576トークン
語彙128,000トークン
重みFP8、約78GB
ライセンスApache 2.0
知識のカットオフ2026年6月18日

コンテキストの数字には注意が必要です。モデルカードは、ネイティブのコンテキストを1,048,576トークン、つまり約100万としています。最も長い学習段階で使われたのは262,144トークンです。RuntimeWireとtej.asのブログは、262,144をネイティブとし、100万全体はテスト済みだと説明しています。

学習の方法

同社の発表によると、Aleph AlphaはNvidia B200 GPU 768基でKolibriを21日間学習させました。使ったのは、ドイツとフィンランドのデータセンターです。モデルカードによると、学習トークンは合計で約23.6兆です。最初の事前学習で、そのうち20兆を使っています。

そのうちドイツ語がどれだけを占めるかは、情報源によって異なります。Aleph Alphaのブログは21.3%、約4.3兆トークンとしています。モデルカードは、事前学習データの23.9%としています。いずれにしても、学習データの5分の1以上がドイツ語でした。

その重点は、トークナイザーに表れています。テキストを断片に分割する部分です。RuntimeWireによると、Kolibriはドイツの基本法を35,190トークンに分割します。GPT-4oとGPT-5が使うトークナイザーでは、同じテキストに41,482トークンが必要です。トークンが少なければ、コストが下がり、コンテキストウィンドウの余裕も増えます。

スコア

Aleph Alphaとtej.asのブログは、次の結果を挙げています。

ベンチマークKolibri 1比較
AIME 2025(英語)96.9%
AIME 2025(ドイツ語)87.5%Nemotron 3 Nano:84.4%
総合(ドイツ語)70.8%Qwen3.5 35B-A3B:69.8%
総合(英語)75.5%
GPQA Diamond(英語)84.3%
HumanEval+92.7%
ロングコンテキスト、100万トークン63.2%Nemotron 3 Nano:57.5%

Aleph Alphaはまた、知らないことを認めるようにモデルを学習させたと述べています。「Kolibriは、答えがコンテキストにないときに『わかりません』と言うよう学習されています」と同社は書いています。tej.asによると、このモデルはさらに「ドイツ語のプロンプトにはドイツ語で推論する」とのことです。

誰のためのモデルか

Aleph Alphaは、規制の厳しい分野での「主権的でミッションクリティカルな」業務をKolibriの対象にしています。たとえば行政、航空宇宙、製造業です。売りは管理権です。顧客は、ドイツと欧州の法律のもとで、自社のサーバー上でモデルを動かせます。tej.asの記事は、この主張を「展開の完全な自由と知的財産の安全」とまとめています。

Kolibriは、オープンモデルにとって慌ただしい週に登場しました。Ai2は10月2日、引用付きの研究レポート向けの小型モデルAstaBrief 8Bを公開しました。

開発者にとっての意味

ハードウェアは、34億6000万のアクティブパラメータではなく、78GB全体を基準に計画してください。tej.asが言うように、「各トークンで働くのは約35億パラメータだけですが、780億すべてをメモリーに置かなければなりません」。読み込んでしまえば、モデルは高速に動きます。ただし、FP8の重みだけで78GBを超えるアクセラレーターのメモリーが必要です。さらに、コンテキスト用の余裕も要ります。

製品がドイツ語の話者を対象にしているなら、実際のドイツ語テキストで、Kolibriを現在のモデルと比べてテストしてください。トークナイザーによる節約だけでも、コストを削減できます。また、ドイツ語のスコアは、tej.asが比較している2つのオープンモデルをわずかに上回っています。ベンチマークだけでなく、自社の文書で回答の品質を測ってください。

Apache 2.0ライセンスなので、導入は簡単です。ファインチューニングも、製品への組み込みも、完全なオフラインでの実行もできます。公共部門や医療分野のチームにとっては、多くのホスト型モデルの妨げになっているデータ転送の問題がなくなります。

100万トークンのコンテキストは慎重に扱ってください。最も長い学習段階で使われたのは262,144トークンです。100万トークンでのスコアが63.2%であることは、最大長では想起の精度が下がることを示しています。自社のワークロードでより長い入力をテストするまでは、重要な資料を25万トークン以内に収めてください。

出典

  1. Kolibri Has Landed: A Sovereign Open-Weight Model - Aleph Alpha
  2. Aleph-Alpha/Kolibri-1 - Hugging Face
  3. Aleph Alpha releases German AI model with 78 GB of FP8 weights - RuntimeWire
  4. Aleph Alpha Kolibri: How the Sovereign German LLM Works - tej.as

関連記事

An NVIDIA Tesla T4 graphics card standing upright on a plain gray studio backdrop, the class of hardware Laya's latency was measured on.
AI・LLM

Layaの型付き判断とは何か、解説

型付き判断モデルは、決まった質問に型付きの答えと確信度の数値で答える。Layaの4億2100万パラメータは公開されているので、自分で確かめられる。