Aller au contenu

Aleph Alpha Kolibri 1 : un modèle MoE ouvert allemand-anglais

Aleph Alpha a publié Kolibri 1 le 3 octobre : un modèle ouvert de 78,1 milliards de paramètres, dont 3,46 milliards actifs, conçu pour l'allemand et l'anglais, sous licence Apache 2.0.

Par Tech AI Wire Team

4 min de lecture

XLinkedIn
Screenshot of the Aleph-Alpha/Kolibri-1 model page on Hugging Face, showing its tags, Apache 2.0 license and 78B parameter count.

En chiffres

total parameters
78.1B
parameters active per token
3.46B
size of the FP8 weights
~78 GB
Nvidia B200 GPUs used for training
768

L'entreprise allemande d'IA Aleph Alpha a publié Kolibri 1 le 3 octobre 2026, un modèle de langage à poids ouverts conçu pour l'allemand et l'anglais. Il compte 78,1 milliards de paramètres, mais seuls 3,46 milliards travaillent sur chaque jeton, ce qui le garde rapide pour sa taille. Les poids peuvent être téléchargés et utilisés commercialement gratuitement, sous licence Apache 2.0. Aleph Alpha le destine aux gouvernements et aux entreprises réglementées qui veulent faire tourner l'IA sur leur propre matériel plutôt que d'envoyer leurs documents à un fournisseur externe.

Ce qu'est Kolibri 1

Kolibri est un modèle à mélange d'experts (MoE). Au lieu d'un seul grand réseau, il compte de nombreux « experts » plus petits, et un routeur en choisit quelques-uns pour chaque jeton. Selon la fiche du modèle sur Hugging Face, il comporte 50 couches de 384 experts chacune. Six experts routés et un expert partagé traitent chaque jeton.

CaractéristiqueKolibri 1
Paramètres au total78,1 milliards
Actifs par jeton3,46 milliards
Couches / experts50 couches, 384 experts par couche
Fenêtre de contexteJusqu'à 1 048 576 jetons
Vocabulaire128 000 jetons
PoidsFP8, environ 78 Go
LicenceApache 2.0
Date limite des connaissances18 juin 2026

Le chiffre du contexte mérite une précision. La fiche du modèle indique un contexte natif de 1 048 576 jetons, soit environ un million. Sa plus longue phase d'entraînement a utilisé 262 144 jetons. RuntimeWire et le blog tej.as décrivent 262 144 comme le contexte natif, le million complet ayant été testé.

Comment il a été entraîné

Aleph Alpha a entraîné Kolibri sur 768 GPU Nvidia B200 pendant 21 jours, dans des centres de données en Allemagne et en Finlande, selon son annonce. La fiche du modèle compte environ 23 600 milliards de jetons d'entraînement au total, à commencer par 20 000 milliards en pré-entraînement.

Les sources divergent sur la part d'allemand. Le blog d'Aleph Alpha indique 21,3 %, soit environ 4 300 milliards de jetons. La fiche du modèle donne 23,9 % des données de pré-entraînement. Dans les deux cas, plus d'un cinquième des données d'entraînement était en allemand.

Cette orientation se voit dans le tokeniseur, la partie qui découpe le texte en morceaux. RuntimeWire rapporte que Kolibri découpe la Loi fondamentale allemande en 35 190 jetons. Le tokeniseur utilisé par GPT-4o et GPT-5 en a besoin de 41 482 pour le même texte. Moins de jetons signifie un coût plus bas et plus de place dans la fenêtre de contexte.

Ses scores

Aleph Alpha et le blog tej.as indiquent ces résultats :

BenchmarkKolibri 1Comparaison
AIME 2025 (anglais)96,9 %
AIME 2025 (allemand)87,5 %Nemotron 3 Nano : 84,4 %
Global (allemand)70,8 %Qwen3.5 35B-A3B : 69,8 %
Global (anglais)75,5 %
GPQA Diamond (anglais)84,3 %
HumanEval+92,7 %
Contexte long, 1M de jetons63,2 %Nemotron 3 Nano : 57,5 %

Aleph Alpha dit aussi avoir entraîné le modèle à reconnaître ses lacunes. « Kolibri est entraîné à dire “je ne sais pas” quand la réponse ne figure pas dans le contexte », écrit l'entreprise. Selon tej.as, le modèle sait aussi « raisonner en allemand sur les requêtes en allemand ».

À qui il s'adresse

Aleph Alpha destine Kolibri aux travaux « souverains et critiques » dans les secteurs réglementés, comme l'administration publique, l'aérospatiale et l'industrie. L'argument, c'est le contrôle : un client peut faire tourner le modèle sur ses propres serveurs, sous le droit allemand et européen. Le billet de tej.as résume l'argument ainsi : « une liberté totale de déploiement et la sécurité de la propriété intellectuelle ».

Kolibri arrive pendant une semaine chargée pour les modèles ouverts. Ai2 a publié AstaBrief 8B, un petit modèle pour des rapports de recherche avec citations, le 2 octobre.

Ce que cela signifie pour les développeurs

Prévoyez votre matériel pour les 78 Go complets, pas pour les 3,46 milliards de paramètres actifs. Comme le dit tej.as, « seuls environ 3,5 milliards de paramètres travaillent sur chaque jeton, mais les 78 milliards doivent tous tenir en mémoire ». Le modèle tourne vite une fois chargé. Mais il vous faut plus de 78 Go de mémoire d'accélérateur rien que pour les poids FP8, plus de la place pour le contexte.

Si votre produit sert des germanophones, testez Kolibri face à votre modèle actuel sur de vrais textes allemands. Les économies du tokeniseur peuvent à elles seules réduire les coûts. Ses scores en allemand dépassent aussi de peu ceux des deux modèles ouverts auxquels tej.as le compare. Mesurez la qualité des réponses sur vos propres documents, pas seulement sur des benchmarks.

La licence Apache 2.0 facilite l'adoption. Vous pouvez l'affiner, l'intégrer dans un produit et le faire tourner entièrement hors ligne. Pour les équipes du secteur public ou de la santé, cela supprime la question du transfert de données qui bloque de nombreux modèles hébergés.

Traitez le contexte d'un million de jetons avec prudence. La plus longue phase d'entraînement a utilisé 262 144 jetons, et le score de 63,2 % à 1M de jetons montre que le rappel baisse à pleine longueur. Gardez les documents critiques sous le quart de million de jetons tant que vous n'avez pas testé des entrées plus longues sur votre propre charge de travail.

Sources

  1. Kolibri Has Landed: A Sovereign Open-Weight Model - Aleph Alpha
  2. Aleph-Alpha/Kolibri-1 - Hugging Face
  3. Aleph Alpha releases German AI model with 78 GB of FP8 weights - RuntimeWire
  4. Aleph Alpha Kolibri: How the Sovereign German LLM Works - tej.as

Articles liés

An NVIDIA Tesla T4 graphics card standing upright on a plain gray studio backdrop, the class of hardware Laya's latency was measured on.
IA & LLM

Les décisions typées de Laya, expliquées

Un modèle à décisions typées remplit des questions fixes avec des réponses typées et un indice de confiance. Les poids ouverts de Laya, 421M, permettent de vérifier cela soi-même.