Aleph Alpha Kolibri 1: modelo MoE aberto para alemão e inglês
A Aleph Alpha lançou o Kolibri 1 em 3 de outubro: um modelo aberto de 78,1 bilhões de parâmetros, com 3,46 bilhões ativos, feito para alemão e inglês, sob a licença Apache 2.0.
4 min de leitura

Em números
- total parameters
- 78.1B
- parameters active per token
- 3.46B
- size of the FP8 weights
- ~78 GB
- Nvidia B200 GPUs used for training
- 768
A empresa alemã de IA Aleph Alpha lançou o Kolibri 1 em 3 de outubro de 2026, um modelo de linguagem de pesos abertos feito para alemão e inglês. Ele tem 78,1 bilhões de parâmetros, mas só 3,46 bilhões trabalham em cada token, o que o mantém rápido para o seu tamanho. Os pesos podem ser baixados de graça e usados comercialmente sob a licença Apache 2.0. A Aleph Alpha o oferece a governos e empresas reguladas que querem rodar IA no próprio hardware em vez de enviar documentos a um fornecedor externo.
O que é o Kolibri 1
O Kolibri é um modelo de mistura de especialistas (MoE). Em vez de uma única rede grande, ele tem muitos "especialistas" menores, e um roteador escolhe alguns deles para cada token. Segundo o cartão do modelo no Hugging Face, ele tem 50 camadas com 384 especialistas cada. Seis especialistas roteados mais um especialista compartilhado cuidam de cada token.
| Especificação | Kolibri 1 |
|---|---|
| Total de parâmetros | 78,1 bilhões |
| Ativos por token | 3,46 bilhões |
| Camadas / especialistas | 50 camadas, 384 especialistas por camada |
| Janela de contexto | Até 1.048.576 tokens |
| Vocabulário | 128.000 tokens |
| Pesos | FP8, cerca de 78 GB |
| Licença | Apache 2.0 |
| Corte de conhecimento | 18 de junho de 2026 |
O número do contexto precisa de uma ressalva. O cartão do modelo indica um contexto nativo de 1.048.576 tokens, cerca de um milhão. A etapa de treinamento mais longa usou 262.144 tokens. O RuntimeWire e o blog tej.as descrevem 262.144 como o contexto nativo, com o milhão completo testado.
Como ele foi treinado
A Aleph Alpha treinou o Kolibri em 768 GPUs Nvidia B200 por 21 dias, usando data centers na Alemanha e na Finlândia, segundo o seu anúncio. O cartão do modelo contabiliza cerca de 23,6 trilhões de tokens de treinamento no total, começando com 20 trilhões no pré-treinamento.
As fontes divergem sobre quanto disso é em alemão. O blog da Aleph Alpha diz 21,3%, cerca de 4,3 trilhões de tokens. O cartão do modelo aponta 23,9% dos dados de pré-treinamento. De qualquer forma, mais de um quinto dos dados de treinamento era em alemão.
Esse foco aparece no tokenizador, a parte que divide o texto em pedaços. O RuntimeWire relata que o Kolibri divide a Lei Fundamental da Alemanha em 35.190 tokens. O tokenizador usado pelo GPT-4o e pelo GPT-5 precisa de 41.482 para o mesmo texto. Menos tokens significam custo menor e mais espaço na janela de contexto.
Como ele pontua
A Aleph Alpha e o blog tej.as listam estes resultados:
| Benchmark | Kolibri 1 | Comparação |
|---|---|---|
| AIME 2025 (inglês) | 96,9% | |
| AIME 2025 (alemão) | 87,5% | Nemotron 3 Nano: 84,4% |
| Geral (alemão) | 70,8% | Qwen3.5 35B-A3B: 69,8% |
| Geral (inglês) | 75,5% | |
| GPQA Diamond (inglês) | 84,3% | |
| HumanEval+ | 92,7% | |
| Contexto longo, 1M de tokens | 63,2% | Nemotron 3 Nano: 57,5% |
A Aleph Alpha também diz que treinou o modelo para admitir lacunas. "O Kolibri é treinado para dizer 'não sei' quando a resposta não está no contexto", escreve a empresa. Segundo o tej.as, o modelo também "raciocina em alemão diante de prompts em alemão".
Para quem ele é
A Aleph Alpha direciona o Kolibri a trabalhos "soberanos e de missão crítica" em setores regulados, como administração pública, aeroespacial e manufatura. O argumento é o controle: um cliente pode rodar o modelo nos próprios servidores sob a lei alemã e europeia. O post do tej.as resume o argumento como "total liberdade de implantação e segurança da propriedade intelectual".
O Kolibri chega em uma semana movimentada para modelos abertos. O Ai2 lançou o AstaBrief 8B, um modelo pequeno para relatórios de pesquisa com citações, em 2 de outubro.
O que isso significa para desenvolvedores
Planeje o hardware pelos 78 GB completos, não pelos 3,46 bilhões de parâmetros ativos. Como diz o tej.as, "só cerca de 3,5 bilhões de parâmetros trabalham em cada token, mas todos os 78 bilhões precisam ficar na memória". O modelo roda rápido depois de carregado. Mas você precisa de mais de 78 GB de memória de acelerador só para os pesos FP8, mais espaço para o contexto.
Se o seu produto atende falantes de alemão, teste o Kolibri contra o seu modelo atual com textos reais em alemão. Só a economia do tokenizador já pode reduzir custos. E as suas notas em alemão superam por pouco as dos dois modelos abertos com que o tej.as o compara. Meça a qualidade das respostas nos seus próprios documentos, não só em benchmarks.
A licença Apache 2.0 facilita a adoção. Você pode fazer fine-tuning, embuti-lo em um produto e rodá-lo totalmente offline. Para equipes do setor público ou da saúde, isso elimina a questão da transferência de dados que trava muitos modelos hospedados.
Trate o contexto de um milhão de tokens com cuidado. A etapa de treinamento mais longa usou 262.144 tokens, e a nota de 63,2% com 1M de tokens mostra que a recuperação cai no comprimento total. Mantenha o material crítico dentro de um quarto de milhão de tokens até testar entradas mais longas na sua própria carga de trabalho.
Fontes
- Kolibri Has Landed: A Sovereign Open-Weight Model - Aleph Alpha
- Aleph-Alpha/Kolibri-1 - Hugging Face
- Aleph Alpha releases German AI model with 78 GB of FP8 weights - RuntimeWire
- Aleph Alpha Kolibri: How the Sovereign German LLM Works - tej.as
Artigos relacionados

Xiaomi lança MiMo-V2.6-Pro com 1 trilhão de parâmetros em pesos abertos sob MIT
O MiMo-V2.6-Pro da Xiaomi tem 1,02 trilhão de parâmetros, 42 bilhões ativos, contexto de 1 milhão de tokens e pesos sob licença MIT, mas precisa de cerca de 680 GB de memória de GPU.

AstaBrief 8B: modelo aberto do Ai2 escreve relatórios com citações
O Ai2 lançou o AstaBrief 8B, um modelo sob Apache 2.0 baseado no Qwen3-8B que escreve relatórios de pesquisa com citações em 51,1 segundos, 3,5 vezes mais rápido que o modo Thinking do Asta.

As decisões tipadas do Laya, explicadas
Um modelo de decisões tipadas preenche perguntas fixas com respostas tipadas e um número de confiança. Os pesos abertos do Laya, 421M, permitem que você mesmo confira isso.