Pular para o conteúdo

Aleph Alpha Kolibri 1: modelo MoE aberto para alemão e inglês

A Aleph Alpha lançou o Kolibri 1 em 3 de outubro: um modelo aberto de 78,1 bilhões de parâmetros, com 3,46 bilhões ativos, feito para alemão e inglês, sob a licença Apache 2.0.

Por Tech AI Wire Team

4 min de leitura

XLinkedIn
Screenshot of the Aleph-Alpha/Kolibri-1 model page on Hugging Face, showing its tags, Apache 2.0 license and 78B parameter count.

Em números

total parameters
78.1B
parameters active per token
3.46B
size of the FP8 weights
~78 GB
Nvidia B200 GPUs used for training
768

A empresa alemã de IA Aleph Alpha lançou o Kolibri 1 em 3 de outubro de 2026, um modelo de linguagem de pesos abertos feito para alemão e inglês. Ele tem 78,1 bilhões de parâmetros, mas só 3,46 bilhões trabalham em cada token, o que o mantém rápido para o seu tamanho. Os pesos podem ser baixados de graça e usados comercialmente sob a licença Apache 2.0. A Aleph Alpha o oferece a governos e empresas reguladas que querem rodar IA no próprio hardware em vez de enviar documentos a um fornecedor externo.

O que é o Kolibri 1

O Kolibri é um modelo de mistura de especialistas (MoE). Em vez de uma única rede grande, ele tem muitos "especialistas" menores, e um roteador escolhe alguns deles para cada token. Segundo o cartão do modelo no Hugging Face, ele tem 50 camadas com 384 especialistas cada. Seis especialistas roteados mais um especialista compartilhado cuidam de cada token.

EspecificaçãoKolibri 1
Total de parâmetros78,1 bilhões
Ativos por token3,46 bilhões
Camadas / especialistas50 camadas, 384 especialistas por camada
Janela de contextoAté 1.048.576 tokens
Vocabulário128.000 tokens
PesosFP8, cerca de 78 GB
LicençaApache 2.0
Corte de conhecimento18 de junho de 2026

O número do contexto precisa de uma ressalva. O cartão do modelo indica um contexto nativo de 1.048.576 tokens, cerca de um milhão. A etapa de treinamento mais longa usou 262.144 tokens. O RuntimeWire e o blog tej.as descrevem 262.144 como o contexto nativo, com o milhão completo testado.

Como ele foi treinado

A Aleph Alpha treinou o Kolibri em 768 GPUs Nvidia B200 por 21 dias, usando data centers na Alemanha e na Finlândia, segundo o seu anúncio. O cartão do modelo contabiliza cerca de 23,6 trilhões de tokens de treinamento no total, começando com 20 trilhões no pré-treinamento.

As fontes divergem sobre quanto disso é em alemão. O blog da Aleph Alpha diz 21,3%, cerca de 4,3 trilhões de tokens. O cartão do modelo aponta 23,9% dos dados de pré-treinamento. De qualquer forma, mais de um quinto dos dados de treinamento era em alemão.

Esse foco aparece no tokenizador, a parte que divide o texto em pedaços. O RuntimeWire relata que o Kolibri divide a Lei Fundamental da Alemanha em 35.190 tokens. O tokenizador usado pelo GPT-4o e pelo GPT-5 precisa de 41.482 para o mesmo texto. Menos tokens significam custo menor e mais espaço na janela de contexto.

Como ele pontua

A Aleph Alpha e o blog tej.as listam estes resultados:

BenchmarkKolibri 1Comparação
AIME 2025 (inglês)96,9%
AIME 2025 (alemão)87,5%Nemotron 3 Nano: 84,4%
Geral (alemão)70,8%Qwen3.5 35B-A3B: 69,8%
Geral (inglês)75,5%
GPQA Diamond (inglês)84,3%
HumanEval+92,7%
Contexto longo, 1M de tokens63,2%Nemotron 3 Nano: 57,5%

A Aleph Alpha também diz que treinou o modelo para admitir lacunas. "O Kolibri é treinado para dizer 'não sei' quando a resposta não está no contexto", escreve a empresa. Segundo o tej.as, o modelo também "raciocina em alemão diante de prompts em alemão".

Para quem ele é

A Aleph Alpha direciona o Kolibri a trabalhos "soberanos e de missão crítica" em setores regulados, como administração pública, aeroespacial e manufatura. O argumento é o controle: um cliente pode rodar o modelo nos próprios servidores sob a lei alemã e europeia. O post do tej.as resume o argumento como "total liberdade de implantação e segurança da propriedade intelectual".

O Kolibri chega em uma semana movimentada para modelos abertos. O Ai2 lançou o AstaBrief 8B, um modelo pequeno para relatórios de pesquisa com citações, em 2 de outubro.

O que isso significa para desenvolvedores

Planeje o hardware pelos 78 GB completos, não pelos 3,46 bilhões de parâmetros ativos. Como diz o tej.as, "só cerca de 3,5 bilhões de parâmetros trabalham em cada token, mas todos os 78 bilhões precisam ficar na memória". O modelo roda rápido depois de carregado. Mas você precisa de mais de 78 GB de memória de acelerador só para os pesos FP8, mais espaço para o contexto.

Se o seu produto atende falantes de alemão, teste o Kolibri contra o seu modelo atual com textos reais em alemão. Só a economia do tokenizador já pode reduzir custos. E as suas notas em alemão superam por pouco as dos dois modelos abertos com que o tej.as o compara. Meça a qualidade das respostas nos seus próprios documentos, não só em benchmarks.

A licença Apache 2.0 facilita a adoção. Você pode fazer fine-tuning, embuti-lo em um produto e rodá-lo totalmente offline. Para equipes do setor público ou da saúde, isso elimina a questão da transferência de dados que trava muitos modelos hospedados.

Trate o contexto de um milhão de tokens com cuidado. A etapa de treinamento mais longa usou 262.144 tokens, e a nota de 63,2% com 1M de tokens mostra que a recuperação cai no comprimento total. Mantenha o material crítico dentro de um quarto de milhão de tokens até testar entradas mais longas na sua própria carga de trabalho.

Fontes

  1. Kolibri Has Landed: A Sovereign Open-Weight Model - Aleph Alpha
  2. Aleph-Alpha/Kolibri-1 - Hugging Face
  3. Aleph Alpha releases German AI model with 78 GB of FP8 weights - RuntimeWire
  4. Aleph Alpha Kolibri: How the Sovereign German LLM Works - tej.as

Artigos relacionados

An NVIDIA Tesla T4 graphics card standing upright on a plain gray studio backdrop, the class of hardware Laya's latency was measured on.
IA e LLMs

As decisões tipadas do Laya, explicadas

Um modelo de decisões tipadas preenche perguntas fixas com respostas tipadas e um número de confiança. Os pesos abertos do Laya, 421M, permitem que você mesmo confira isso.