Pular para o conteúdo

Xiaomi lança MiMo-V2.6-Pro com 1 trilhão de parâmetros em pesos abertos sob MIT

O MiMo-V2.6-Pro da Xiaomi tem 1,02 trilhão de parâmetros, 42 bilhões ativos, contexto de 1 milhão de tokens e pesos sob licença MIT, mas precisa de cerca de 680 GB de memória de GPU.

Por Tech AI Wire Team

3 min de leitura

XLinkedIn
Screenshot of Xiaomi MiMo's Hugging Face organization page, listing its MiMo-V2.6 model collection.

Em números

total parameters in MiMo-V2.6-Pro
1.02T
parameters active per token
42B
token context window
1M
GPU memory needed to serve it with vLLM
680 GB

A Xiaomi lançou o MiMo-V2.6-Pro e o MiMo-V2.6-Flash, dois modelos de IA cujos pesos qualquer pessoa pode baixar sob a licença MIT. O modelo Pro tem 1,02 trilhão de parâmetros, os valores internos que um modelo aprende durante o treinamento. O DataNorth data o lançamento de 21 de setembro de 2026, enquanto o Forkast e o LLM Rumors indicam 22 de setembro.

Pesos abertos significam que uma empresa pode rodar o modelo no próprio hardware e modificá-lo livremente. O problema, como diz o LLM Rumors, é que "pesos abertos" não significa auto-hospedagem simples. Rodar o modelo Pro exige cerca de 680 GB de memória de GPU.

O que a Xiaomi lançou

Os dois modelos usam um design de mistura de especialistas (mixture of experts). Nesse design, o modelo tem muitas sub-redes especializadas, chamadas especialistas, e usa só algumas delas para cada token, um pedaço curto de texto. Isso mantém o custo de cada resposta bem abaixo do que o tamanho total sugere.

MiMo-V2.6-ProMiMo-V2.6-Flash
Total de parâmetros1,02 trilhão309 bilhões
Ativos por token42 bilhões15 bilhões
Preço da API por milhão de tokens de entradaUS$ 0,435US$ 0,14
Preço da API por milhão de tokens de saídaUS$ 0,87US$ 0,28

O DataNorth informa que os dois modelos aceitam texto, imagens, áudio e vídeo como entrada e geram texto como saída. A janela de contexto, a quantidade de texto que um modelo consegue considerar de uma vez, é de 1.048.576 tokens. Os pesos estão no Hugging Face, e os modelos também rodam no Xiaomi AI Studio, na MiMo API da Xiaomi e no OpenRouter.

O Forkast traz mais detalhes sobre o design. O site descreve uma mistura de especialistas com roteador congelado e atenção híbrida, além de um decodificador especulativo de cinco camadas. Um decodificador especulativo rascunha vários tokens à frente, para que o modelo produza texto mais rápido.

Como ele pontua

O DataNorth e o Forkast relatam estes resultados para o modelo Pro:

BenchmarkPontuação
Artificial Analysis Intelligence Index v4.346,32, empatado com o Grok 4.7
Terminal Bench 2.189,9
DeepSWE v1.171,9
AutomationBench53,1
CyberGym94,0, segundo o Forkast

O índice da Artificial Analysis combina muitos testes em uma única pontuação. Empatar com o Grok 4.7 ali coloca um modelo com licença MIT no mesmo nível do modelo da xAI nessa medida.

O kit de treinamento que veio junto

A Xiaomi lançou mais de 7.000 ambientes de tarefas de aprendizado por reforço junto com os pesos, segundo o Forkast e o LLM Rumors. O aprendizado por reforço treina um modelo recompensando bons resultados em tarefas. Esses ambientes são as tarefas.

O Forkast descreve o framework de treinamento como totalmente assíncrono e baseado em GRPO, um método de aprendizado por reforço. Ele usou 1.568 prompts de treinamento e 16 tentativas, ou rollouts, por passo. O LLM Rumors acrescenta que a Xiaomi também publicou um repositório mimoagent com blocos de construção para agentes e ferramentas de avaliação.

O que é preciso para rodar

Auto-hospedar o modelo Pro é trabalho de data center. O LLM Rumors relata um checkpoint de 566 GB. Servi-lo com o vLLM, um servidor de inferência popular, exige cerca de 680 GB de memória de GPU no total. Isso equivale a mais ou menos oito aceleradores Nvidia H200 ou quatro AMD MI355X, segundo o site. Configurações com o SGLang, outro servidor, distribuem o modelo entre duas máquinas.

O DataNorth observa que a Xiaomi não dá nenhuma orientação própria de hardware nem números de velocidade.

O que isso significa para desenvolvedores

Comece pela API, não pelas suas próprias GPUs. A US$ 0,435 por milhão de tokens de entrada e US$ 0,87 por milhão de tokens de saída, o modelo Pro hospedado é barato de testar. Rode suas próprias tarefas nele pela API da Xiaomi ou pelo OpenRouter antes de pensar em hardware.

Experimente o Flash para trabalho de alto volume. Com 15 bilhões de parâmetros ativos e preços de US$ 0,14 e US$ 0,28 por milhão de tokens, o Flash serve para classificação, extração e outros trabalhos em que o custo importa mais do que a qualidade máxima.

Faça um orçamento honesto para a auto-hospedagem. Oito GPUs da classe H200 são uma compra ou um aluguel sério. Hospede por conta própria só se você precisar que os dados fiquem nas suas próprias máquinas, ou se o seu volume deixar a API mais cara do que o hardware.

Verifique a licença com seus advogados e depois use o modelo. A MIT é uma das licenças mais permissivas, o que torna o MiMo-V2.6 fácil de ajustar com fine-tuning e de incluir em produtos comerciais. Confirme se o arquivo de licença no lançamento corresponde ao que você espera.

Use os ambientes de treinamento mesmo que você deixe o modelo de lado. Equipes que criam seus próprios agentes podem reutilizar os mais de 7.000 ambientes de tarefas e o framework publicado para testar e treinar outros modelos.

Fontes

  1. Xiaomi releases MiMo-V2.6 Pro and Flash - DataNorth
  2. Xiaomi's MiMo-V2.6 Ships Open Weights at Frontier-Class Performance - Forkast
  3. MiMo-V2.6 Pro: Open Weights, Real Deployment Costs - LLM Rumors

Artigos relacionados

Glass office blocks around a lawn in the courtyard of Alibaba Group's headquarters campus in Hangzhou, China.
IA e LLMs

Qwen3.8-Omni-Flash corta 98% do custo de áudio

O novo modelo omnimodal da Alibaba lê texto, imagens, áudio e vídeo num contexto de um milhão de tokens, e reduz em mais de 98% o preço do áudio de entrada.