Xiaomi lança MiMo-V2.6-Pro com 1 trilhão de parâmetros em pesos abertos sob MIT
O MiMo-V2.6-Pro da Xiaomi tem 1,02 trilhão de parâmetros, 42 bilhões ativos, contexto de 1 milhão de tokens e pesos sob licença MIT, mas precisa de cerca de 680 GB de memória de GPU.
3 min de leitura

Em números
- total parameters in MiMo-V2.6-Pro
- 1.02T
- parameters active per token
- 42B
- token context window
- 1M
- GPU memory needed to serve it with vLLM
- 680 GB
A Xiaomi lançou o MiMo-V2.6-Pro e o MiMo-V2.6-Flash, dois modelos de IA cujos pesos qualquer pessoa pode baixar sob a licença MIT. O modelo Pro tem 1,02 trilhão de parâmetros, os valores internos que um modelo aprende durante o treinamento. O DataNorth data o lançamento de 21 de setembro de 2026, enquanto o Forkast e o LLM Rumors indicam 22 de setembro.
Pesos abertos significam que uma empresa pode rodar o modelo no próprio hardware e modificá-lo livremente. O problema, como diz o LLM Rumors, é que "pesos abertos" não significa auto-hospedagem simples. Rodar o modelo Pro exige cerca de 680 GB de memória de GPU.
O que a Xiaomi lançou
Os dois modelos usam um design de mistura de especialistas (mixture of experts). Nesse design, o modelo tem muitas sub-redes especializadas, chamadas especialistas, e usa só algumas delas para cada token, um pedaço curto de texto. Isso mantém o custo de cada resposta bem abaixo do que o tamanho total sugere.
| MiMo-V2.6-Pro | MiMo-V2.6-Flash | |
|---|---|---|
| Total de parâmetros | 1,02 trilhão | 309 bilhões |
| Ativos por token | 42 bilhões | 15 bilhões |
| Preço da API por milhão de tokens de entrada | US$ 0,435 | US$ 0,14 |
| Preço da API por milhão de tokens de saída | US$ 0,87 | US$ 0,28 |
O DataNorth informa que os dois modelos aceitam texto, imagens, áudio e vídeo como entrada e geram texto como saída. A janela de contexto, a quantidade de texto que um modelo consegue considerar de uma vez, é de 1.048.576 tokens. Os pesos estão no Hugging Face, e os modelos também rodam no Xiaomi AI Studio, na MiMo API da Xiaomi e no OpenRouter.
O Forkast traz mais detalhes sobre o design. O site descreve uma mistura de especialistas com roteador congelado e atenção híbrida, além de um decodificador especulativo de cinco camadas. Um decodificador especulativo rascunha vários tokens à frente, para que o modelo produza texto mais rápido.
Como ele pontua
O DataNorth e o Forkast relatam estes resultados para o modelo Pro:
| Benchmark | Pontuação |
|---|---|
| Artificial Analysis Intelligence Index v4.3 | 46,32, empatado com o Grok 4.7 |
| Terminal Bench 2.1 | 89,9 |
| DeepSWE v1.1 | 71,9 |
| AutomationBench | 53,1 |
| CyberGym | 94,0, segundo o Forkast |
O índice da Artificial Analysis combina muitos testes em uma única pontuação. Empatar com o Grok 4.7 ali coloca um modelo com licença MIT no mesmo nível do modelo da xAI nessa medida.
O kit de treinamento que veio junto
A Xiaomi lançou mais de 7.000 ambientes de tarefas de aprendizado por reforço junto com os pesos, segundo o Forkast e o LLM Rumors. O aprendizado por reforço treina um modelo recompensando bons resultados em tarefas. Esses ambientes são as tarefas.
O Forkast descreve o framework de treinamento como totalmente assíncrono e baseado em GRPO, um método de aprendizado por reforço. Ele usou 1.568 prompts de treinamento e 16 tentativas, ou rollouts, por passo. O LLM Rumors acrescenta que a Xiaomi também publicou um repositório mimoagent com blocos de construção para agentes e ferramentas de avaliação.
O que é preciso para rodar
Auto-hospedar o modelo Pro é trabalho de data center. O LLM Rumors relata um checkpoint de 566 GB. Servi-lo com o vLLM, um servidor de inferência popular, exige cerca de 680 GB de memória de GPU no total. Isso equivale a mais ou menos oito aceleradores Nvidia H200 ou quatro AMD MI355X, segundo o site. Configurações com o SGLang, outro servidor, distribuem o modelo entre duas máquinas.
O DataNorth observa que a Xiaomi não dá nenhuma orientação própria de hardware nem números de velocidade.
O que isso significa para desenvolvedores
Comece pela API, não pelas suas próprias GPUs. A US$ 0,435 por milhão de tokens de entrada e US$ 0,87 por milhão de tokens de saída, o modelo Pro hospedado é barato de testar. Rode suas próprias tarefas nele pela API da Xiaomi ou pelo OpenRouter antes de pensar em hardware.
Experimente o Flash para trabalho de alto volume. Com 15 bilhões de parâmetros ativos e preços de US$ 0,14 e US$ 0,28 por milhão de tokens, o Flash serve para classificação, extração e outros trabalhos em que o custo importa mais do que a qualidade máxima.
Faça um orçamento honesto para a auto-hospedagem. Oito GPUs da classe H200 são uma compra ou um aluguel sério. Hospede por conta própria só se você precisar que os dados fiquem nas suas próprias máquinas, ou se o seu volume deixar a API mais cara do que o hardware.
Verifique a licença com seus advogados e depois use o modelo. A MIT é uma das licenças mais permissivas, o que torna o MiMo-V2.6 fácil de ajustar com fine-tuning e de incluir em produtos comerciais. Confirme se o arquivo de licença no lançamento corresponde ao que você espera.
Use os ambientes de treinamento mesmo que você deixe o modelo de lado. Equipes que criam seus próprios agentes podem reutilizar os mais de 7.000 ambientes de tarefas e o framework publicado para testar e treinar outros modelos.
Fontes
Artigos relacionados

Qwen3.8-Omni-Flash corta 98% do custo de áudio
O novo modelo omnimodal da Alibaba lê texto, imagens, áudio e vídeo num contexto de um milhão de tokens, e reduz em mais de 98% o preço do áudio de entrada.

AstaBrief 8B: modelo aberto do Ai2 escreve relatórios com citações
O Ai2 lançou o AstaBrief 8B, um modelo sob Apache 2.0 baseado no Qwen3-8B que escreve relatórios de pesquisa com citações em 51,1 segundos, 3,5 vezes mais rápido que o modo Thinking do Asta.

OpenAI liga campanha de extração de raciocínio à Moonshot AI
Segundo a OpenAI, usuários ligados à Moonshot AI, criadora do Kimi, enviaram em julho 16.000 pedidos de extração a partir de mais de 4.000 usuários para copiar o raciocínio oculto dos modelos da OpenAI.