Xiaomi publie MiMo-V2.6-Pro, 1 000 milliards de paramètres en poids ouverts sous MIT
Le MiMo-V2.6-Pro de Xiaomi compte 1 020 milliards de paramètres, dont 42 milliards actifs, un contexte de 1 million de tokens et des poids sous licence MIT, mais il demande environ 680 Go de mémoire GPU.
3 min de lecture

En chiffres
- total parameters in MiMo-V2.6-Pro
- 1.02T
- parameters active per token
- 42B
- token context window
- 1M
- GPU memory needed to serve it with vLLM
- 680 GB
Xiaomi a publié MiMo-V2.6-Pro et MiMo-V2.6-Flash, deux modèles d'IA dont tout le monde peut télécharger les poids sous licence MIT. Le modèle Pro compte 1 020 milliards de paramètres, les valeurs internes qu'un modèle apprend pendant son entraînement. DataNorth date la sortie du 21 septembre 2026, tandis que Forkast et LLM Rumors indiquent le 22 septembre.
Des poids ouverts signifient qu'une entreprise peut faire tourner le modèle sur son propre matériel et le modifier librement. Le hic, comme le dit LLM Rumors, c'est que « poids ouverts » ne veut pas dire auto-hébergement simple. Faire tourner le modèle Pro demande environ 680 Go de mémoire GPU.
Ce que Xiaomi a publié
Les deux modèles reposent sur une architecture de mélange d'experts (mixture of experts). Dans cette architecture, le modèle contient de nombreux sous-réseaux spécialisés, appelés experts, et n'en utilise que quelques-uns pour chaque token, un petit morceau de texte. Cela maintient le coût de chaque réponse bien en dessous de ce que suggère la taille totale.
| MiMo-V2.6-Pro | MiMo-V2.6-Flash | |
|---|---|---|
| Paramètres au total | 1 020 milliards | 309 milliards |
| Actifs par token | 42 milliards | 15 milliards |
| Prix de l'API par million de tokens en entrée | 0,435 $ | 0,14 $ |
| Prix de l'API par million de tokens en sortie | 0,87 $ | 0,28 $ |
DataNorth rapporte que les deux modèles acceptent du texte, des images, de l'audio et de la vidéo en entrée et produisent du texte en sortie. La fenêtre de contexte, la quantité de texte qu'un modèle peut prendre en compte en une fois, est de 1 048 576 tokens. Les poids sont sur Hugging Face, et les modèles tournent aussi sur Xiaomi AI Studio, la MiMo API de Xiaomi et OpenRouter.
Forkast donne plus de détails sur l'architecture. Le média décrit un mélange d'experts à routeur figé avec une attention hybride, ainsi qu'un décodeur spéculatif à cinq couches. Un décodeur spéculatif ébauche plusieurs tokens à l'avance, ce qui permet au modèle de produire du texte plus vite.
Ses résultats
DataNorth et Forkast rapportent ces résultats pour le modèle Pro :
| Benchmark | Score |
|---|---|
| Artificial Analysis Intelligence Index v4.3 | 46,32, à égalité avec Grok 4.7 |
| Terminal Bench 2.1 | 89,9 |
| DeepSWE v1.1 | 71,9 |
| AutomationBench | 53,1 |
| CyberGym | 94,0, selon Forkast |
L'indice d'Artificial Analysis combine de nombreux tests en un seul score. Égaler Grok 4.7 sur cet indice place un modèle sous licence MIT au niveau du modèle de xAI sur cette mesure.
Le kit d'entraînement livré avec
Xiaomi a publié plus de 7 000 environnements de tâches pour l'apprentissage par renforcement en même temps que les poids, rapportent Forkast et LLM Rumors. L'apprentissage par renforcement entraîne un modèle en récompensant les bons résultats sur des tâches. Ces environnements sont les tâches.
Forkast décrit le framework d'entraînement comme entièrement asynchrone et fondé sur GRPO, une méthode d'apprentissage par renforcement. Il a utilisé 1 568 prompts d'entraînement et 16 tentatives, ou rollouts, par étape. LLM Rumors ajoute que Xiaomi a aussi publié un dépôt mimoagent contenant des briques pour les agents et des outils d'évaluation.
Ce qu'il faut pour le faire tourner
Auto-héberger le modèle Pro est un travail de centre de données. LLM Rumors fait état d'un checkpoint de 566 Go. Le servir avec vLLM, un serveur d'inférence répandu, demande environ 680 Go de mémoire GPU au total. Cela représente à peu près huit accélérateurs Nvidia H200 ou quatre AMD MI355X, selon le média. Les configurations qui utilisent SGLang, un autre serveur, le répartissent sur deux machines.
DataNorth note que Xiaomi ne donne de son côté ni recommandations matérielles ni chiffres de vitesse.
Ce que cela signifie pour les développeurs
Commencez par l'API, pas par vos propres GPU. À 0,435 dollar par million de tokens en entrée et 0,87 dollar par million de tokens en sortie, le modèle Pro hébergé coûte peu à tester. Faites passer vos propres tâches par l'API de Xiaomi ou par OpenRouter avant de penser au matériel.
Essayez Flash pour les gros volumes. Avec 15 milliards de paramètres actifs et des prix de 0,14 et 0,28 dollar par million de tokens, Flash convient à la classification, à l'extraction et aux autres tâches où le coût compte plus que la qualité maximale.
Budgétez honnêtement l'auto-hébergement. Huit GPU de classe H200 représentent un achat ou une location conséquents. N'auto-hébergez que si vos données doivent rester sur vos propres machines, ou si votre volume rend l'API plus chère que le matériel.
Faites vérifier la licence par vos juristes, puis utilisez le modèle. MIT est l'une des licences les plus permissives, ce qui rend MiMo-V2.6 facile à affiner et à intégrer dans des produits commerciaux. Vérifiez que le fichier de licence de la version publiée correspond à ce que vous attendez.
Utilisez les environnements d'entraînement même si vous laissez le modèle de côté. Les équipes qui construisent leurs propres agents peuvent réutiliser les plus de 7 000 environnements de tâches et le framework publié pour tester et entraîner d'autres modèles.
Sources
Articles liés

Qwen3.8-Omni-Flash réduit de 98 % le coût de l'audio
Le nouveau modèle omnimodal d'Alibaba lit texte, images, audio et vidéo dans un contexte d'un million de jetons, et baisse de plus de 98 % le prix de l'audio en entrée.

AstaBrief 8B : le modèle ouvert d'Ai2 rédige des rapports avec citations
Ai2 a publié AstaBrief 8B, un modèle sous Apache 2.0 bâti sur Qwen3-8B qui rédige des rapports de recherche avec citations en 51,1 secondes, 3,5 fois plus vite que le mode Thinking d'Asta.

OpenAI relie une campagne d'extraction de raisonnement à Moonshot AI
Selon OpenAI, des utilisateurs liés à Moonshot AI, créateur de Kimi, ont envoyé en juillet 16 000 requêtes d'extraction émanant de plus de 4 000 utilisateurs pour copier le raisonnement caché des modèles d'OpenAI.