Aller au contenu

Xiaomi publie MiMo-V2.6-Pro, 1 000 milliards de paramètres en poids ouverts sous MIT

Le MiMo-V2.6-Pro de Xiaomi compte 1 020 milliards de paramètres, dont 42 milliards actifs, un contexte de 1 million de tokens et des poids sous licence MIT, mais il demande environ 680 Go de mémoire GPU.

Par Tech AI Wire Team

3 min de lecture

XLinkedIn
Screenshot of Xiaomi MiMo's Hugging Face organization page, listing its MiMo-V2.6 model collection.

En chiffres

total parameters in MiMo-V2.6-Pro
1.02T
parameters active per token
42B
token context window
1M
GPU memory needed to serve it with vLLM
680 GB

Xiaomi a publié MiMo-V2.6-Pro et MiMo-V2.6-Flash, deux modèles d'IA dont tout le monde peut télécharger les poids sous licence MIT. Le modèle Pro compte 1 020 milliards de paramètres, les valeurs internes qu'un modèle apprend pendant son entraînement. DataNorth date la sortie du 21 septembre 2026, tandis que Forkast et LLM Rumors indiquent le 22 septembre.

Des poids ouverts signifient qu'une entreprise peut faire tourner le modèle sur son propre matériel et le modifier librement. Le hic, comme le dit LLM Rumors, c'est que « poids ouverts » ne veut pas dire auto-hébergement simple. Faire tourner le modèle Pro demande environ 680 Go de mémoire GPU.

Ce que Xiaomi a publié

Les deux modèles reposent sur une architecture de mélange d'experts (mixture of experts). Dans cette architecture, le modèle contient de nombreux sous-réseaux spécialisés, appelés experts, et n'en utilise que quelques-uns pour chaque token, un petit morceau de texte. Cela maintient le coût de chaque réponse bien en dessous de ce que suggère la taille totale.

MiMo-V2.6-ProMiMo-V2.6-Flash
Paramètres au total1 020 milliards309 milliards
Actifs par token42 milliards15 milliards
Prix de l'API par million de tokens en entrée0,435 $0,14 $
Prix de l'API par million de tokens en sortie0,87 $0,28 $

DataNorth rapporte que les deux modèles acceptent du texte, des images, de l'audio et de la vidéo en entrée et produisent du texte en sortie. La fenêtre de contexte, la quantité de texte qu'un modèle peut prendre en compte en une fois, est de 1 048 576 tokens. Les poids sont sur Hugging Face, et les modèles tournent aussi sur Xiaomi AI Studio, la MiMo API de Xiaomi et OpenRouter.

Forkast donne plus de détails sur l'architecture. Le média décrit un mélange d'experts à routeur figé avec une attention hybride, ainsi qu'un décodeur spéculatif à cinq couches. Un décodeur spéculatif ébauche plusieurs tokens à l'avance, ce qui permet au modèle de produire du texte plus vite.

Ses résultats

DataNorth et Forkast rapportent ces résultats pour le modèle Pro :

BenchmarkScore
Artificial Analysis Intelligence Index v4.346,32, à égalité avec Grok 4.7
Terminal Bench 2.189,9
DeepSWE v1.171,9
AutomationBench53,1
CyberGym94,0, selon Forkast

L'indice d'Artificial Analysis combine de nombreux tests en un seul score. Égaler Grok 4.7 sur cet indice place un modèle sous licence MIT au niveau du modèle de xAI sur cette mesure.

Le kit d'entraînement livré avec

Xiaomi a publié plus de 7 000 environnements de tâches pour l'apprentissage par renforcement en même temps que les poids, rapportent Forkast et LLM Rumors. L'apprentissage par renforcement entraîne un modèle en récompensant les bons résultats sur des tâches. Ces environnements sont les tâches.

Forkast décrit le framework d'entraînement comme entièrement asynchrone et fondé sur GRPO, une méthode d'apprentissage par renforcement. Il a utilisé 1 568 prompts d'entraînement et 16 tentatives, ou rollouts, par étape. LLM Rumors ajoute que Xiaomi a aussi publié un dépôt mimoagent contenant des briques pour les agents et des outils d'évaluation.

Ce qu'il faut pour le faire tourner

Auto-héberger le modèle Pro est un travail de centre de données. LLM Rumors fait état d'un checkpoint de 566 Go. Le servir avec vLLM, un serveur d'inférence répandu, demande environ 680 Go de mémoire GPU au total. Cela représente à peu près huit accélérateurs Nvidia H200 ou quatre AMD MI355X, selon le média. Les configurations qui utilisent SGLang, un autre serveur, le répartissent sur deux machines.

DataNorth note que Xiaomi ne donne de son côté ni recommandations matérielles ni chiffres de vitesse.

Ce que cela signifie pour les développeurs

Commencez par l'API, pas par vos propres GPU. À 0,435 dollar par million de tokens en entrée et 0,87 dollar par million de tokens en sortie, le modèle Pro hébergé coûte peu à tester. Faites passer vos propres tâches par l'API de Xiaomi ou par OpenRouter avant de penser au matériel.

Essayez Flash pour les gros volumes. Avec 15 milliards de paramètres actifs et des prix de 0,14 et 0,28 dollar par million de tokens, Flash convient à la classification, à l'extraction et aux autres tâches où le coût compte plus que la qualité maximale.

Budgétez honnêtement l'auto-hébergement. Huit GPU de classe H200 représentent un achat ou une location conséquents. N'auto-hébergez que si vos données doivent rester sur vos propres machines, ou si votre volume rend l'API plus chère que le matériel.

Faites vérifier la licence par vos juristes, puis utilisez le modèle. MIT est l'une des licences les plus permissives, ce qui rend MiMo-V2.6 facile à affiner et à intégrer dans des produits commerciaux. Vérifiez que le fichier de licence de la version publiée correspond à ce que vous attendez.

Utilisez les environnements d'entraînement même si vous laissez le modèle de côté. Les équipes qui construisent leurs propres agents peuvent réutiliser les plus de 7 000 environnements de tâches et le framework publié pour tester et entraîner d'autres modèles.

Sources

  1. Xiaomi releases MiMo-V2.6 Pro and Flash - DataNorth
  2. Xiaomi's MiMo-V2.6 Ships Open Weights at Frontier-Class Performance - Forkast
  3. MiMo-V2.6 Pro: Open Weights, Real Deployment Costs - LLM Rumors

Articles liés