Zum Inhalt springen

Xiaomi veröffentlicht MiMo-V2.6-Pro mit 1 Billion Parametern als offene Gewichte unter MIT

Xiaomis MiMo-V2.6-Pro hat 1,02 Billionen Parameter, davon 42 Milliarden aktiv, einen Kontext von 1 Million Tokens und MIT-lizenzierte Gewichte, braucht aber rund 680 GB GPU-Speicher.

Von Tech AI Wire Team

3 Min. Lesezeit

XLinkedIn
Screenshot of Xiaomi MiMo's Hugging Face organization page, listing its MiMo-V2.6 model collection.

Die Zahlen

total parameters in MiMo-V2.6-Pro
1.02T
parameters active per token
42B
token context window
1M
GPU memory needed to serve it with vLLM
680 GB

Xiaomi hat MiMo-V2.6-Pro und MiMo-V2.6-Flash veröffentlicht, zwei KI-Modelle, deren Gewichte jeder unter der MIT-Lizenz herunterladen kann. Das Pro-Modell hat 1,02 Billionen Parameter, also die internen Werte, die ein Modell im Training lernt. DataNorth datiert die Veröffentlichung auf den 21. September 2026, Forkast und LLM Rumors nennen dagegen den 22. September.

Offene Gewichte bedeuten, dass ein Unternehmen das Modell auf eigener Hardware betreiben und frei verändern kann. Der Haken ist, wie LLM Rumors es formuliert, dass "offene Gewichte" kein einfaches Self-Hosting bedeutet. Der Betrieb des Pro-Modells erfordert rund 680 GB GPU-Speicher.

Was Xiaomi veröffentlicht hat

Beide Modelle nutzen eine Mixture-of-Experts-Architektur. Bei diesem Aufbau enthält das Modell viele spezialisierte Teilnetze, Experten genannt, und nutzt für jedes Token, also ein kurzes Textstück, nur wenige davon. Dadurch bleiben die Kosten jeder Antwort weit unter dem, was die Gesamtgröße vermuten lässt.

MiMo-V2.6-ProMiMo-V2.6-Flash
Parameter insgesamt1,02 Billionen309 Milliarden
Aktiv pro Token42 Milliarden15 Milliarden
API-Preis pro Million Eingabe-Tokens0,435 US-Dollar0,14 US-Dollar
API-Preis pro Million Ausgabe-Tokens0,87 US-Dollar0,28 US-Dollar

DataNorth berichtet, dass beide Modelle Text, Bilder, Audio und Video als Eingabe verarbeiten und Text ausgeben. Das Kontextfenster, also die Textmenge, die ein Modell auf einmal berücksichtigen kann, umfasst 1.048.576 Tokens. Die Gewichte liegen auf Hugging Face, und die Modelle laufen auch auf Xiaomi AI Studio, Xiaomis MiMo API und OpenRouter.

Forkast liefert weitere Details zur Architektur. Das Medium beschreibt eine Mixture of Experts mit eingefrorenem Router und hybrider Attention sowie einen spekulativen Decoder mit fünf Schichten. Ein spekulativer Decoder entwirft mehrere Tokens im Voraus, damit das Modell Text schneller erzeugen kann.

Wie es abschneidet

DataNorth und Forkast melden diese Ergebnisse für das Pro-Modell:

BenchmarkWert
Artificial Analysis Intelligence Index v4.346,32, gleichauf mit Grok 4.7
Terminal Bench 2.189,9
DeepSWE v1.171,9
AutomationBench53,1
CyberGym94,0, laut Forkast

Der Index von Artificial Analysis fasst viele Tests zu einem einzigen Wert zusammen. Der Gleichstand mit Grok 4.7 bringt dort ein MIT-lizenziertes Modell bei diesem Maßstab auf das Niveau des Modells von xAI.

Das mitgelieferte Trainingspaket

Xiaomi hat zusammen mit den Gewichten mehr als 7.000 Aufgabenumgebungen für Reinforcement Learning veröffentlicht, berichten Forkast und LLM Rumors. Reinforcement Learning trainiert ein Modell, indem es gute Ergebnisse bei Aufgaben belohnt. Diese Umgebungen sind die Aufgaben.

Forkast beschreibt das Trainingsframework als vollständig asynchron und auf GRPO basierend, einer Methode des Reinforcement Learning. Es nutzte 1.568 Trainings-Prompts und 16 Versuche, sogenannte Rollouts, pro Schritt. LLM Rumors ergänzt, dass Xiaomi auch ein mimoagent-Repository mit Bausteinen für Agenten und mit Evaluierungswerkzeugen veröffentlicht hat.

Was der Betrieb erfordert

Das Pro-Modell selbst zu hosten, ist eine Aufgabe für ein Rechenzentrum. LLM Rumors berichtet von einem Checkpoint mit 566 GB. Für den Betrieb mit vLLM, einem verbreiteten Inferenzserver, sind insgesamt rund 680 GB GPU-Speicher nötig. Das entspricht laut dem Medium etwa acht Beschleunigern vom Typ Nvidia H200 oder vier vom Typ AMD MI355X. Setups mit SGLang, einem weiteren Server, verteilen das Modell auf zwei Maschinen.

DataNorth weist darauf hin, dass Xiaomi selbst weder Hardware-Empfehlungen noch Geschwindigkeitswerte angibt.

Was das für Entwickler bedeutet

Beginnen Sie mit der API, nicht mit eigenen GPUs. Bei 0,435 US-Dollar pro Million Eingabe-Tokens und 0,87 US-Dollar pro Million Ausgabe-Tokens ist das gehostete Pro-Modell günstig zu testen. Lassen Sie Ihre eigenen Aufgaben über Xiaomis API oder OpenRouter laufen, bevor Sie über Hardware nachdenken.

Testen Sie Flash für Arbeit mit hohem Volumen. Mit 15 Milliarden aktiven Parametern und Preisen von 0,14 und 0,28 US-Dollar pro Million Tokens eignet sich Flash für Klassifizierung, Extraktion und andere Aufgaben, bei denen die Kosten wichtiger sind als Spitzenqualität.

Planen Sie das Budget für Self-Hosting ehrlich. Acht GPUs der H200-Klasse sind eine ernsthafte Anschaffung oder Miete. Hosten Sie nur selbst, wenn Ihre Daten auf Ihren eigenen Maschinen bleiben müssen oder wenn Ihr Volumen die API teurer macht als die Hardware.

Prüfen Sie die Lizenz mit Ihren Juristen, und setzen Sie das Modell dann ein. MIT ist eine der freizügigsten Lizenzen. Dadurch lässt sich MiMo-V2.6 leicht feinabstimmen und in kommerziellen Produkten ausliefern. Prüfen Sie, ob die Lizenzdatei im Release Ihren Erwartungen entspricht.

Nutzen Sie die Trainingsumgebungen, auch wenn Sie das Modell auslassen. Teams, die eigene Agenten bauen, können die mehr als 7.000 Aufgabenumgebungen und das veröffentlichte Framework wiederverwenden, um andere Modelle zu testen und zu trainieren.

Quellen

  1. Xiaomi releases MiMo-V2.6 Pro and Flash - DataNorth
  2. Xiaomi's MiMo-V2.6 Ships Open Weights at Frontier-Class Performance - Forkast
  3. MiMo-V2.6 Pro: Open Weights, Real Deployment Costs - LLM Rumors

Ähnliche Artikel