Xiaomi veröffentlicht MiMo-V2.6-Pro mit 1 Billion Parametern als offene Gewichte unter MIT
Xiaomis MiMo-V2.6-Pro hat 1,02 Billionen Parameter, davon 42 Milliarden aktiv, einen Kontext von 1 Million Tokens und MIT-lizenzierte Gewichte, braucht aber rund 680 GB GPU-Speicher.
3 Min. Lesezeit

Die Zahlen
- total parameters in MiMo-V2.6-Pro
- 1.02T
- parameters active per token
- 42B
- token context window
- 1M
- GPU memory needed to serve it with vLLM
- 680 GB
Xiaomi hat MiMo-V2.6-Pro und MiMo-V2.6-Flash veröffentlicht, zwei KI-Modelle, deren Gewichte jeder unter der MIT-Lizenz herunterladen kann. Das Pro-Modell hat 1,02 Billionen Parameter, also die internen Werte, die ein Modell im Training lernt. DataNorth datiert die Veröffentlichung auf den 21. September 2026, Forkast und LLM Rumors nennen dagegen den 22. September.
Offene Gewichte bedeuten, dass ein Unternehmen das Modell auf eigener Hardware betreiben und frei verändern kann. Der Haken ist, wie LLM Rumors es formuliert, dass "offene Gewichte" kein einfaches Self-Hosting bedeutet. Der Betrieb des Pro-Modells erfordert rund 680 GB GPU-Speicher.
Was Xiaomi veröffentlicht hat
Beide Modelle nutzen eine Mixture-of-Experts-Architektur. Bei diesem Aufbau enthält das Modell viele spezialisierte Teilnetze, Experten genannt, und nutzt für jedes Token, also ein kurzes Textstück, nur wenige davon. Dadurch bleiben die Kosten jeder Antwort weit unter dem, was die Gesamtgröße vermuten lässt.
| MiMo-V2.6-Pro | MiMo-V2.6-Flash | |
|---|---|---|
| Parameter insgesamt | 1,02 Billionen | 309 Milliarden |
| Aktiv pro Token | 42 Milliarden | 15 Milliarden |
| API-Preis pro Million Eingabe-Tokens | 0,435 US-Dollar | 0,14 US-Dollar |
| API-Preis pro Million Ausgabe-Tokens | 0,87 US-Dollar | 0,28 US-Dollar |
DataNorth berichtet, dass beide Modelle Text, Bilder, Audio und Video als Eingabe verarbeiten und Text ausgeben. Das Kontextfenster, also die Textmenge, die ein Modell auf einmal berücksichtigen kann, umfasst 1.048.576 Tokens. Die Gewichte liegen auf Hugging Face, und die Modelle laufen auch auf Xiaomi AI Studio, Xiaomis MiMo API und OpenRouter.
Forkast liefert weitere Details zur Architektur. Das Medium beschreibt eine Mixture of Experts mit eingefrorenem Router und hybrider Attention sowie einen spekulativen Decoder mit fünf Schichten. Ein spekulativer Decoder entwirft mehrere Tokens im Voraus, damit das Modell Text schneller erzeugen kann.
Wie es abschneidet
DataNorth und Forkast melden diese Ergebnisse für das Pro-Modell:
| Benchmark | Wert |
|---|---|
| Artificial Analysis Intelligence Index v4.3 | 46,32, gleichauf mit Grok 4.7 |
| Terminal Bench 2.1 | 89,9 |
| DeepSWE v1.1 | 71,9 |
| AutomationBench | 53,1 |
| CyberGym | 94,0, laut Forkast |
Der Index von Artificial Analysis fasst viele Tests zu einem einzigen Wert zusammen. Der Gleichstand mit Grok 4.7 bringt dort ein MIT-lizenziertes Modell bei diesem Maßstab auf das Niveau des Modells von xAI.
Das mitgelieferte Trainingspaket
Xiaomi hat zusammen mit den Gewichten mehr als 7.000 Aufgabenumgebungen für Reinforcement Learning veröffentlicht, berichten Forkast und LLM Rumors. Reinforcement Learning trainiert ein Modell, indem es gute Ergebnisse bei Aufgaben belohnt. Diese Umgebungen sind die Aufgaben.
Forkast beschreibt das Trainingsframework als vollständig asynchron und auf GRPO basierend, einer Methode des Reinforcement Learning. Es nutzte 1.568 Trainings-Prompts und 16 Versuche, sogenannte Rollouts, pro Schritt. LLM Rumors ergänzt, dass Xiaomi auch ein mimoagent-Repository mit Bausteinen für Agenten und mit Evaluierungswerkzeugen veröffentlicht hat.
Was der Betrieb erfordert
Das Pro-Modell selbst zu hosten, ist eine Aufgabe für ein Rechenzentrum. LLM Rumors berichtet von einem Checkpoint mit 566 GB. Für den Betrieb mit vLLM, einem verbreiteten Inferenzserver, sind insgesamt rund 680 GB GPU-Speicher nötig. Das entspricht laut dem Medium etwa acht Beschleunigern vom Typ Nvidia H200 oder vier vom Typ AMD MI355X. Setups mit SGLang, einem weiteren Server, verteilen das Modell auf zwei Maschinen.
DataNorth weist darauf hin, dass Xiaomi selbst weder Hardware-Empfehlungen noch Geschwindigkeitswerte angibt.
Was das für Entwickler bedeutet
Beginnen Sie mit der API, nicht mit eigenen GPUs. Bei 0,435 US-Dollar pro Million Eingabe-Tokens und 0,87 US-Dollar pro Million Ausgabe-Tokens ist das gehostete Pro-Modell günstig zu testen. Lassen Sie Ihre eigenen Aufgaben über Xiaomis API oder OpenRouter laufen, bevor Sie über Hardware nachdenken.
Testen Sie Flash für Arbeit mit hohem Volumen. Mit 15 Milliarden aktiven Parametern und Preisen von 0,14 und 0,28 US-Dollar pro Million Tokens eignet sich Flash für Klassifizierung, Extraktion und andere Aufgaben, bei denen die Kosten wichtiger sind als Spitzenqualität.
Planen Sie das Budget für Self-Hosting ehrlich. Acht GPUs der H200-Klasse sind eine ernsthafte Anschaffung oder Miete. Hosten Sie nur selbst, wenn Ihre Daten auf Ihren eigenen Maschinen bleiben müssen oder wenn Ihr Volumen die API teurer macht als die Hardware.
Prüfen Sie die Lizenz mit Ihren Juristen, und setzen Sie das Modell dann ein. MIT ist eine der freizügigsten Lizenzen. Dadurch lässt sich MiMo-V2.6 leicht feinabstimmen und in kommerziellen Produkten ausliefern. Prüfen Sie, ob die Lizenzdatei im Release Ihren Erwartungen entspricht.
Nutzen Sie die Trainingsumgebungen, auch wenn Sie das Modell auslassen. Teams, die eigene Agenten bauen, können die mehr als 7.000 Aufgabenumgebungen und das veröffentlichte Framework wiederverwenden, um andere Modelle zu testen und zu trainieren.
Quellen
Ähnliche Artikel

Qwen3.8-Omni-Flash senkt Audio-Eingabekosten um 98 %
Alibabas neues omnimodales Modell liest Text, Bilder, Audio und Video in einem 1M-Token-Kontext und senkt die Preise für Audio-Eingaben um über 98 Prozent.

AstaBrief 8B: Ai2s offenes Modell schreibt Berichte mit Quellenangaben
Ai2 hat AstaBrief 8B veröffentlicht, ein Apache-2.0-Modell auf Basis von Qwen3-8B, das Forschungsberichte mit Quellenangaben in 51,1 Sekunden schreibt, 3,5-mal schneller als Astas Thinking mode.

OpenAI bringt Kampagne zur Reasoning-Extraktion mit Moonshot AI in Verbindung
Laut OpenAI schickten Nutzer mit Verbindung zu Moonshot AI, dem Hersteller von Kimi, im Juli 16.000 Extraktionsanfragen von über 4.000 Nutzern, um das verborgene Reasoning der OpenAI-Modelle zu kopieren.