Xiaomi lanza MiMo-V2.6-Pro con 1 billón de parámetros en pesos abiertos bajo MIT
MiMo-V2.6-Pro de Xiaomi tiene 1,02 billones de parámetros, 42.000 millones activos, un contexto de 1 millón de tokens y pesos con licencia MIT, pero necesita unos 680 GB de memoria de GPU.
3 min de lectura

En cifras
- total parameters in MiMo-V2.6-Pro
- 1.02T
- parameters active per token
- 42B
- token context window
- 1M
- GPU memory needed to serve it with vLLM
- 680 GB
Xiaomi ha lanzado MiMo-V2.6-Pro y MiMo-V2.6-Flash, dos modelos de IA cuyos pesos cualquiera puede descargar bajo la licencia MIT. El modelo Pro tiene 1,02 billones de parámetros, los valores internos que un modelo aprende durante el entrenamiento. DataNorth fecha el lanzamiento el 21 de septiembre de 2026, mientras que Forkast y LLM Rumors indican el 22 de septiembre.
Que los pesos sean abiertos significa que una empresa puede ejecutar el modelo en su propio hardware y modificarlo libremente. El problema, como dice LLM Rumors, es que "pesos abiertos" no significa un autoalojamiento sencillo. Ejecutar el modelo Pro requiere unos 680 GB de memoria de GPU.
Qué ha lanzado Xiaomi
Ambos modelos usan un diseño de mezcla de expertos (mixture of experts). En este diseño, el modelo contiene muchas subredes especializadas, llamadas expertos, y solo usa unas pocas para cada token, un fragmento corto de texto. Eso mantiene el coste de cada respuesta muy por debajo de lo que sugiere el tamaño total.
| MiMo-V2.6-Pro | MiMo-V2.6-Flash | |
|---|---|---|
| Parámetros totales | 1,02 billones | 309.000 millones |
| Activos por token | 42.000 millones | 15.000 millones |
| Precio de la API por millón de tokens de entrada | 0,435 dólares | 0,14 dólares |
| Precio de la API por millón de tokens de salida | 0,87 dólares | 0,28 dólares |
DataNorth informa de que ambos modelos aceptan texto, imágenes, audio y vídeo como entrada y generan texto como salida. La ventana de contexto, la cantidad de texto que un modelo puede considerar a la vez, es de 1.048.576 tokens. Los pesos están en Hugging Face, y los modelos también funcionan en Xiaomi AI Studio, la MiMo API de Xiaomi y OpenRouter.
Forkast añade detalles sobre el diseño. Describe una mezcla de expertos con router congelado y atención híbrida, además de un decodificador especulativo de cinco capas. Un decodificador especulativo genera por adelantado un borrador de varios tokens, para que el modelo pueda producir texto más rápido.
Cómo puntúa
DataNorth y Forkast informan de estos resultados para el modelo Pro:
| Benchmark | Puntuación |
|---|---|
| Artificial Analysis Intelligence Index v4.3 | 46,32, empatado con Grok 4.7 |
| Terminal Bench 2.1 | 89,9 |
| DeepSWE v1.1 | 71,9 |
| AutomationBench | 53,1 |
| CyberGym | 94,0, según Forkast |
El índice de Artificial Analysis combina muchas pruebas en una sola puntuación. Empatar con Grok 4.7 en él sitúa a un modelo con licencia MIT al nivel del modelo de xAI en esa medida.
El kit de entrenamiento que lo acompaña
Xiaomi publicó más de 7.000 entornos de tareas de aprendizaje por refuerzo junto con los pesos, según Forkast y LLM Rumors. El aprendizaje por refuerzo entrena un modelo recompensando los buenos resultados en tareas. Estos entornos son las tareas.
Forkast describe el framework de entrenamiento como totalmente asíncrono y basado en GRPO, un método de aprendizaje por refuerzo. Usó 1.568 prompts de entrenamiento y 16 intentos, o rollouts, por paso. LLM Rumors añade que Xiaomi también publicó un repositorio mimoagent con componentes para agentes y herramientas de evaluación.
Qué hace falta para ejecutarlo
Autoalojar el modelo Pro es trabajo de centro de datos. LLM Rumors informa de un checkpoint de 566 GB. Servirlo con vLLM, un servidor de inferencia popular, requiere unos 680 GB de memoria de GPU en total. Eso equivale a unos ocho aceleradores Nvidia H200 o cuatro AMD MI355X, según el medio. Las configuraciones con SGLang, otro servidor, lo reparten entre dos máquinas.
DataNorth señala que Xiaomi no ofrece ninguna orientación propia sobre hardware ni cifras de velocidad.
Qué significa esto para los desarrolladores
Empieza por la API, no por tus propias GPU. A 0,435 dólares por millón de tokens de entrada y 0,87 dólares por millón de tokens de salida, el modelo Pro alojado es barato de probar. Pasa tus propias tareas por la API de Xiaomi o por OpenRouter antes de pensar en hardware.
Prueba Flash para trabajo de gran volumen. Con 15.000 millones de parámetros activos y precios de 0,14 y 0,28 dólares por millón de tokens, Flash encaja en clasificación, extracción y otros trabajos en los que el coste importa más que la calidad máxima.
Presupuesta el autoalojamiento con honestidad. Ocho GPU de la clase H200 son una compra o un alquiler serios. Autoaloja solo si necesitas que los datos se queden en tus propias máquinas, o si tu volumen hace que la API salga más cara que el hardware.
Revisa la licencia con tus abogados y después usa el modelo. MIT es una de las licencias más permisivas, lo que hace que MiMo-V2.6 sea fácil de ajustar con fine-tuning y de integrar en productos comerciales. Confirma que el archivo de licencia de la versión publicada coincide con lo que esperas.
Usa los entornos de entrenamiento aunque descartes el modelo. Los equipos que crean sus propios agentes pueden reutilizar los más de 7.000 entornos de tareas y el framework publicado para probar y entrenar otros modelos.
Fuentes
Artículos relacionados

Qwen3.8-Omni-Flash baja un 98 % el costo del audio
El nuevo modelo omnimodal de Alibaba lee texto, imágenes, audio y video en un contexto de un millón de tokens, y baja más de 98 % el precio del audio de entrada.

AstaBrief 8B: el modelo abierto de Ai2 escribe informes con citas
Ai2 lanzó AstaBrief 8B, un modelo con licencia Apache 2.0 basado en Qwen3-8B que escribe informes de investigación con citas en 51,1 segundos, 3,5 veces más rápido que el modo Thinking de Asta.

OpenAI vincula una campaña de extracción de razonamiento con Moonshot AI
Según OpenAI, usuarios vinculados a Moonshot AI, creadora de Kimi, enviaron en julio 16.000 solicitudes de extracción procedentes de más de 4.000 usuarios para copiar el razonamiento oculto de los modelos de OpenAI.