Saltar al contenido

Xiaomi lanza MiMo-V2.6-Pro con 1 billón de parámetros en pesos abiertos bajo MIT

MiMo-V2.6-Pro de Xiaomi tiene 1,02 billones de parámetros, 42.000 millones activos, un contexto de 1 millón de tokens y pesos con licencia MIT, pero necesita unos 680 GB de memoria de GPU.

Por Tech AI Wire Team

3 min de lectura

XLinkedIn
Screenshot of Xiaomi MiMo's Hugging Face organization page, listing its MiMo-V2.6 model collection.

En cifras

total parameters in MiMo-V2.6-Pro
1.02T
parameters active per token
42B
token context window
1M
GPU memory needed to serve it with vLLM
680 GB

Xiaomi ha lanzado MiMo-V2.6-Pro y MiMo-V2.6-Flash, dos modelos de IA cuyos pesos cualquiera puede descargar bajo la licencia MIT. El modelo Pro tiene 1,02 billones de parámetros, los valores internos que un modelo aprende durante el entrenamiento. DataNorth fecha el lanzamiento el 21 de septiembre de 2026, mientras que Forkast y LLM Rumors indican el 22 de septiembre.

Que los pesos sean abiertos significa que una empresa puede ejecutar el modelo en su propio hardware y modificarlo libremente. El problema, como dice LLM Rumors, es que "pesos abiertos" no significa un autoalojamiento sencillo. Ejecutar el modelo Pro requiere unos 680 GB de memoria de GPU.

Qué ha lanzado Xiaomi

Ambos modelos usan un diseño de mezcla de expertos (mixture of experts). En este diseño, el modelo contiene muchas subredes especializadas, llamadas expertos, y solo usa unas pocas para cada token, un fragmento corto de texto. Eso mantiene el coste de cada respuesta muy por debajo de lo que sugiere el tamaño total.

MiMo-V2.6-ProMiMo-V2.6-Flash
Parámetros totales1,02 billones309.000 millones
Activos por token42.000 millones15.000 millones
Precio de la API por millón de tokens de entrada0,435 dólares0,14 dólares
Precio de la API por millón de tokens de salida0,87 dólares0,28 dólares

DataNorth informa de que ambos modelos aceptan texto, imágenes, audio y vídeo como entrada y generan texto como salida. La ventana de contexto, la cantidad de texto que un modelo puede considerar a la vez, es de 1.048.576 tokens. Los pesos están en Hugging Face, y los modelos también funcionan en Xiaomi AI Studio, la MiMo API de Xiaomi y OpenRouter.

Forkast añade detalles sobre el diseño. Describe una mezcla de expertos con router congelado y atención híbrida, además de un decodificador especulativo de cinco capas. Un decodificador especulativo genera por adelantado un borrador de varios tokens, para que el modelo pueda producir texto más rápido.

Cómo puntúa

DataNorth y Forkast informan de estos resultados para el modelo Pro:

BenchmarkPuntuación
Artificial Analysis Intelligence Index v4.346,32, empatado con Grok 4.7
Terminal Bench 2.189,9
DeepSWE v1.171,9
AutomationBench53,1
CyberGym94,0, según Forkast

El índice de Artificial Analysis combina muchas pruebas en una sola puntuación. Empatar con Grok 4.7 en él sitúa a un modelo con licencia MIT al nivel del modelo de xAI en esa medida.

El kit de entrenamiento que lo acompaña

Xiaomi publicó más de 7.000 entornos de tareas de aprendizaje por refuerzo junto con los pesos, según Forkast y LLM Rumors. El aprendizaje por refuerzo entrena un modelo recompensando los buenos resultados en tareas. Estos entornos son las tareas.

Forkast describe el framework de entrenamiento como totalmente asíncrono y basado en GRPO, un método de aprendizaje por refuerzo. Usó 1.568 prompts de entrenamiento y 16 intentos, o rollouts, por paso. LLM Rumors añade que Xiaomi también publicó un repositorio mimoagent con componentes para agentes y herramientas de evaluación.

Qué hace falta para ejecutarlo

Autoalojar el modelo Pro es trabajo de centro de datos. LLM Rumors informa de un checkpoint de 566 GB. Servirlo con vLLM, un servidor de inferencia popular, requiere unos 680 GB de memoria de GPU en total. Eso equivale a unos ocho aceleradores Nvidia H200 o cuatro AMD MI355X, según el medio. Las configuraciones con SGLang, otro servidor, lo reparten entre dos máquinas.

DataNorth señala que Xiaomi no ofrece ninguna orientación propia sobre hardware ni cifras de velocidad.

Qué significa esto para los desarrolladores

Empieza por la API, no por tus propias GPU. A 0,435 dólares por millón de tokens de entrada y 0,87 dólares por millón de tokens de salida, el modelo Pro alojado es barato de probar. Pasa tus propias tareas por la API de Xiaomi o por OpenRouter antes de pensar en hardware.

Prueba Flash para trabajo de gran volumen. Con 15.000 millones de parámetros activos y precios de 0,14 y 0,28 dólares por millón de tokens, Flash encaja en clasificación, extracción y otros trabajos en los que el coste importa más que la calidad máxima.

Presupuesta el autoalojamiento con honestidad. Ocho GPU de la clase H200 son una compra o un alquiler serios. Autoaloja solo si necesitas que los datos se queden en tus propias máquinas, o si tu volumen hace que la API salga más cara que el hardware.

Revisa la licencia con tus abogados y después usa el modelo. MIT es una de las licencias más permisivas, lo que hace que MiMo-V2.6 sea fácil de ajustar con fine-tuning y de integrar en productos comerciales. Confirma que el archivo de licencia de la versión publicada coincide con lo que esperas.

Usa los entornos de entrenamiento aunque descartes el modelo. Los equipos que crean sus propios agentes pueden reutilizar los más de 7.000 entornos de tareas y el framework publicado para probar y entrenar otros modelos.

Fuentes

  1. Xiaomi releases MiMo-V2.6 Pro and Flash - DataNorth
  2. Xiaomi's MiMo-V2.6 Ships Open Weights at Frontier-Class Performance - Forkast
  3. MiMo-V2.6 Pro: Open Weights, Real Deployment Costs - LLM Rumors

Artículos relacionados