Qwen3.8-Flash-Next tiene 125.000 millones de parámetros pero solo usa 6.000
Alibaba publicó Qwen3.8-Flash-Next el 26 de agosto de 2026. Activa 6.000 de 125.000 millones de parámetros por token y cuesta 0,16 dólares por millón de tokens de entrada.
3 min de lectura

En cifras
- parameters active per token, out of 125B
- 6B
- per million input tokens on QwenCloud
- $0.16
- token context with YaRN extension
- 1M
El equipo Qwen de Alibaba publicó Qwen3.8-Flash-Next el 26 de agosto de 2026. El modelo contiene 125.000 millones de parámetros, pero solo usa 6.000 millones para cada token. Esa proporción explica por qué puede servirse a 0,16 dólares por millón de tokens de entrada, y por qué importa a quien vigila su factura de inferencia.
La publicación es un adelanto de la arquitectura que sostendrá a Qwen4, la próxima familia de modelos del equipo. Qwen publica los cambios de diseño antes de que salga la línea completa, para que la comunidad pueda examinarlos primero.
Por qué el modelo sigue siendo barato de ejecutar
Qwen3.8-Flash-Next es un modelo de mezcla de expertos. La red se divide en muchas secciones especializadas y un enrutador elige un subconjunto pequeño para cada token. El resto de los pesos queda inactivo, así que la factura de memoria es grande pero la de cómputo es pequeña.
El punto de control completo es mayor de lo que sugiere la cifra del titular. MarkTechPost lo desglosa en un armazón de 125.000 millones, una tabla de incrustaciones de n-gramas de 51.000 millones y un módulo de predicción multitoken de 4.000 millones, unos 180.000 millones de parámetros en disco.
Cuatro cambios de diseño sostienen esta versión, según el repositorio del propio equipo Qwen:
| Cambio | Qué hace |
|---|---|
| Gated DeltaNet + Qwen Sparse Attention | Tres de cada cuatro capas usan Gated DeltaNet; la cuarta, atención dispersa |
| Gated Residual | Cambia cómo pasa la señal entre capas |
| Incrustación de n-gramas | Una tabla de 20 millones de entradas que añade capacidad de forma barata |
| Optimizador Muon | Un optimizador de entrenamiento revisado |
La ventana de contexto es de 262.144 tokens de forma nativa. DataCamp y MarkTechPost coinciden en que se estira hasta cerca de 1 millón de tokens con YaRN, una técnica para extender un modelo más allá de la longitud con la que se entrenó.
Qwen también afirma que el entrenamiento costó alrededor de una novena parte que el de su antecesor Qwen3.7-Plus. Esa cifra procede de Qwen y ningún tercero la ha verificado.
Qué muestran las pruebas, y quién las hizo
Todas las puntuaciones siguientes proceden de las mediciones de la propia Alibaba. Ningún laboratorio independiente las ha confirmado.
| Prueba | Qwen3.8-Flash-Next | Claude Opus 4.6 Max |
|---|---|---|
| SWE-bench Pro | 62,5 | 53,4 |
| LiveCodeBench v6 | 91,9 | no facilitado |
| AndroidWorld | 84,5 | no facilitado |
| MathVision | 95,7 | no facilitado |
| Razonamiento | 35,9 | 40,0 |
El patrón resulta más útil que cualquier cifra suelta. El modelo lidera en programación y tareas de agente, y se queda atrás en razonamiento de frontera, donde MarkTechPost registra 35,9 frente a 40,0. La propia documentación de Qwen enumera limitaciones: el modelo se vuelve frágil en cadenas de agente largas y flojea en evaluaciones intensivas en conocimiento.
La licencia no es lo que "pesos abiertos" suele significar
Los pesos se descargan desde Hugging Face y ModelScope. El punto de control FP8 ocupa 172,78 GiB y la versión BF16, 335,28 GiB. Es una descarga de clase servidor, no de portátil.
Las condiciones merecen una lectura atenta. MarkTechPost informa de que la versión usa la licencia qwen-community-1.0, que exige una verificación antes del uso comercial. Es una distancia real respecto a Apache 2.0 o MIT, donde descargas y publicas. Aquí "pesos abiertos" significa que puedes inspeccionar y ejecutar el modelo, no que puedas desplegarlo comercialmente sin pedir permiso.
Qué significa esto para los desarrolladores
Calcula con los parámetros activos, no con el total. Un modelo de 125.000 millones que dispara 6.000 por token se comporta como uno pequeño en latencia y coste, y como uno grande en memoria. Si dimensionas hardware, el tamaño del punto de control fija cuántas GPU necesitas; el número activo fija el rendimiento.
Lee la licencia antes de construir sobre ella. Comprueba si el paso de verificación de qwen-community-1.0 se aplica a tu producto, y consigue esa respuesta antes de escribir el código de integración, no después. Es lo más caro de descubrir tarde.
No tomes la tabla de pruebas al pie de la letra. Las evaluaciones del fabricante eligen tareas favorables, y la lectura honesta aquí es la de un modelo fuerte en código y más débil en razonamiento. Pruébalo con tus propias tareas, sobre todo en cadenas de agente largas, donde el propio Qwen admite que es frágil.
El punto estratégico es la presión sobre los precios. A 0,16 dólares de entrada y 0,47 de salida por millón de tokens, esta clase de modelos abiertos de mezcla de expertos fija un suelo al que los modelos de frontera alojados tendrán que responder. Eso beneficia a cualquiera que pague una factura de inferencia, sea cual sea el modelo que acabe eligiendo.
Fuentes
Artículos relacionados

Los pesos de GLM-5.3 llegan con licencia propia y piden ocho GPU
Los pesos del modelo estrella GLM-5.3 de Z.ai están en Hugging Face tras un retraso por revisión de seguridad. La licencia no es MIT y el modelo necesita al menos ocho GPU de gama alta.

Z.ai e IBM lanzan modelos de razonamiento de pesos abiertos con un día de diferencia
Z.ai publicó GLM-5.3-Flash bajo licencia MIT con 320.000 millones de parámetros. IBM publicó Granite 4.2 bajo Apache 2.0, de 3B a 30B. Sirven para hardware muy distinto.

Ollama 0.33 permite a Claude Desktop ejecutar Qwen, DeepSeek y Kimi en local
Ollama 0.33.0 añade un proxy local que cambia el modelo detrás de la app Claude Desktop de Anthropic por uno abierto. Un intento en primavera fracasó por las comprobaciones del ID de modelo.