Skip to content
Tech AI Wire

Qwen3.8-Flash-Next tiene 125.000 millones de parámetros pero solo usa 6.000

Alibaba publicó Qwen3.8-Flash-Next el 26 de agosto de 2026. Activa 6.000 de 125.000 millones de parámetros por token y cuesta 0,16 dólares por millón de tokens de entrada.

Por Tech AI Wire Team

3 min de lectura

XLinkedIn
The Hugging Face model page for Qwen3.8-Flash-Next, showing its qwen-community-1.0 licence tag and parameter counts.

En cifras

parameters active per token, out of 125B
6B
per million input tokens on QwenCloud
$0.16
token context with YaRN extension
1M

El equipo Qwen de Alibaba publicó Qwen3.8-Flash-Next el 26 de agosto de 2026. El modelo contiene 125.000 millones de parámetros, pero solo usa 6.000 millones para cada token. Esa proporción explica por qué puede servirse a 0,16 dólares por millón de tokens de entrada, y por qué importa a quien vigila su factura de inferencia.

La publicación es un adelanto de la arquitectura que sostendrá a Qwen4, la próxima familia de modelos del equipo. Qwen publica los cambios de diseño antes de que salga la línea completa, para que la comunidad pueda examinarlos primero.

Por qué el modelo sigue siendo barato de ejecutar

Qwen3.8-Flash-Next es un modelo de mezcla de expertos. La red se divide en muchas secciones especializadas y un enrutador elige un subconjunto pequeño para cada token. El resto de los pesos queda inactivo, así que la factura de memoria es grande pero la de cómputo es pequeña.

El punto de control completo es mayor de lo que sugiere la cifra del titular. MarkTechPost lo desglosa en un armazón de 125.000 millones, una tabla de incrustaciones de n-gramas de 51.000 millones y un módulo de predicción multitoken de 4.000 millones, unos 180.000 millones de parámetros en disco.

Cuatro cambios de diseño sostienen esta versión, según el repositorio del propio equipo Qwen:

CambioQué hace
Gated DeltaNet + Qwen Sparse AttentionTres de cada cuatro capas usan Gated DeltaNet; la cuarta, atención dispersa
Gated ResidualCambia cómo pasa la señal entre capas
Incrustación de n-gramasUna tabla de 20 millones de entradas que añade capacidad de forma barata
Optimizador MuonUn optimizador de entrenamiento revisado

La ventana de contexto es de 262.144 tokens de forma nativa. DataCamp y MarkTechPost coinciden en que se estira hasta cerca de 1 millón de tokens con YaRN, una técnica para extender un modelo más allá de la longitud con la que se entrenó.

Qwen también afirma que el entrenamiento costó alrededor de una novena parte que el de su antecesor Qwen3.7-Plus. Esa cifra procede de Qwen y ningún tercero la ha verificado.

Qué muestran las pruebas, y quién las hizo

Todas las puntuaciones siguientes proceden de las mediciones de la propia Alibaba. Ningún laboratorio independiente las ha confirmado.

PruebaQwen3.8-Flash-NextClaude Opus 4.6 Max
SWE-bench Pro62,553,4
LiveCodeBench v691,9no facilitado
AndroidWorld84,5no facilitado
MathVision95,7no facilitado
Razonamiento35,940,0

El patrón resulta más útil que cualquier cifra suelta. El modelo lidera en programación y tareas de agente, y se queda atrás en razonamiento de frontera, donde MarkTechPost registra 35,9 frente a 40,0. La propia documentación de Qwen enumera limitaciones: el modelo se vuelve frágil en cadenas de agente largas y flojea en evaluaciones intensivas en conocimiento.

La licencia no es lo que "pesos abiertos" suele significar

Los pesos se descargan desde Hugging Face y ModelScope. El punto de control FP8 ocupa 172,78 GiB y la versión BF16, 335,28 GiB. Es una descarga de clase servidor, no de portátil.

Las condiciones merecen una lectura atenta. MarkTechPost informa de que la versión usa la licencia qwen-community-1.0, que exige una verificación antes del uso comercial. Es una distancia real respecto a Apache 2.0 o MIT, donde descargas y publicas. Aquí "pesos abiertos" significa que puedes inspeccionar y ejecutar el modelo, no que puedas desplegarlo comercialmente sin pedir permiso.

Qué significa esto para los desarrolladores

Calcula con los parámetros activos, no con el total. Un modelo de 125.000 millones que dispara 6.000 por token se comporta como uno pequeño en latencia y coste, y como uno grande en memoria. Si dimensionas hardware, el tamaño del punto de control fija cuántas GPU necesitas; el número activo fija el rendimiento.

Lee la licencia antes de construir sobre ella. Comprueba si el paso de verificación de qwen-community-1.0 se aplica a tu producto, y consigue esa respuesta antes de escribir el código de integración, no después. Es lo más caro de descubrir tarde.

No tomes la tabla de pruebas al pie de la letra. Las evaluaciones del fabricante eligen tareas favorables, y la lectura honesta aquí es la de un modelo fuerte en código y más débil en razonamiento. Pruébalo con tus propias tareas, sobre todo en cadenas de agente largas, donde el propio Qwen admite que es frágil.

El punto estratégico es la presión sobre los precios. A 0,16 dólares de entrada y 0,47 de salida por millón de tokens, esta clase de modelos abiertos de mezcla de expertos fija un suelo al que los modelos de frontera alojados tendrán que responder. Eso beneficia a cualquiera que pague una factura de inferencia, sea cual sea el modelo que acabe eligiendo.

Fuentes

  1. Qwen3.8-Flash-Next - GitHub - QwenLM
  2. Alibaba's Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture - MarkTechPost
  3. Qwen3.8-Flash-Next: Features, Benchmarks, and Pricing - DataCamp

Artículos relacionados