Skip to content
Tech AI Wire
AI & LLMsExplicación

Qwen3.5-9B gasta 32 KB por token en la caché KV

Qwen3.5-9B usa atención completa en solo 8 de sus 32 capas, así que su caché KV cuesta 32 KB por token. Esa proporción decide si cabe en 8 GB.

Por Tech AI Wire Team

3 min de lectura

XLinkedIn
A GeForce graphics card with two fans standing on a plain gray studio backdrop, the GeForce logo on its shroud.

En cifras

layers that use full attention
8 of 32
KV cache per token
32KB
native context length in tokens
262,144

El Qwen3.5-9B de Alibaba usa atención completa en solo 8 de sus 32 capas. Las otras 24 emplean un método lineal cuyo coste en memoria no crece con la conversación. Ese reparto es la razón por la que un modelo de 9.000 millones de parámetros puede sostener una charla larga en una tarjeta gráfica de 8 GB.

El modelo se publicó en febrero de 2026 con licencia Apache 2.0. La mayoría de la cobertura se centró en sus puntuaciones. VentureBeat informó de que obtuvo 81,7 en GPQA Diamond, una prueba de razonamiento científico de nivel de posgrado, por delante del gpt-oss-120b de OpenAI con 80,1. Para quien ejecute el modelo en su propio equipo, la disposición de las capas importa más que la puntuación.

Qué es una caché KV y por qué crece

Un modelo de lenguaje vuelve a leer toda la conversación antes de escribir cada palabra nueva. Repetir ese trabajo cada vez sería lento. Así que el modelo guarda valores intermedios, llamados claves y valores, en un almacén conocido como caché KV.

Los pesos de un modelo son un coste fijo. La caché KV no lo es. Crece con cada token de la conversación.

En una máquina con 8 GB de memoria, esa diferencia decide mucho. Un archivo de modelo puede cargarse sin problemas y quedarse igualmente sin espacio en cuanto la charla se alarga. Cuando eso pasa, el software suele mover capas al procesador principal en lugar de fallar, y la velocidad cae con fuerza.

Cómo reparte Qwen3.5-9B sus capas

La ficha del modelo Qwen3.5-9B describe la pila como 8 repeticiones de un bloque de 4 capas. Tres capas de cada bloque usan Gated DeltaNet, un método de atención lineal. La cuarta usa atención completa con puerta.

La atención lineal mantiene un estado en curso de tamaño fijo. No crece cuando el texto se alarga. Así que esas 24 capas cuestan lo mismo con 4.000 tokens que con 200.000.

Solo las 8 capas de atención completa mantienen una caché que crece. La ficha del modelo da su forma: 4 cabezas de clave-valor, cada una de 256 dimensiones de ancho.

Con eso basta para calcular el coste por token. Multiplique las 8 capas por 2, porque se guardan tanto las claves como los valores, luego por 4 cabezas, luego por 256 dimensiones, luego por 2 bytes por valor. El resultado son 32.768 bytes, es decir, 32 KB por cada token de la conversación.

Cuánto cuesta con longitudes de contexto reales

La ficha del modelo indica una longitud de contexto nativa de 262.144 tokens, ampliable a unos 1.010.000. A 32 KB por token, el coste de la caché en cada longitud es aritmética sencilla.

La segunda columna de abajo muestra lo que costaría el mismo modelo si sus 32 capas usaran atención completa en vez de 8. Es un supuesto, incluido para mostrar el tamaño del ahorro.

Longitud de contextoCaché KV de Qwen3.5-9BSi las 32 capas usaran atención completa
8.192 tokens0,25 GiB1,0 GiB
32.768 tokens1,0 GiB4,0 GiB
131.072 tokens4,0 GiB16,0 GiB
262.144 tokens8,0 GiB32,0 GiB

El diseño ahorra cuatro veces la memoria de caché en todas las longitudes. En una tarjeta de 8 GB que aloja unos 6,6 GB de pesos de 4 bits, esa es la diferencia entre una conversación de 32.000 tokens y una de 4.000.

Qwen ha llevado desde entonces la misma idea más lejos. Su lanzamiento Qwen3.8-Flash-Next también usa Gated DeltaNet en tres de cada cuatro capas, junto a un diseño de expertos dispersos.

Qué significa esto para los desarrolladores

El número de parámetros es una guía pobre para saber si un modelo cabe en una cantidad de memoria dada. Dos modelos del mismo tamaño pueden diferir en cuatro veces o más solo en el coste de la caché. Compruebe la disposición de las capas antes de fiarse de una estimación de tamaño.

Los números que hay que buscar están en la configuración publicada del modelo: cuántas capas usan atención completa, cuántas cabezas de clave-valor tiene cada una y qué ancho tiene cada cabeza. Esos tres números, por dos para las claves y los valores y por dos para el almacenamiento de 16 bits, dan el coste por token. Multiplique por la longitud de contexto que piense usar de verdad.

Presupueste la caché antes de elegir una ventana de contexto. Un error común es fijar el contexto en el máximo del modelo porque el máximo está disponible. La mayoría de los entornos locales aceptan un ajuste que no cabe y luego mueven trabajo al procesador en silencio, lo que parece una ralentización misteriosa y no un error.

Reducir la caché a la mitad también es una opción. La mayoría de los entornos pueden guardar la caché con precisión de 8 bits en vez de 16, lo que reduce a la mitad las cifras de la tabla de arriba con una pérdida pequeña de calidad. En una máquina de 8 GB, ese es a menudo el ajuste que convierte un modelo de inservible en cómodo.

Fuentes

  1. Qwen/Qwen3.5-9B model card - Hugging Face
  2. Alibaba's small, open source Qwen3.5-9B beats OpenAI's gpt-oss-120B and can run on standard laptops - VentureBeat

Artículos relacionados