Qwen3.5-9B gasta 32 KB por token no cache KV
O Qwen3.5-9B usa atenção completa em apenas 8 das suas 32 camadas, então o cache KV custa 32 KB por token. Essa proporção decide se ele cabe em 8 GB.
3 min de leitura

Em números
- layers that use full attention
- 8 of 32
- KV cache per token
- 32KB
- native context length in tokens
- 262,144
O Qwen3.5-9B, da Alibaba, usa atenção completa em apenas 8 das suas 32 camadas. As outras 24 usam um método linear cujo custo de memória não cresce com a conversa. É essa divisão que permite a um modelo de 9 bilhões de parâmetros manter uma conversa longa em uma placa de vídeo de 8 GB.
O modelo saiu em fevereiro de 2026 sob a licença Apache 2.0. A maior parte da cobertura tratou das suas notas em testes. O VentureBeat noticiou que ele marcou 81,7 no GPQA Diamond, um teste de raciocínio científico de nível de pós-graduação, à frente do gpt-oss-120b da OpenAI, com 80,1. Para quem roda o modelo no próprio equipamento, o arranjo das camadas importa mais que a nota.
O que é um cache KV e por que ele cresce
Um modelo de linguagem relê a conversa inteira antes de escrever cada palavra nova. Refazer esse trabalho todas as vezes seria lento. Por isso o modelo guarda valores intermediários, chamados chaves e valores, em um depósito conhecido como cache KV.
Os pesos de um modelo são um custo fixo. O cache KV não é. Ele cresce com cada token da conversa.
Em uma máquina com 8 GB de memória, essa diferença decide muita coisa. Um arquivo de modelo pode carregar sem problema e ainda assim ficar sem espaço quando a conversa se alonga. Quando isso acontece, o software normalmente move camadas para o processador principal em vez de falhar, e a velocidade cai bastante.
Como o Qwen3.5-9B divide as suas camadas
O cartão do modelo Qwen3.5-9B descreve a pilha como 8 repetições de um bloco de 4 camadas. Três camadas de cada bloco usam Gated DeltaNet, um método de atenção linear. A quarta usa atenção completa com porta.
A atenção linear mantém um estado corrente de tamanho fixo. Ele não cresce quando o texto fica mais longo. Então essas 24 camadas custam o mesmo com 4.000 tokens e com 200.000.
Só as 8 camadas de atenção completa mantêm um cache que cresce. O cartão do modelo dá a forma delas: 4 cabeças de chave-valor, cada uma com 256 dimensões de largura.
Isso já basta para calcular o custo por token. Multiplique as 8 camadas por 2, porque chaves e valores são ambos guardados, depois por 4 cabeças, depois por 256 dimensões, depois por 2 bytes por valor. O resultado é 32.768 bytes, ou seja, 32 KB para cada token da conversa.
Quanto isso custa em comprimentos de contexto reais
O cartão do modelo indica um comprimento de contexto nativo de 262.144 tokens, extensível para cerca de 1.010.000. A 32 KB por token, o custo do cache em cada comprimento é aritmética simples.
A segunda coluna abaixo mostra quanto custaria o mesmo modelo se todas as 32 camadas usassem atenção completa em vez de 8. É uma hipótese, incluída para mostrar o tamanho da economia.
| Comprimento de contexto | Cache KV do Qwen3.5-9B | Se as 32 camadas usassem atenção completa |
|---|---|---|
| 8.192 tokens | 0,25 GiB | 1,0 GiB |
| 32.768 tokens | 1,0 GiB | 4,0 GiB |
| 131.072 tokens | 4,0 GiB | 16,0 GiB |
| 262.144 tokens | 8,0 GiB | 32,0 GiB |
O projeto economiza quatro vezes a memória de cache em todos os comprimentos. Em uma placa de 8 GB que guarda cerca de 6,6 GB de pesos de 4 bits, essa é a diferença entre uma conversa de 32.000 tokens e uma de 4.000.
Desde então a Qwen levou a mesma ideia mais longe. O lançamento do Qwen3.8-Flash-Next também usa Gated DeltaNet em três de cada quatro camadas, ao lado de um projeto de especialistas esparsos.
O que isso significa para desenvolvedores
A contagem de parâmetros é um guia ruim para saber se um modelo cabe em uma dada quantidade de memória. Dois modelos do mesmo tamanho podem diferir em quatro vezes ou mais só no custo do cache. Verifique o arranjo das camadas antes de confiar em uma estimativa de tamanho.
Os números a procurar estão na configuração publicada do modelo: quantas camadas usam atenção completa, quantas cabeças de chave-valor cada uma tem e qual é a largura de cada cabeça. Esses três números, vezes dois para chaves e valores e vezes dois para armazenamento de 16 bits, dão o custo por token. Depois multiplique pelo comprimento de contexto que você realmente pretende usar.
Reserve orçamento para o cache antes de escolher uma janela de contexto. Um erro comum é colocar o contexto no máximo do modelo só porque o máximo está disponível. A maioria dos ambientes locais aceita um ajuste que não cabe e depois move trabalho para o processador em silêncio, o que parece uma lentidão misteriosa e não um erro.
Cortar o cache pela metade também é uma opção. A maioria dos ambientes consegue guardar o cache com precisão de 8 bits em vez de 16, o que reduz à metade os números da tabela acima com uma perda pequena de qualidade. Em uma máquina de 8 GB, esse costuma ser o ajuste que transforma um modelo de inutilizável em confortável.
Fontes
Artigos relacionados

Qwen3.8-Flash-Next tem 125 bilhões de parâmetros, mas roda só 6 bilhões
A Alibaba lançou o Qwen3.8-Flash-Next em 26 de agosto de 2026. Ele ativa 6 de 125 bilhões de parâmetros por token e custa US$ 0,16 por milhão de tokens de entrada.

Ollama 0.33 deixa o Claude Desktop rodar Qwen, DeepSeek e Kimi localmente
O Ollama 0.33.0 adiciona um proxy local que troca o modelo por trás do app Claude Desktop, da Anthropic, por um modelo aberto. Uma tentativa na primavera falhou em checagens de ID de modelo.

Salesforce Koa parte de pesos abertos mas sai fechado
A Salesforce diz que o Koa comete três vezes menos erros no seu próprio CRM Bench, mas os pesos são proprietários e o modelo só roda na infraestrutura dela.