Qwen3.8-Flash-Next tem 125 bilhões de parâmetros, mas roda só 6 bilhões
A Alibaba lançou o Qwen3.8-Flash-Next em 26 de agosto de 2026. Ele ativa 6 de 125 bilhões de parâmetros por token e custa US$ 0,16 por milhão de tokens de entrada.
3 min de leitura

Em números
- parameters active per token, out of 125B
- 6B
- per million input tokens on QwenCloud
- $0.16
- token context with YaRN extension
- 1M
A equipe Qwen, da Alibaba, lançou o Qwen3.8-Flash-Next em 26 de agosto de 2026. O modelo guarda 125 bilhões de parâmetros, mas usa apenas 6 bilhões deles para cada token. Essa proporção explica por que ele pode ser servido a US$ 0,16 por milhão de tokens de entrada, e por que interessa a quem acompanha a conta de inferência.
O lançamento é uma prévia da arquitetura por trás do Qwen4, a próxima família de modelos da equipe. A Qwen publica as mudanças de projeto antes de a linha completa chegar, para que a comunidade possa examiná-las primeiro.
Por que o modelo continua barato de rodar
O Qwen3.8-Flash-Next é um modelo de mistura de especialistas. A rede é dividida em muitas seções especializadas, e um roteador escolhe um pequeno subconjunto para cada token. O restante dos pesos fica parado. A conta de memória, portanto, é grande, mas a de processamento é pequena.
O checkpoint completo é maior do que o número da manchete sugere. O MarkTechPost o divide em uma espinha dorsal de 125 bilhões, uma tabela de embeddings de n-gramas de 51 bilhões e um módulo de previsão de múltiplos tokens de 4 bilhões, cerca de 180 bilhões de parâmetros em disco.
Quatro mudanças de projeto sustentam este lançamento, segundo o repositório da própria equipe Qwen:
| Mudança | O que faz |
|---|---|
| Gated DeltaNet + Qwen Sparse Attention | Três de cada quatro camadas usam Gated DeltaNet; a quarta usa atenção esparsa |
| Gated Residual | Altera como o sinal passa entre as camadas |
| Embedding de n-gramas | Uma tabela de 20 milhões de entradas que acrescenta capacidade de forma barata |
| Otimizador Muon | Um otimizador de treino revisado |
A janela de contexto é de 262.144 tokens de forma nativa. DataCamp e MarkTechPost relatam que ela se estende para cerca de 1 milhão de tokens com o YaRN, uma técnica para esticar um modelo além do comprimento com que foi treinado.
A Qwen também diz que o treino custou cerca de um nono do que custou o antecessor Qwen3.7-Plus. Esse número vem da Qwen, e nenhuma parte externa o verificou.
O que os benchmarks mostram, e quem os rodou
Todas as pontuações abaixo vêm das medições da própria Alibaba. Nenhum laboratório independente as confirmou.
| Benchmark | Qwen3.8-Flash-Next | Claude Opus 4.6 Max |
|---|---|---|
| SWE-bench Pro | 62,5 | 53,4 |
| LiveCodeBench v6 | 91,9 | não informado |
| AndroidWorld | 84,5 | não informado |
| MathVision | 95,7 | não informado |
| Raciocínio | 35,9 | 40,0 |
O padrão é mais útil do que qualquer número isolado. O modelo lidera em programação e tarefas de agente e fica para trás em raciocínio de fronteira, onde o MarkTechPost registra 35,9 contra 40,0. A própria documentação da Qwen lista limitações: o modelo fica frágil em cadeias longas de agente e vai pior em avaliações que exigem muito conhecimento.
A licença não é o que "pesos abertos" costuma significar
Os pesos podem ser baixados do Hugging Face e do ModelScope. O checkpoint FP8 tem 172,78 GiB e a versão BF16, 335,28 GiB. É um download de classe servidor, não de notebook.
Os termos merecem leitura cuidadosa. O MarkTechPost relata que o lançamento usa a licença qwen-community-1.0, que exige verificação antes do uso comercial. Isso é uma distância real em relação a Apache 2.0 ou MIT, em que você baixa e publica. Aqui "pesos abertos" quer dizer que você pode inspecionar e rodar o modelo, não que possa implantá-lo comercialmente sem pedir.
O que isso significa para os desenvolvedores
Faça a conta pelos parâmetros ativos, não pelo total. Um modelo de 125 bilhões que dispara 6 bilhões por token se comporta como um modelo pequeno em latência e custo, e como um grande em memória. Se você está dimensionando hardware, o tamanho do checkpoint define a quantidade de GPUs; o número ativo define a vazão.
Leia a licença antes de construir em cima. Verifique se a etapa de verificação da qwen-community-1.0 se aplica ao seu produto, e obtenha essa resposta antes de escrever o código de integração, não depois. Essa é a descoberta mais cara de se fazer tarde.
Não tome a tabela de benchmarks ao pé da letra. Avaliações feitas pelo fornecedor escolhem tarefas favoráveis, e a leitura honesta aqui é a de um modelo forte em código e mais fraco em raciocínio. Rode-o nas suas próprias tarefas, especialmente em cadeias longas de agente, onde a própria Qwen admite que ele é frágil.
O ponto estratégico é a pressão de preço. A US$ 0,16 de entrada e US$ 0,47 de saída por milhão de tokens, essa classe de modelos abertos de mistura de especialistas estabelece um piso ao qual os modelos de fronteira hospedados terão de responder. Isso é bom para qualquer um que pague uma conta de inferência, seja qual for o modelo que acabe escolhendo.
Fontes
Artigos relacionados

Pesos do GLM-5.3 saem com licença própria e exigem oito GPUs
Os pesos do modelo principal GLM-5.3 da Z.ai estão no Hugging Face após atraso por revisão de segurança. A licença não é MIT e o modelo precisa de pelo menos oito GPUs de ponta.

Z.ai e IBM lançam modelos de raciocínio de pesos abertos com um dia de diferença
A Z.ai lançou o GLM-5.3-Flash sob licença MIT com 320B de parâmetros. A IBM lançou o Granite 4.2 sob Apache 2.0, de 3B a 30B. Eles servem hardwares muito diferentes.

Ollama 0.33 deixa o Claude Desktop rodar Qwen, DeepSeek e Kimi localmente
O Ollama 0.33.0 adiciona um proxy local que troca o modelo por trás do app Claude Desktop, da Anthropic, por um modelo aberto. Uma tentativa na primavera falhou em checagens de ID de modelo.