Skip to content
Tech AI Wire

Qwen3.8-Flash-Next tem 125 bilhões de parâmetros, mas roda só 6 bilhões

A Alibaba lançou o Qwen3.8-Flash-Next em 26 de agosto de 2026. Ele ativa 6 de 125 bilhões de parâmetros por token e custa US$ 0,16 por milhão de tokens de entrada.

Por Tech AI Wire Team

3 min de leitura

XLinkedIn
The Hugging Face model page for Qwen3.8-Flash-Next, showing its qwen-community-1.0 licence tag and parameter counts.

Em números

parameters active per token, out of 125B
6B
per million input tokens on QwenCloud
$0.16
token context with YaRN extension
1M

A equipe Qwen, da Alibaba, lançou o Qwen3.8-Flash-Next em 26 de agosto de 2026. O modelo guarda 125 bilhões de parâmetros, mas usa apenas 6 bilhões deles para cada token. Essa proporção explica por que ele pode ser servido a US$ 0,16 por milhão de tokens de entrada, e por que interessa a quem acompanha a conta de inferência.

O lançamento é uma prévia da arquitetura por trás do Qwen4, a próxima família de modelos da equipe. A Qwen publica as mudanças de projeto antes de a linha completa chegar, para que a comunidade possa examiná-las primeiro.

Por que o modelo continua barato de rodar

O Qwen3.8-Flash-Next é um modelo de mistura de especialistas. A rede é dividida em muitas seções especializadas, e um roteador escolhe um pequeno subconjunto para cada token. O restante dos pesos fica parado. A conta de memória, portanto, é grande, mas a de processamento é pequena.

O checkpoint completo é maior do que o número da manchete sugere. O MarkTechPost o divide em uma espinha dorsal de 125 bilhões, uma tabela de embeddings de n-gramas de 51 bilhões e um módulo de previsão de múltiplos tokens de 4 bilhões, cerca de 180 bilhões de parâmetros em disco.

Quatro mudanças de projeto sustentam este lançamento, segundo o repositório da própria equipe Qwen:

MudançaO que faz
Gated DeltaNet + Qwen Sparse AttentionTrês de cada quatro camadas usam Gated DeltaNet; a quarta usa atenção esparsa
Gated ResidualAltera como o sinal passa entre as camadas
Embedding de n-gramasUma tabela de 20 milhões de entradas que acrescenta capacidade de forma barata
Otimizador MuonUm otimizador de treino revisado

A janela de contexto é de 262.144 tokens de forma nativa. DataCamp e MarkTechPost relatam que ela se estende para cerca de 1 milhão de tokens com o YaRN, uma técnica para esticar um modelo além do comprimento com que foi treinado.

A Qwen também diz que o treino custou cerca de um nono do que custou o antecessor Qwen3.7-Plus. Esse número vem da Qwen, e nenhuma parte externa o verificou.

O que os benchmarks mostram, e quem os rodou

Todas as pontuações abaixo vêm das medições da própria Alibaba. Nenhum laboratório independente as confirmou.

BenchmarkQwen3.8-Flash-NextClaude Opus 4.6 Max
SWE-bench Pro62,553,4
LiveCodeBench v691,9não informado
AndroidWorld84,5não informado
MathVision95,7não informado
Raciocínio35,940,0

O padrão é mais útil do que qualquer número isolado. O modelo lidera em programação e tarefas de agente e fica para trás em raciocínio de fronteira, onde o MarkTechPost registra 35,9 contra 40,0. A própria documentação da Qwen lista limitações: o modelo fica frágil em cadeias longas de agente e vai pior em avaliações que exigem muito conhecimento.

A licença não é o que "pesos abertos" costuma significar

Os pesos podem ser baixados do Hugging Face e do ModelScope. O checkpoint FP8 tem 172,78 GiB e a versão BF16, 335,28 GiB. É um download de classe servidor, não de notebook.

Os termos merecem leitura cuidadosa. O MarkTechPost relata que o lançamento usa a licença qwen-community-1.0, que exige verificação antes do uso comercial. Isso é uma distância real em relação a Apache 2.0 ou MIT, em que você baixa e publica. Aqui "pesos abertos" quer dizer que você pode inspecionar e rodar o modelo, não que possa implantá-lo comercialmente sem pedir.

O que isso significa para os desenvolvedores

Faça a conta pelos parâmetros ativos, não pelo total. Um modelo de 125 bilhões que dispara 6 bilhões por token se comporta como um modelo pequeno em latência e custo, e como um grande em memória. Se você está dimensionando hardware, o tamanho do checkpoint define a quantidade de GPUs; o número ativo define a vazão.

Leia a licença antes de construir em cima. Verifique se a etapa de verificação da qwen-community-1.0 se aplica ao seu produto, e obtenha essa resposta antes de escrever o código de integração, não depois. Essa é a descoberta mais cara de se fazer tarde.

Não tome a tabela de benchmarks ao pé da letra. Avaliações feitas pelo fornecedor escolhem tarefas favoráveis, e a leitura honesta aqui é a de um modelo forte em código e mais fraco em raciocínio. Rode-o nas suas próprias tarefas, especialmente em cadeias longas de agente, onde a própria Qwen admite que ele é frágil.

O ponto estratégico é a pressão de preço. A US$ 0,16 de entrada e US$ 0,47 de saída por milhão de tokens, essa classe de modelos abertos de mistura de especialistas estabelece um piso ao qual os modelos de fronteira hospedados terão de responder. Isso é bom para qualquer um que pague uma conta de inferência, seja qual for o modelo que acabe escolhendo.

Fontes

  1. Qwen3.8-Flash-Next - GitHub - QwenLM
  2. Alibaba's Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture - MarkTechPost
  3. Qwen3.8-Flash-Next: Features, Benchmarks, and Pricing - DataCamp

Artigos relacionados