Skip to content

Qwen3.8-Omni-Flash corta 98% do custo de áudio

O novo modelo omnimodal da Alibaba lê texto, imagens, áudio e vídeo num contexto de um milhão de tokens, e reduz em mais de 98% o preço do áudio de entrada.

Por Tech AI Wire Team

3 min de leitura

XLinkedIn
Glass office blocks around a lawn in the courtyard of Alibaba Group's headquarters campus in Hangzhou, China.
Foto: Danielinblue

Em números

token context window, with up to 991K input tokens
1M
per million text input tokens
$0.15
languages supported
113
Input price cuts versus Qwen3.5-Omni-Plus
Audio
98%
Audio-visual
93%
Video
89%

A Alibaba lançou o Qwen3.8-Omni-Flash em 18 de setembro de 2026, um modelo que aceita texto, imagens, áudio e vídeo, e responde em texto. O preço é o destaque. Em comparação com o Qwen3.5-Omni-Plus, o áudio de entrada custa mais de 98% menos por hora, a entrada audiovisual mais de 93% menos e o vídeo cerca de 89% menos, segundo MarkTechPost e AlphaSignal.

Omnimodal significa que um único modelo trata vários tipos de entrada de forma nativa, em vez de uma cadeia que primeiro transcreve o áudio e depois lê a transcrição. O texto custa 0,15 dólar por milhão de tokens de entrada e 0,47 dólar por milhão de saída, com entrada em cache a 0,016 dólar por milhão.

O que ele aceita

LimiteValor
Janela de contexto1M de tokens, até 991K de entrada e 131K de saída
Comprimento de raciocínioAté 262K tokens
VídeoAté 2 horas, 2 GB, amostrado até 15 quadros por segundo
ÁudioAté 3 horas
Idiomas113

A disponibilidade é o ponto incômodo para quem gostou da versão anterior. Esta vem somente por API, pelo QwenCloud, Alibaba Cloud Model Studio e Qwen Studio, sem pesos abertos anunciados. É uma mudança de postura em relação ao Qwen3.8-Flash-Next, que saiu com pesos abertos em agosto de 2026 e fornece aqui a arquitetura.

Essa arquitetura é uma mistura de especialistas. A rede guarda cerca de 125 bilhões de parâmetros distribuídos em 512 especialistas, mas ativa apenas cerca de 6 bilhões por token, ao lado de uma tabela de embeddings de 51 bilhões de parâmetros. Esse desenho explica por que um modelo tão grande pode ser cobrado como um pequeno.

Percepção agêntica e economia de tokens

A afirmação mais interessante é sobre como o modelo assiste ao vídeo. Em vez de amostrar quadros em intervalos fixos, ele inspeciona a fonte em duas passagens: uma varredura grosseira para achar o trecho relevante e depois um olhar detalhado nesse trecho. A AlphaSignal descreve isso como percepção agêntica e cita a Qwen, para quem este é "o primeiro modelo da família a tornar a percepção omnimodal parte de um fluxo de trabalho de agente".

As economias relatadas variam conforme o teste, então vale citar os dois números. A MarkTechPost relata uma tarefa que caiu de 145.736 para 79.117 tokens, uma redução de 45,7%. A AlphaSignal cita 51,8% menos tokens no OmniVideoBench, com ganho agêntico médio de 19,5 pontos sobre o modelo anterior. A BenchLM, que acompanha resultados publicados, observa ter dados de apenas 19 dos seus 446 testes e ainda não publica uma pontuação geral.

A Alibaba também lançou os Qwen-MM-Plugins sob licença Apache 2.0. O conjunto acrescenta memória, conversão de vídeo em notas e funções de edição, e serve para ligar entradas multimodais a frameworks de agentes existentes, como Claude Code e Gemini CLI. O raciocínio estendido vem ativo por padrão no nível mais alto e pode ser desligado.

O que isso significa para desenvolvedores

Mudanças de preço desse tamanho mudam o que vale a pena construir. Transcrever uma ligação de suporte, resumir uma reunião gravada ou varrer imagens de segurança eram projetos em que a conta do modelo decidia o desenho. Com menos de um dólar por um lote grande de tokens de texto, e o áudio 98% mais barato, a conta pende para simplesmente enviar a mídia.

Ainda assim, confira a matemática dos tokens antes de confiar em um orçamento. Áudio e vídeo consomem tokens em ritmos que dependem da duração, da taxa de quadros e de quanto da fonte o modelo decide examinar de perto. Percepção agêntica significa que a contagem varia com o conteúdo, então meça o seu pior caso em vez de uma média.

O lançamento apenas por API é a restrição real para times com regras sobre onde os dados ficam. Áudio e vídeo são justamente as entradas que carregam informação pessoal, e este modelo roda na nuvem da Alibaba. Se a sua última implantação do Qwen dependia de pesos locais, este não é um sucessor direto. A cobertura de testes ainda é rala, então trate os números agênticos como dados do fornecedor até que avaliações independentes os completem.

Fontes

  1. Alibaba Qwen Releases Qwen3.8-Omni-Flash: A 1M-Context Omni-Modal Model Built Around Agentic Audio-Video Understanding and Tool Use - MarkTechPost
  2. Alibaba's Qwen3.8-Omni-Flash Cuts Video AI Costs by 89% With Agent Tool Use - AlphaSignal
  3. Qwen3.8-Omni-Flash Benchmarks & Context (September 2026) - BenchLM

Artigos relacionados