Skip to content

Qwen3.8-Omni-Flash réduit de 98 % le coût de l'audio

Le nouveau modèle omnimodal d'Alibaba lit texte, images, audio et vidéo dans un contexte d'un million de jetons, et baisse de plus de 98 % le prix de l'audio en entrée.

Par Tech AI Wire Team

3 min de lecture

XLinkedIn
Glass office blocks around a lawn in the courtyard of Alibaba Group's headquarters campus in Hangzhou, China.
Photo: Danielinblue

En chiffres

token context window, with up to 991K input tokens
1M
per million text input tokens
$0.15
languages supported
113
Input price cuts versus Qwen3.5-Omni-Plus
Audio
98%
Audio-visual
93%
Video
89%

Alibaba a publié Qwen3.8-Omni-Flash le 18 septembre 2026, un modèle qui accepte du texte, des images, de l'audio et de la vidéo, et répond en texte. Le prix est l'information principale. Comparé à Qwen3.5-Omni-Plus, l'audio en entrée coûte plus de 98 % de moins par heure, l'entrée audiovisuelle plus de 93 % de moins et la vidéo environ 89 % de moins, selon MarkTechPost et AlphaSignal.

Omnimodal signifie qu'un seul modèle traite nativement plusieurs types d'entrée, au lieu d'une chaîne qui transcrit d'abord l'audio puis lit la transcription. Le texte coûte 0,15 dollar par million de jetons en entrée et 0,47 dollar par million en sortie, l'entrée en cache revenant à 0,016 dollar par million.

Ce qu'il accepte

LimiteValeur
Fenêtre de contexte1M de jetons, jusqu'à 991K en entrée et 131K en sortie
Longueur de raisonnementJusqu'à 262K jetons
VidéoJusqu'à 2 heures, 2 Go, échantillonnée jusqu'à 15 images par seconde
AudioJusqu'à 3 heures
Langues113

La disponibilité est le point délicat pour qui appréciait la version précédente. Celle-ci passe uniquement par l'API, via QwenCloud, Alibaba Cloud Model Studio et Qwen Studio, sans poids ouverts annoncés. C'est un changement de posture par rapport à Qwen3.8-Flash-Next, publié avec des poids ouverts en août 2026 et qui fournit ici l'architecture.

Cette architecture est un mélange d'experts. Le réseau contient environ 125 milliards de paramètres répartis sur 512 experts, mais n'en active qu'environ 6 milliards par jeton, aux côtés d'une table d'embeddings de 51 milliards de paramètres. Cette conception explique qu'un modèle de cette taille puisse être facturé comme un petit.

Perception agentique et économie de jetons

L'affirmation la plus intéressante porte sur la façon dont le modèle regarde une vidéo. Plutôt que d'échantillonner des images à intervalle fixe, il inspecte la source en deux passes : un balayage grossier pour trouver le passage pertinent, puis un examen rapproché de ce passage. AlphaSignal parle de perception agentique et cite Qwen, pour qui il s'agit du "premier modèle de sa famille à intégrer la perception omnimodale dans un flux de travail d'agent".

Les économies annoncées varient selon le test, les deux chiffres méritent donc d'être cités. MarkTechPost rapporte une tâche passant de 145 736 à 79 117 jetons, soit une réduction de 45,7 %. AlphaSignal cite 51,8 % de jetons en moins sur OmniVideoBench, avec un gain agentique moyen de 19,5 points par rapport au modèle précédent. BenchLM, qui suit les résultats publiés, note ne disposer de résultats que pour 19 de ses 446 tests et ne publie pas encore de score global.

Alibaba a aussi publié Qwen-MM-Plugins sous licence Apache 2.0. Cette boîte à outils ajoute de la mémoire, la conversion de vidéo en notes et des fonctions d'édition, et vise à brancher les entrées multimodales sur des cadres d'agents existants comme Claude Code et Gemini CLI. Le raisonnement étendu est actif par défaut au réglage le plus élevé, et peut être désactivé.

Ce que cela signifie pour les développeurs

Des changements de prix de cette ampleur changent ce qu'il vaut la peine de construire. Transcrire un appel d'assistance, résumer une réunion enregistrée ou passer en revue des images de surveillance étaient des projets où la facture du modèle décidait de l'architecture. À moins d'un dollar pour un grand lot de jetons de texte, et avec l'audio en baisse de 98 %, le calcul penche vers l'envoi direct du média.

Vérifiez toutefois le calcul des jetons avant de croire un devis. L'audio et la vidéo consomment des jetons à des rythmes qui dépendent de la durée, de la cadence d'images et de la part de la source que le modèle décide d'examiner de près. La perception agentique signifie que le nombre de jetons varie avec le contenu. Mesurez votre pire cas plutôt qu'une moyenne.

La publication uniquement par API est la vraie contrainte pour les équipes soumises à des règles sur la localisation des données. L'audio et la vidéo sont précisément les entrées porteuses d'informations personnelles, et ce modèle tourne sur le cloud d'Alibaba. Si votre dernier déploiement Qwen reposait sur des poids locaux, ce n'est pas un successeur direct. La couverture des tests reste mince : traitez les chiffres agentiques comme des données du fournisseur jusqu'à ce que des évaluations indépendantes les complètent.

Sources

  1. Alibaba Qwen Releases Qwen3.8-Omni-Flash: A 1M-Context Omni-Modal Model Built Around Agentic Audio-Video Understanding and Tool Use - MarkTechPost
  2. Alibaba's Qwen3.8-Omni-Flash Cuts Video AI Costs by 89% With Agent Tool Use - AlphaSignal
  3. Qwen3.8-Omni-Flash Benchmarks & Context (September 2026) - BenchLM

Articles liés