Qwen3.8-Flash-Next contient 125 milliards de paramètres mais n'en active que 6
Alibaba a publié Qwen3.8-Flash-Next le 26 août 2026. Le modèle active 6 des 125 milliards de paramètres par jeton et coûte 0,16 dollar par million de jetons d'entrée.
3 min de lecture

En chiffres
- parameters active per token, out of 125B
- 6B
- per million input tokens on QwenCloud
- $0.16
- token context with YaRN extension
- 1M
L'équipe Qwen d'Alibaba a publié Qwen3.8-Flash-Next le 26 août 2026. Le modèle contient 125 milliards de paramètres, mais n'en utilise que 6 milliards pour un jeton donné. Ce rapport explique pourquoi il peut être servi à 0,16 dollar le million de jetons d'entrée, et pourquoi il intéresse les développeurs qui surveillent leur facture d'inférence.
Cette publication est un aperçu de l'architecture qui sous-tendra Qwen4, la prochaine famille de modèles de l'équipe. Qwen dévoile les changements de conception avant la sortie complète, pour que la communauté puisse les examiner d'abord.
Pourquoi le modèle reste peu coûteux à exécuter
Qwen3.8-Flash-Next est un modèle à mélange d'experts. Le réseau est découpé en de nombreuses sections spécialisées, et un routeur en choisit un petit sous-ensemble pour chaque jeton. Le reste des poids reste inactif. La facture mémoire est donc élevée, mais la facture de calcul est faible.
Le point de contrôle complet est plus gros que le chiffre annoncé ne le laisse croire. MarkTechPost le décompose en une ossature de 125 milliards, une table d'embeddings n-grammes de 51 milliards et un module de prédiction multi-jetons de 4 milliards, soit environ 180 milliards de paramètres sur disque.
Quatre changements de conception portent cette version, d'après le dépôt de l'équipe Qwen :
| Changement | Rôle |
|---|---|
| Gated DeltaNet + Qwen Sparse Attention | Trois couches sur quatre utilisent Gated DeltaNet, la quatrième une attention creuse |
| Gated Residual | Modifie la façon dont le signal circule entre les couches |
| Embedding n-grammes | Une table de 20 millions d'entrées qui ajoute de la capacité à bas coût |
| Optimiseur Muon | Un optimiseur d'entraînement révisé |
La fenêtre de contexte est de 262 144 jetons en natif. DataCamp et MarkTechPost indiquent tous deux qu'elle s'étend à environ 1 million de jetons grâce à YaRN, une technique qui prolonge un modèle au-delà de sa longueur d'entraînement.
Qwen affirme aussi que l'entraînement a coûté environ un neuvième de celui de son prédécesseur Qwen3.7-Plus. Ce chiffre vient de Qwen, et aucune partie extérieure ne l'a vérifié.
Ce que montrent les tests, et qui les a menés
Tous les scores ci-dessous proviennent des propres mesures d'Alibaba. Aucun laboratoire indépendant ne les a confirmés.
| Test | Qwen3.8-Flash-Next | Claude Opus 4.6 Max |
|---|---|---|
| SWE-bench Pro | 62,5 | 53,4 |
| LiveCodeBench v6 | 91,9 | non communiqué |
| AndroidWorld | 84,5 | non communiqué |
| MathVision | 95,7 | non communiqué |
| Raisonnement | 35,9 | 40,0 |
La tendance est plus utile que n'importe quel score isolé. Le modèle domine sur le code et les tâches d'agent, et décroche sur le raisonnement de pointe, où MarkTechPost relève 35,9 contre 40,0. La documentation de Qwen énumère elle aussi des limites : le modèle devient fragile sur les longues chaînes d'agent et reste en retrait sur les évaluations riches en connaissances.
La licence n'est pas ce que « poids ouverts » veut dire d'habitude
Les poids se téléchargent depuis Hugging Face et ModelScope. Le point de contrôle FP8 pèse 172,78 Gio et la version BF16 335,28 Gio. C'est un téléchargement de classe serveur, pas d'ordinateur portable.
Les conditions méritent une lecture attentive. MarkTechPost indique que la version utilise la licence qwen-community-1.0, qui impose une vérification avant tout usage commercial. C'est un écart réel avec Apache 2.0 ou MIT, où l'on télécharge et l'on livre. Ici, « poids ouverts » signifie que vous pouvez inspecter et exécuter le modèle, pas le déployer commercialement sans demander.
Ce que cela signifie pour les développeurs
Raisonnez sur les paramètres actifs, pas sur le total. Un modèle de 125 milliards qui en déclenche 6 par jeton se comporte comme un petit modèle en latence et en coût, et comme un grand en mémoire. Pour dimensionner le matériel : la taille du point de contrôle fixe le nombre de GPU, le nombre actif fixe le débit.
Lisez la licence avant de bâtir dessus. Vérifiez si l'étape de vérification de qwen-community-1.0 s'applique à votre produit, et obtenez la réponse avant d'écrire le code d'intégration, pas après. C'est la chose la plus coûteuse à découvrir tardivement.
Ne prenez pas le tableau des tests au pied de la lettre. Les évaluations maison retiennent les tâches favorables, et la lecture honnête ici est celle d'un modèle fort en code et plus faible en raisonnement. Testez-le sur vos propres tâches, en particulier les longues chaînes d'agent, où Qwen reconnaît lui-même sa fragilité.
L'enjeu stratégique est la pression sur les prix. À 0,16 dollar en entrée et 0,47 en sortie par million de jetons, cette catégorie de modèles ouverts à mélange d'experts fixe un plancher auquel les modèles de pointe hébergés devront répondre. C'est une bonne nouvelle pour quiconque paie une facture d'inférence, quel que soit le modèle finalement retenu.
Sources
Articles liés

Les poids de GLM-5.3 arrivent sous licence maison et exigent huit GPU
Les poids du modèle phare GLM-5.3 de Z.ai sont sur Hugging Face après un retard dû à une revue de sûreté. La licence n'est pas MIT, et le modèle réclame au moins huit GPU haut de gamme.

Z.ai et IBM sortent des modèles de raisonnement à poids ouverts à un jour d'écart
Z.ai a publié GLM-5.3-Flash sous licence MIT avec 320 milliards de paramètres. IBM a publié Granite 4.2 sous Apache 2.0, de 3 à 30 milliards. Ils visent des matériels très différents.

Ollama 0.33 fait tourner Qwen, DeepSeek et Kimi en local dans Claude Desktop
Ollama 0.33.0 ajoute un proxy local qui remplace le modèle derrière l'application Claude Desktop d'Anthropic par un modèle ouvert. Une tentative au printemps a échoué sur la vérification des identifiants de modèle.