Les poids de GLM-5.3 arrivent sous licence maison et exigent huit GPU
Les poids du modèle phare GLM-5.3 de Z.ai sont sur Hugging Face après un retard dû à une revue de sûreté. La licence n'est pas MIT, et le modèle réclame au moins huit GPU haut de gamme.
4 min de lecture

En chiffres
- total parameters, 40B active per token
- 753B
- the FP8 download, in 141 shards
- 755.7 GB
- minimum high-end GPUs needed to run it
- 8
- revenue that triggers a Z.ai security review
- $10B
Les poids de GLM-5.3, le plus grand modèle ouvert du laboratoire chinois Z.ai, sont désormais publiés sur Hugging Face. Deux détails comptent plus que les scores de benchmark. La licence est un document maison de Z.ai et non MIT, et le modèle exige au moins huit GPU de centre de données haut de gamme pour tourner.
GLM-5.3 est un modèle à mélange d'experts. Cette conception découpe le réseau en de nombreuses sections spécialisées et n'en réveille que quelques-unes par mot traité. La fiche technique de Kingy.ai indique 753,3 milliards de paramètres au total et 40 milliards actifs par jeton, pris parmi 256 experts routés dont 8 sont choisis à chaque passage. La fenêtre de contexte atteint 1 048 576 jetons, soit la quantité de texte que le modèle garde en tête d'un coup.
La licence est la vraie nouvelle
GLM-5.2 est sorti sous MIT, une licence permissive presque sans contraintes. GLM-5.3, non. Selon la lecture des termes faite par Kingy.ai, les poids du modèle phare portent une licence maison, la "GLM-5.3 License", qui autorise l'usage commercial dans la plupart des cas mais ajoute un déclencheur.
Ce déclencheur vise les entreprises qui revendent l'accès au modèle. Tout opérateur de Model-as-a-Service dont le chiffre d'affaires cumulé, licencié et affiliés compris, dépasse 10 milliards de dollars sur 12 mois consécutifs doit passer une revue de sécurité de Z.ai avant de poursuivre son usage commercial. MIT ne contient pas cette condition, et elle inscrit une validation par le fournisseur dans la licence.
Le petit frère a pris une autre route. Selon explainX, GLM-5.3-Flash est sorti le 26 août sous MIT. Il compte 320 milliards de paramètres, dont 18 milliards actifs. Les poids MIT de GLM-5.2 restent aussi disponibles.
Pourquoi la sortie a glissé
Z.ai a lancé GLM-5.3 le 14 août en promettant les poids sous environ deux semaines, soit le 28 août. Selon explainX, l'échéance a glissé à cause d'une revue de sûreté.
La raison avancée est inhabituelle. Pendant l'évaluation, Z.ai a constaté que la capacité du modèle en cybersécurité avait progressé plus vite que prévu. Cela incluait le raisonnement sur des chaînes d'exploitation en plusieurs étapes. La même évaluation a relevé 2 436 vulnérabilités dans 269 projets open source, selon explainX. Parmi elles, 1 097 ont été classées critiques ou élevées.
Ce que coûte son exécution
| Élément | Valeur |
|---|---|
| Paramètres totaux | 753,3 milliards, 40 milliards actifs par jeton |
| Experts | 256 routés, 8 choisis par jeton |
| Fenêtre de contexte | 1 048 576 jetons |
| Quantification par défaut | FP8 (E4M3) |
| Téléchargement FP8 | 755,7 Go en 141 fragments |
| Téléchargement BF16 | Environ 1,5 To en 282 fragments |
| Matériel minimal | 8 GPU de classe H200, H20 ou B200, 141 à 180 Go de VRAM chacun |
| Contexte complet de 1M | 8 × B200 à 180 Go, avec un cache clé-valeur en FP8 |
Kingy.ai résume ce tableau en une phrase : "It is not easy to run", ce n'est pas facile à faire tourner.
Tous les gains viennent du post-entraînement
L'affirmation technique la plus intéressante figure sur la fiche du modèle elle-même. Z.ai écrit : "GLM-5.3 uses the same base model as GLM-5.2 - every gain comes from post-training." Le modèle de base est donc le même, et chaque gain vient du post-entraînement, l'ajustement effectué après le préentraînement coûteux.
La fiche revendique 50 % d'amélioration sur le Code Bench interne de Z.ai par rapport à GLM-5.2. Sur les benchmarks d'exploitation, elle affirme plus que doubler les scores de GLM-5.2. Kingy.ai reprend les chiffres publiés.
| Benchmark | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Terminal-Bench 3.0 | 4,6 | 28,3 |
| DeepSWE | 46,2 | 66,9 |
| SWE-Marathon | 19,4 | 42,5 |
| CyberGym | 77,2 | 84,5 |
Ce sont des chiffres autodéclarés par le laboratoire qui a fabriqué le modèle. Traitez-les comme une affirmation à vérifier, pas comme un résultat.
Ce que cela signifie pour les développeurs
Lisez la licence avant de bâtir un produit autour de ce modèle. Ici, « poids ouverts » et « open source » ne sont pas la même chose, et la différence est désormais concrète. Si votre entreprise revend l'accès au modèle et franchit le seuil de revenus, la poursuite de l'usage dépend d'une revue menée par le fournisseur.
Si vous avez besoin de termes permissifs aujourd'hui, le choix est explicite. GLM-5.3-Flash et GLM-5.2 sont sous MIT, et Flash fait un tiers de la taille avec 320 milliards de paramètres. Vous échangez les scores de code du modèle phare contre des termes que votre service juridique ne discutera pas.
Faites le calcul matériel avant de télécharger quoi que ce soit. Un point de contrôle FP8 de 755,7 Go réparti en 141 fragments n'est pas un projet de station de travail, et huit cartes sont le plancher, pas une cible confortable. Louez de la capacité à l'heure pour l'évaluer, et chiffrez l'achat de machines seulement ensuite.
Le résultat du post-entraînement est la leçon transposable. Le même modèle de base, ajusté autrement, a fait passer Terminal-Bench 3.0 de 4,6 à 28,3. Si vous budgétez vos propres travaux de modèle, cela plaide pour dépenser sur le post-entraînement et l'évaluation avant de viser une base plus grosse.
Enfin, surveillez la tendance des licences plutôt que ce seul document. Un laboratoire a trouvé une forte capacité de découverte de vulnérabilités dans son propre modèle, a retardé la sortie, puis a livré avec une clause de revue. Attendez-vous à d'autres poids assortis de telles conditions, et à ce que « est-ce du MIT ? » devienne votre première question.
Sources
- zai-org/GLM-5.3 model card - Hugging Face
- GLM-5.3 specs, benchmarks, API and how to use it - Kingy.ai
- GLM-5.3 open weights delay: what happened - explainX
Articles liés

Qwen3.8-Flash-Next contient 125 milliards de paramètres mais n'en active que 6
Alibaba a publié Qwen3.8-Flash-Next le 26 août 2026. Le modèle active 6 des 125 milliards de paramètres par jeton et coûte 0,16 dollar par million de jetons d'entrée.

Z.ai et IBM sortent des modèles de raisonnement à poids ouverts à un jour d'écart
Z.ai a publié GLM-5.3-Flash sous licence MIT avec 320 milliards de paramètres. IBM a publié Granite 4.2 sous Apache 2.0, de 3 à 30 milliards. Ils visent des matériels très différents.

Ollama 0.33 fait tourner Qwen, DeepSeek et Kimi en local dans Claude Desktop
Ollama 0.33.0 ajoute un proxy local qui remplace le modèle derrière l'application Claude Desktop d'Anthropic par un modèle ouvert. Une tentative au printemps a échoué sur la vérification des identifiants de modèle.