Skip to content
Tech AI Wire

Les poids de GLM-5.3 arrivent sous licence maison et exigent huit GPU

Les poids du modèle phare GLM-5.3 de Z.ai sont sur Hugging Face après un retard dû à une revue de sûreté. La licence n'est pas MIT, et le modèle réclame au moins huit GPU haut de gamme.

Par Tech AI Wire Team

4 min de lecture

XLinkedIn
The Hugging Face page for zai-org/GLM-5.3, showing its glm-5.3 license and the 141 model shards that make up the 756 GB download.

En chiffres

total parameters, 40B active per token
753B
the FP8 download, in 141 shards
755.7 GB
minimum high-end GPUs needed to run it
8
revenue that triggers a Z.ai security review
$10B

Les poids de GLM-5.3, le plus grand modèle ouvert du laboratoire chinois Z.ai, sont désormais publiés sur Hugging Face. Deux détails comptent plus que les scores de benchmark. La licence est un document maison de Z.ai et non MIT, et le modèle exige au moins huit GPU de centre de données haut de gamme pour tourner.

GLM-5.3 est un modèle à mélange d'experts. Cette conception découpe le réseau en de nombreuses sections spécialisées et n'en réveille que quelques-unes par mot traité. La fiche technique de Kingy.ai indique 753,3 milliards de paramètres au total et 40 milliards actifs par jeton, pris parmi 256 experts routés dont 8 sont choisis à chaque passage. La fenêtre de contexte atteint 1 048 576 jetons, soit la quantité de texte que le modèle garde en tête d'un coup.

La licence est la vraie nouvelle

GLM-5.2 est sorti sous MIT, une licence permissive presque sans contraintes. GLM-5.3, non. Selon la lecture des termes faite par Kingy.ai, les poids du modèle phare portent une licence maison, la "GLM-5.3 License", qui autorise l'usage commercial dans la plupart des cas mais ajoute un déclencheur.

Ce déclencheur vise les entreprises qui revendent l'accès au modèle. Tout opérateur de Model-as-a-Service dont le chiffre d'affaires cumulé, licencié et affiliés compris, dépasse 10 milliards de dollars sur 12 mois consécutifs doit passer une revue de sécurité de Z.ai avant de poursuivre son usage commercial. MIT ne contient pas cette condition, et elle inscrit une validation par le fournisseur dans la licence.

Le petit frère a pris une autre route. Selon explainX, GLM-5.3-Flash est sorti le 26 août sous MIT. Il compte 320 milliards de paramètres, dont 18 milliards actifs. Les poids MIT de GLM-5.2 restent aussi disponibles.

Pourquoi la sortie a glissé

Z.ai a lancé GLM-5.3 le 14 août en promettant les poids sous environ deux semaines, soit le 28 août. Selon explainX, l'échéance a glissé à cause d'une revue de sûreté.

La raison avancée est inhabituelle. Pendant l'évaluation, Z.ai a constaté que la capacité du modèle en cybersécurité avait progressé plus vite que prévu. Cela incluait le raisonnement sur des chaînes d'exploitation en plusieurs étapes. La même évaluation a relevé 2 436 vulnérabilités dans 269 projets open source, selon explainX. Parmi elles, 1 097 ont été classées critiques ou élevées.

Ce que coûte son exécution

ÉlémentValeur
Paramètres totaux753,3 milliards, 40 milliards actifs par jeton
Experts256 routés, 8 choisis par jeton
Fenêtre de contexte1 048 576 jetons
Quantification par défautFP8 (E4M3)
Téléchargement FP8755,7 Go en 141 fragments
Téléchargement BF16Environ 1,5 To en 282 fragments
Matériel minimal8 GPU de classe H200, H20 ou B200, 141 à 180 Go de VRAM chacun
Contexte complet de 1M8 × B200 à 180 Go, avec un cache clé-valeur en FP8

Kingy.ai résume ce tableau en une phrase : "It is not easy to run", ce n'est pas facile à faire tourner.

Tous les gains viennent du post-entraînement

L'affirmation technique la plus intéressante figure sur la fiche du modèle elle-même. Z.ai écrit : "GLM-5.3 uses the same base model as GLM-5.2 - every gain comes from post-training." Le modèle de base est donc le même, et chaque gain vient du post-entraînement, l'ajustement effectué après le préentraînement coûteux.

La fiche revendique 50 % d'amélioration sur le Code Bench interne de Z.ai par rapport à GLM-5.2. Sur les benchmarks d'exploitation, elle affirme plus que doubler les scores de GLM-5.2. Kingy.ai reprend les chiffres publiés.

BenchmarkGLM-5.2GLM-5.3
Terminal-Bench 3.04,628,3
DeepSWE46,266,9
SWE-Marathon19,442,5
CyberGym77,284,5

Ce sont des chiffres autodéclarés par le laboratoire qui a fabriqué le modèle. Traitez-les comme une affirmation à vérifier, pas comme un résultat.

Ce que cela signifie pour les développeurs

Lisez la licence avant de bâtir un produit autour de ce modèle. Ici, « poids ouverts » et « open source » ne sont pas la même chose, et la différence est désormais concrète. Si votre entreprise revend l'accès au modèle et franchit le seuil de revenus, la poursuite de l'usage dépend d'une revue menée par le fournisseur.

Si vous avez besoin de termes permissifs aujourd'hui, le choix est explicite. GLM-5.3-Flash et GLM-5.2 sont sous MIT, et Flash fait un tiers de la taille avec 320 milliards de paramètres. Vous échangez les scores de code du modèle phare contre des termes que votre service juridique ne discutera pas.

Faites le calcul matériel avant de télécharger quoi que ce soit. Un point de contrôle FP8 de 755,7 Go réparti en 141 fragments n'est pas un projet de station de travail, et huit cartes sont le plancher, pas une cible confortable. Louez de la capacité à l'heure pour l'évaluer, et chiffrez l'achat de machines seulement ensuite.

Le résultat du post-entraînement est la leçon transposable. Le même modèle de base, ajusté autrement, a fait passer Terminal-Bench 3.0 de 4,6 à 28,3. Si vous budgétez vos propres travaux de modèle, cela plaide pour dépenser sur le post-entraînement et l'évaluation avant de viser une base plus grosse.

Enfin, surveillez la tendance des licences plutôt que ce seul document. Un laboratoire a trouvé une forte capacité de découverte de vulnérabilités dans son propre modèle, a retardé la sortie, puis a livré avec une clause de revue. Attendez-vous à d'autres poids assortis de telles conditions, et à ce que « est-ce du MIT ? » devienne votre première question.

Sources

  1. zai-org/GLM-5.3 model card - Hugging Face
  2. GLM-5.3 specs, benchmarks, API and how to use it - Kingy.ai
  3. GLM-5.3 open weights delay: what happened - explainX

Articles liés