Z.ai et IBM sortent des modèles de raisonnement à poids ouverts à un jour d'écart
4 min de lecture
- GLM-5.2
- 4.6%
- GLM-5.3
- 28.3%

Deux modèles de raisonnement à poids ouverts sont sortis à un jour d'intervalle. Z.ai a publié GLM-5.3-Flash le 26 août 2026 sous licence MIT, selon MarkTechPost. IBM a publié Granite 4.2 le 25 août 2026 sous Apache 2.0, selon DataNorth. Poids ouverts signifie que les fichiers du modèle eux-mêmes sont publiés, donc vous pouvez les télécharger et les faire tourner vous-même. Les deux visent des matériels presque opposés, et c'est le point à comprendre avant d'en choisir un.
D'abord, un piège de nommage. GLM-5.3 et GLM-5.3-Flash sont deux sorties différentes. DataNorth rapporte que GLM-5.3 est arrivé le 14 août 2026 pour le code et la cybersécurité, avec des poids ouverts promis environ deux semaines plus tard. GLM-5.3-Flash est la sortie du 26 août, et ses poids sont déjà sur Hugging Face.
GLM-5.3-Flash : grand, peu cher à appeler, difficile à héberger
GLM-5.3-Flash est un modèle à mélange d'experts avec 320 milliards de paramètres au total et 18 milliards actifs par token, selon MarkTechPost. Un mélange d'experts n'active qu'une petite part de ses paramètres pour chaque token, ce qui lui permet d'être grand sans coûter beaucoup de calcul par token. Ici, il active 8 experts sur 288.
MarkTechPost rapporte qu'il est le premier modèle nativement multimodal de la série GLM-5, acceptant des images et des vidéos en entrée, avec une fenêtre de contexte de 1 048 576 tokens. Z.ai le présente comme « le premier modèle nativement multimodal de la série GLM-5 et le modèle de code capable le moins cher ». Les affirmations d'efficacité sont précises : 3 fois moins de calcul d'attention et un cache KV 4,4 fois plus petit que GLM-5.2.
C'est sur le prix que l'argumentaire porte. MarkTechPost indique 0,15 dollar par million de tokens en entrée, 0,03 dollar par million de tokens en entrée mis en cache, et 0,50 dollar par million de tokens en sortie. Z.ai dit que le modèle « dépasse GLM-5.2 sur les benchmarks et les charges réelles pour environ un dixième du prix ».
Le revers est dans le même article. L'auto-hébergement demande du matériel conséquent, les poids pesant environ 306 Gio, et sa capacité de vision reste derrière Gemini 3.7 Flash.
Granite 4.2 : assez petit pour tourner vraiment
IBM a pris la direction inverse. DataNorth rapporte que Granite 4.2 existe en tailles de 3, 8 et 30 milliards de paramètres sous Apache 2.0, entraîné sur environ 15 000 milliards de tokens dont 1 000 milliards de tokens de code synthétique. Le contexte est de 131 072 tokens, avec une extension annoncée à 512K, et il prend en charge 12 langues.
Sa particularité de conception est ce qu'IBM appelle « un interrupteur de réflexion, pour qu'un même checkpoint puisse soit raisonner étape par étape, soit répondre directement ». C'est utile en pratique : vous livrez un seul fichier de modèle et choisissez requête par requête si vous payez des tokens de raisonnement. DataNorth rapporte que le modèle de 30 milliards obtient 57,00 sur SWE-bench Verified, un benchmark qui demande à un modèle de corriger de vraies issues GitHub.
IBM a aussi publié les modèles Granite Speech 5.0 Turbo CTC à 470 millions de paramètres, qui atteignent selon DataNorth un débit de 12 600 RTFx sur un NVIDIA H200.
Face à face
| GLM-5.3-Flash | Granite 4.2 | |
|---|---|---|
| Tailles | 320 milliards au total, 18 milliards actifs | 3, 8 et 30 milliards |
| Licence | MIT | Apache 2.0 |
| Fenêtre de contexte | 1 048 576 tokens | 131 072 tokens |
| Entrées | texte, image, vidéo | texte |
| Poids sur disque | environ 306 Gio | non précisé |
| Benchmark cité | Terminal-Bench 3.0 à 28,3 % pour GLM-5.3 | SWE-bench Verified à 57,00 en 30 milliards |
Ce que cela signifie pour les développeurs
Choisissez selon l'endroit où le modèle tournera, pas selon le nombre de paramètres. Un modèle de 320 milliards à 306 Gio, c'est un déploiement multi-GPU ou un appel d'API. Un modèle de 3 ou 8 milliards, c'est quelque chose que vous pouvez poser sur une seule machine, y compris du matériel que vous possédez déjà. Si votre contrainte est le hors ligne ou l'hébergement sur site, les tailles de Granite sont les seules de cette liste à rendre cela facile, peu importe quel modèle marque le plus.
Ne comparez pas les deux chiffres de benchmark mis en avant l'un à l'autre. Terminal-Bench 3.0 et SWE-bench Verified sont des tests différents, donc 28,3 % et 57,00 ne sont pas sur la même échelle. Le chiffre comparable ici est GLM-5.3 face à GLM-5.2 sur le même benchmark, où DataNorth rapporte un bond de 4,6 % à 28,3 %. Ce gain vient du seul post-entraînement, sur un modèle de base inchangé, ce qui rappelle utilement que la base n'est souvent pas le goulot d'étranglement.
Les deux licences sont permissives, mais elles ne sont pas identiques, et la différence ressort en revue juridique. MIT et Apache 2.0 autorisent toutes deux l'usage commercial et la modification. Apache 2.0 ajoute une concession de brevets explicite, que certaines équipes juridiques exigent. Vérifiez laquelle votre organisation a déjà approuvée avant de bâtir sur l'une ou l'autre.
Le tarif de GLM-5.3-Flash est le chiffre qui devrait changer un plan. À 0,03 dollar par million de tokens en entrée mis en cache, une charge qui renvoie sans cesse le même long contexte devient bien moins chère, et c'est exactement la forme de la plupart des charges d'agents et d'analyse de documents. Si vous avez écarté l'an dernier des conceptions à long contexte pour des raisons de coût, ce calcul vaut la peine d'être refait. Vérifiez d'abord le comportement du cache sur votre propre trafic, car le tarif en cache n'aide que si vos prompts se répètent vraiment.