Ce qui se passe
Z.ai a mis en ligne les poids de GLM-5.3. Le modèle de base est celui de GLM-5.2 : tout l'écart vient du post-entraînement. La carte de modèle annonce deux choses. D'abord le code — « le modèle à poids ouverts le plus capable en code », avec 50 % de mieux que GLM-5.2 sur leur banc interne Z.ai Code Bench. Ensuite, et c'est la partie inhabituelle, une capacité cyber émergente : « en montant en échelle sur le post-entraînement, la capacité cyber s'est développée plus vite que nous ne l'attendions ».
| Banc | GLM-5.3 | GLM-5.2 |
|---|---|---|
| Terminal Bench 3.0 | 28,3 | 4,6 |
| DeepSWE (v1.1) | 66,9 | 46,2 |
| SWE-Marathon (v1.1) | 42,5 | 19,4 |
| AutomationBench (v1.0.6) | 48,2 | 26,2 |
| CyberGym (découverte de vulnérabilités) | 84,5 | 77,2 |
| ExploitGym (2 h / 6 h) | 105 / 130 | 29 / 39 |
| ExploitBench | 54,4 | 24,4 |
Ce que ça change
Le triplement des scores d'exploitation est le fait marquant : ce qui se mesurait jusqu'ici sur des modèles fermés, derrière des politiques d'usage et une facturation, se télécharge désormais. À rapprocher du témoignage d'Anil Madhavapeddy sur l'effondrement des délais d'embargo en open source : c'est la même compétence, vue depuis l'autre bout de la chaîne.
Prudence sur les chiffres : ils viennent de l'éditeur et n'ont pas été reproduits par un tiers. Les notes de bas de page décrivent des protocoles sérieux — harnais Claude Code, effort de raisonnement maximal, pass@1, listes blanches de domaines pour empêcher le modèle de tricher — mais un banc annoncé par celui qui publie le modèle reste un banc annoncé par celui qui publie le modèle.
Ce qu'il faut pour le servir
Ce n'est pas un modèle de poste de travail : 753 milliards de paramètres, des
poids en FP8 (F8_E4M3), 141 fichiers safetensors, environ 750 Go à charger.
Les cibles de déploiement documentées sont SGLang, vLLM, TokenSpeed, Transformers,
KTransformers et Unsloth, plus les frameworks Ascend NPU côté matériel non-NVIDIA.
Deux réglages à connaître avant le premier test :
reasoning_effortacceptelow,highoumax, et vautmaxpar défaut — y compris si vous passez une autre valeur ;- dans le gabarit de conversation,
clear_thinkingvautfalsepar défaut ; la carte recommande de le passer explicitement àtrueen usage conversationnel.
La licence est spécifique au modèle (license: other, nom glm-5.3) : à lire
avant tout déploiement commercial.