veilletech.fr
29 août Feed du jour
#05 LLM Article

GLM-5.3 : des poids ouverts qui trouvent des failles

Les poids se téléchargent ; les garde-fous, non.

Z.ai publie GLM-5.3 en poids ouverts : même modèle de base que GLM-5.2, tous les gains venant du post-entraînement. L'équipe revendique le meilleur modèle à poids ouverts sur le code, mais la vraie nouveauté est une capacité cyber qu'elle décrit comme émergente, en tête de son tableau sur CyberGym et très au-dessus de GLM-5.2 sur les bancs d'exploitation.

2 min de lecturevidéo 1:18
Partager
Sommaire4 sections
  1. Ce qui se passe
  2. Ce que ça change
  3. Ce qu'il faut pour le servir
  4. À retenir

Ce qui se passe

Z.ai a mis en ligne les poids de GLM-5.3. Le modèle de base est celui de GLM-5.2 : tout l'écart vient du post-entraînement. La carte de modèle annonce deux choses. D'abord le code — « le modèle à poids ouverts le plus capable en code », avec 50 % de mieux que GLM-5.2 sur leur banc interne Z.ai Code Bench. Ensuite, et c'est la partie inhabituelle, une capacité cyber émergente : « en montant en échelle sur le post-entraînement, la capacité cyber s'est développée plus vite que nous ne l'attendions ».

Banc GLM-5.3 GLM-5.2
Terminal Bench 3.0 28,3 4,6
DeepSWE (v1.1) 66,9 46,2
SWE-Marathon (v1.1) 42,5 19,4
AutomationBench (v1.0.6) 48,2 26,2
CyberGym (découverte de vulnérabilités) 84,5 77,2
ExploitGym (2 h / 6 h) 105 / 130 29 / 39
ExploitBench 54,4 24,4

Ce que ça change

Le triplement des scores d'exploitation est le fait marquant : ce qui se mesurait jusqu'ici sur des modèles fermés, derrière des politiques d'usage et une facturation, se télécharge désormais. À rapprocher du témoignage d'Anil Madhavapeddy sur l'effondrement des délais d'embargo en open source : c'est la même compétence, vue depuis l'autre bout de la chaîne.

Prudence sur les chiffres : ils viennent de l'éditeur et n'ont pas été reproduits par un tiers. Les notes de bas de page décrivent des protocoles sérieux — harnais Claude Code, effort de raisonnement maximal, pass@1, listes blanches de domaines pour empêcher le modèle de tricher — mais un banc annoncé par celui qui publie le modèle reste un banc annoncé par celui qui publie le modèle.

Ce qu'il faut pour le servir

Ce n'est pas un modèle de poste de travail : 753 milliards de paramètres, des poids en FP8 (F8_E4M3), 141 fichiers safetensors, environ 750 Go à charger. Les cibles de déploiement documentées sont SGLang, vLLM, TokenSpeed, Transformers, KTransformers et Unsloth, plus les frameworks Ascend NPU côté matériel non-NVIDIA.

Deux réglages à connaître avant le premier test :

La licence est spécifique au modèle (license: other, nom glm-5.3) : à lire avant tout déploiement commercial.

Source : carte de modèle zai-org/GLM-5.3 sur Hugging Face