Même base, davantage de post-training : GLM-5.3 pousse le code et la cybersécurité
GLM-5.3 renforce le code agentique et la cybersécurité grâce au post-training, avec des open weights prévus après deux semaines d’évaluations.
GLM-5.3 conserve le même modèle de base que GLM-5.2. Z.ai attribue l’ensemble des gains à une phase de post-training plus importante, avec davantage d’environnements, de tâches longues et de calcul consacré au reinforcement learning. Le travail s’appuie notamment sur IndexShare pour le contexte long, SAO pour les trajectoires agentiques et slime pour l’entraînement asynchrone à grande échelle.
Le code constitue l’un des principaux axes de progression. GLM-5.3 passe de 4,6 à 28,3 sur Terminal-Bench 3.0, de 46,2 à 66,9 sur DeepSWE v1.1 et de 23,8 à 28,5 sur Agents' Last Exam. Sur son benchmark interne Z.ai Code Bench, l’entreprise indique également obtenir de meilleurs taux de réussite tout en consommant moins de tokens de sortie que GLM-5.2. À effort maximal, le modèle atteint 34,5 % avec environ 75 000 tokens par tâche, contre 23,4 % et 96 000 tokens pour son prédécesseur.
Les environnements de RL cherchent désormais à reproduire des unités de travail plus proches de projets réels. Certaines tâches peuvent inclure codebases, documentation, systèmes de stockage, clusters de calcul et résultats expérimentaux, avec plusieurs étapes de diagnostic, modification, test et vérification. Z.ai génère également une partie de ces environnements et de leurs verifiers, même si l’entreprise précise que le processus nécessite encore une intervention humaine significative.
La progression la plus sensible concerne la cybersécurité. Après l’intégration de données et d’environnements consacrés à la découverte de vulnérabilités, Z.ai indique avoir observé une amélioration plus rapide que prévu sur les étapes d’exploitation. GLM-5.3 atteint 84,5 % sur CyberGym, contre 77,2 % pour GLM-5.2, et 54,4 % sur ExploitBench, contre 24,4 %. Sur ExploitGym, il résout 105 tâches dans un budget normalisé de deux heures et 130 en six heures, contre respectivement 29 et 39 pour GLM-5.2. Des modèles fermés conservent toutefois une avance importante sur les benchmarks d’exploitation les plus avancés.
Z.ai indique également avoir testé ses modèles avec plusieurs équipes de sécurité sur des codebases réelles. Après revue, filtrage et déduplication, l’entreprise comptabilise 2 436 vulnérabilités réparties dans 269 projets, dont 53 étaient publiquement divulguées au moment de la publication et 2 383 encore sous embargo. Les résultats sont progressivement consignés dans un Security Disclosure Ledger avec le projet concerné, la sévérité et, lorsqu’il existe, le CVE correspondant.
GLM-5.3 fonctionne uniquement avec le raisonnement activé et propose trois niveaux d’effort : low, high et max. La version max est recommandée pour le code. Le modèle est actuellement accessible via GLM Coding Plan et ZCode, notamment depuis des environnements comme Claude Code ou OpenCode. Les open weights doivent être publiés deux semaines après la sortie, une fois les évaluations de sécurité et le durcissement terminés.