Z.ai publie GLM-5.2, modèle open weights pour le code au long cours

Le modèle open weights GLM-5.2 de Z.ai gère un million de tokens de contexte pour le code autonome, surpassant les modèles fermés pour un coût réduit.

GLM-5.2, le nouveau modèle phare de Z.ai (l'entreprise chinoise anciennement appelée Zhipu AI), vise les tâches longues et autonomes. L'architecture reste un Mixture-of-Experts d'environ 744 milliards de paramètres, dont une quarantaine de milliards actifs par requête. Sa principale évolution tient à une fenêtre de contexte portée de 200 000 à un million de tokens, que Z.ai dit avoir rendue exploitable sur de longues trajectoires d'agents de code, et pas seulement plus large. Deux niveaux d'effort de raisonnement, High et Max, arbitrent entre performance, latence et coût.

Côté architecture, l'entreprise détaille IndexShare, un indexeur partagé toutes les quatre couches d'attention parcimonieuse qui abaisse le coût de calcul par token à très long contexte. D'après ses propres mesures, Z.ai situe GLM-5.2 au premier rang des modèles open weights sur plusieurs benchmarks de code au long cours, devant GPT-5.5 sur l'un d'eux et à quelques points de Claude Opus 4.8, pour un coût d'usage bien moindre que celui des modèles fermés. Les poids sont disponibles sous licence MIT sur Hugging Face, et le modèle s'utilise aussi via l'API et le chat de Z.ai, dans une vingtaine d'outils de code dont Claude Code, ou en local.