Ce que fait ce modèle
Le paysage de l'intelligence artificielle accueille un nouvel acteur de premier plan pour les tâches de longue durée et le raisonnement complexe : le modèle GLM-5.2 développé par Z.ai (anciennement connu sous le nom de Zhipu). Conçu spécifiquement pour l'ingénierie logicielle agentique, ce modèle phare a fait son apparition sur les dépôts Hugging Face le 16 juin 2026, suivi d'une couverture médiatique par Computerworld dès le lendemain. Sur la plateforme OpenRouter, cette technologie est déclinée sous une variante spécifique nommée z-ai/glm-5.2:batch. Cette déclinaison propose une approche optimisée pour le traitement par lots, bien que sa date exacte d'intégration sur le routeur ne soit pas formellement documentée.
Architecture et modalités techniques
D'un point de vue architectural, GLM-5.2 repose sur une structure de type Mixture of Experts (MoE). Les spécifications techniques révèlent toutefois une légère divergence de communication entre les plateformes : le dépôt officiel GitHub fait état de 744 milliards de paramètres totaux, dont 40 milliards sont activés par jeton (token), tandis que la fiche Hugging Face affiche un total de 753 milliards de paramètres.
Contrairement à la tendance actuelle vers la multimodalité native, GLM-5.2 se concentre exclusivement sur le traitement de texte à texte. Il ne dispose d'aucune capacité de vision, d'analyse audio, ni de génération d'images ou de vidéos. En revanche, Z.ai a doté son modèle de fonctionnalités avancées pour le traitement textuel de haut niveau : des modes de raisonnement paramétrables, le support du streaming, l'appel de fonctions et d'outils (tool calling), la génération de sorties structurées (notamment au format JSON), la mise en cache du contexte (context caching) et l'intégration du protocole MCP (Model Context Protocol).
Comparatif et performances annoncées
Les évaluations publiées par l'éditeur positionnent GLM-5.2 comme un concurrent redoutable parmi les modèles ouverts orientés vers le code et les agents autonomes. Sur le benchmark FrontierSWE Dominance, Z.ai affiche un score de 74,4 %, plaçant le modèle à seulement 0,7 point de Claude Opus 4.8 (75,1 %) et devant GPT-5.5 (72,6 %). Sur Terminal-Bench 2.1, GLM-5.2 atteint 81,0 %, restant cette fois-ci en retrait par rapport aux 85,0 % de Claude Opus 4.8.
D'autres indicateurs clés sont mis en avant par l'éditeur, notamment un score de 62,1 % sur SWE-bench Pro, 46,2 % sur DeepSWE, et 54,7 % sur l'évaluation complexe "Humanity's Last Exam" lorsqu'il est équipé d'outils. Il convient toutefois de souligner que ces mesures émanent principalement de l'éditeur lui-même et dépendent de protocoles variables (choix du contexte, budgets de tokens, présence d'un juge LLM). Une validation indépendante reste donc indispensable pour confirmer ces performances en conditions réelles de production.
Cas d'usage concrets et limites pratiques
L'orientation de GLM-5.2 le destine naturellement à des tâches autonomes à horizon long. Parmi les applications concrètes, on peut citer : - L'audit approfondi de dépôts de code complexes. - La refactorisation multi-fichiers automatisée. - Le débogage et l'automatisation de commandes au sein d'un terminal. - La reproduction autonome d'expériences scientifiques ou techniques. - Le développement d'applications de bout en bout.
Néanmoins, l'utilisation de la variante z-ai/glm-5.2:batch sur OpenRouter impose certaines limites par rapport à l'offre standard de Z.ai. Alors que le service natif de Z.ai annonce une fenêtre de contexte de 1 million de tokens et jusqu'à 128 000 tokens en sortie, la déclinaison batch d'OpenRouter restreint la fenêtre de contexte à 512 000 tokens. De plus, aucune limite maximale de génération n'est explicitement définie dans le catalogue public d'OpenRouter (max_completion_tokens étant configuré à null). Les utilisateurs ne doivent donc pas présumer que les capacités maximales de l'API native de Z.ai sont intégralement transposables sur cette déclinaison.
L'un des atouts majeurs de la variante batch proposée via OpenRouter réside dans son positionnement tarifaire extrêmement compétitif. Alors que les tarifs officiels de l'API Z.ai s'élvèvent à 1,40 $ par million de tokens en entrée (0,26 $ avec cache) et 4,40 $ par million de tokens en sortie, l'offre OpenRouter pour z-ai/glm-5.2:batch divise ces coûts par deux. Les tarifs affichés sont de 0,70 $ par million de tokens en entrée, 0,13 $ pour l'entrée avec cache, et 2,20 $ par million de tokens en sortie. Comme pour tout service de routage, ces tarifs et plafonds sont susceptibles d'évoluer et doivent être vérifiés avant tout déploiement à grande échelle.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Texte
Type principal de contenu traité ou produit par ce modèle.
Outils
Peut appeler des outils ou des fonctions (recherche, calcul, actions).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
Z.ai GLM-5.2
Dernière versionz-ai/glm-5.2:batchOutils- Architecture
- MoE (744B total / 40B actifs)
- Fenêtre de contexte (Batch)
- 512 000 tokens
- Tarif Entrée (par M)
- 0,70 $
- Tarif Sortie (par M)
- 2,20 $
Tarif annoncé : 0.70 $ en entrée, 2.20 $ en sortie, par million de jetons (USD)