Ce que fait ce modèle
Clarification sur l'identifiant et genèse du modèle
Dans l'écosystème de Mistral, l'identifiant exact zai-glm-5 correspond dans la pratique aux itérations de la famille GLM conçues par l'organisation Z.ai et hébergées par Mistral. Au 17 septembre 2026, la documentation officielle référence plus particulièrement zai-glm-5-2 et, tout récemment, zai-glm-5-3. Annoncé le 15 septembre 2026 en préversion publique (Public Preview), Z.ai GLM 5.3 succède à la version 5.2 déployée initialement le 6 août 2026. Cette intégration s'inscrit dans la stratégie d'ouverture de Mistral aux architectures tierces open source, exécutées sans modifications au sein de ses infrastructures régionales, avec les mêmes garanties de contrôle et de niveau de service que ses modèles propriétaires.
Modalités, contexte et outillage technique
Sur le plan des modalités, Z.ai GLM 5.3 est strictement restreint au texte (texte vers texte). L'intégration actuelle ne prend en charge aucune modalité visuelle, audio ou génératrice d'images. En revanche, le modèle est optimisé pour les interactions programmatiques de pointe. Il prend en charge l'ensemble des mécanismes attendus en production : complétions conversationnelles (Chat Completions), appels d'outils et de fonctions (function calling), sorties structurées (structured outputs), préfixage, sorties prédites (predicted outputs) et traitement asynchrone par lots (batch processing).
Le modèle se distingue également par un paramètre explicite de contrôle du raisonnement, baptisé reasoning_effort. Configurable sur trois paliers (low, high, max), il permet aux développeurs d'arbitrer précisément entre la latence d'exécution et la profondeur d'analyse algorithmique nécessaire à la résolution du problème posé.
Ses capacités volumétriques sont dimensionnées pour les charges de travail massives : la fenêtre de contexte atteint 1 000 000 de tokens, couplée à une capacité de génération maximale de 128 000 tokens en sortie.
Positionnement concurrentiel et performances mesurées
Z.ai positionne GLM 5.3 comme une solution de pointe pour l'ingénierie logicielle complexe, les architectures agentiques outillées et la manipulation de bases de code volumineuses. Les indicateurs comparatifs partagés par Z.ai sur Hugging Face illustrent cette ambition, bien qu'ils doivent être considérés comme des mesures déclaratives d'éditeur en l'absence d'audit indépendant systématique :
- Terminal Bench 2.1 : Z.ai revendique un score de 88,2 %, marquant un net progrès par rapport aux 81,0 % de GLM 5.2. Ce résultat le place au-dessus des 85,0 % rapportés pour Claude Opus 4.8 et au coude-à-coude avec les 88,8 % indiqués pour GPT-5.6 Sol.
- HLE with Tools : le modèle affiche un score de 62,5 %, devançant Claude Opus 4.8 (57,9 %), tout en restant en deçà de GPT-5.6 Sol (64,5 %).
- Z.ai Code Bench : l'éditeur fait également état d'un gain d'efficacité interne de 50 %, bien que ce benchmark propriétaire ne fasse pas l'objet d'une standardisation publique.
Ces résultats confirment que le modèle cible directement le segment des modèles de pointe dédiés à la manipulation de code et aux flux de commandes en environnement système.
Cas d'usage préconisés et limites opérationnelles
Les scénarios d'utilisation les mieux validés reposent sur la combinaison d'une grande mémoire contextuelle et de capacités de raisonnement itératif. Les guides techniques (cookbooks) de Mistral mettent en avant deux applications concrètes : la génération puis la correction itérative de projets complets (notamment des mini-jeux HTML5) et la modernisation de bases de code Python volumineuses connectées à des dépôts GitHub.
De manière générale, le modèle excelle dans : - L'analyse et l'audit de dépôts logiciels étendus sans découpage artificiel. - Le refactoring de code patrimonial et la migration de frameworks. - Le fonctionnement d'agents autonomes à étapes multiples nécessitant des appels d'outils successifs.
Certaines limites structurelles doivent toutefois guider vos choix d'intégration. Tout d'abord, son statut de préversion publique implique de possibles évolutions de stabilité et de comportement. Ensuite, l'absence totale de vision interdit les flux d'ingénierie visuelle directe (reproduction d'interfaces à partir de maquettes, analyse de diagrammes d'architecture sous forme d'images). Enfin, les performances avancées par Z.ai nécessitent une validation empirique sur vos propres jeux d'évaluation, vos conventions de code et vos langues de travail.
Chez Mistral, l'inférence standard de GLM 5.3 est facturée au tarif officiel de 1,40 $ par million de tokens en entrée (0,14 $ pour les tokens mis en cache) et 4,40 $ par million de tokens en sortie.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Texte
Type principal de contenu traité ou produit par ce modèle.
Outils
Peut appeler des outils ou des fonctions (recherche, calcul, actions).
Raisonnement
Peut enchaîner une réflexion prolongée avant de répondre, utile pour les tâches difficiles.
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
GLM-5
Dernière versionmistral:zai-glm-5OutilsRaisonnement- Fenêtre de contexte
- 200 000 jetons
- Sortie maximale
- 128 000 jetons
- Fournisseur d'origine
- Z.ai (hébergé par Mistral)
- Statut
- Public Preview (depuis le 15 septembre 2026)
- Fenêtre de contexte
- 1 000 000 tokens
- Sortie maximale
- 128 000 tokens
- Modalités
- Texte uniquement
- Contrôle du raisonnement
- Paramètre reasoning_effort (low, high, max)
- Tarification Mistral brute
- 1,40 $ / M (entrée), 0,14 $ / M (cache), 4,40 $ / M (sortie)