Texte

MistralFrance

Zai GLM 5 3

Hébergé sans modification par Mistral, le modèle GLM 5.3 de Z.ai propose 1 million de tokens de contexte et une spécialisation poussée en ingénierie logicielle.

Dernière version
Z.ai GLM 5.3 sur
Numéro de version
5.3
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Introduction et positionnement dans l'écosystème

L'arrivée de zai-glm-5-3 dans l'infrastructure de Mistral AI marque une diversification notable de son catalogue. Contrairement aux modèles traditionnels de la gamme Mistral, GLM 5.3 n'est pas une création interne du laboratoire européen, mais un modèle tiers développé par Z.ai. Proposé en accès public préliminaire (Public Preview) depuis le 15 septembre 2026, il est hébergé sans altération sur l'infrastructure de Mistral, faisant suite à la mise à disposition de ses poids sur Hugging Face fin août 2026 et à un déploiement initial par Z.ai à la mi-août.

Ce partenariat d'hébergement permet aux entreprises et développeurs d'exploiter un modèle particulièrement massif tout en bénéficiant de l'infrastructure d'inférence et des API de Mistral.

Architecture technique et modalités

GLM 5.3 repose sur une architecture de type mélange d'experts (Mixture-of-Experts ou MoE). Il totalise 744 milliards de paramètres — une valeur mesurée à 753 milliards selon les métriques de NVIDIA —, dont 40 milliards sont activés dynamiquement pour chaque token traité. Le modèle prend appui sur les fondations de GLM 5.2, l'essentiel de ses gains de performance provenant d'un travail intensif de post-entraînement.

Sur le plan des modalités, GLM 5.3 est strictement un modèle texte-vers-texte. Il ne prend pas en charge l'analyse native d'images, de flux audio ou la génération visuelle. En revanche, il offre un outillage avancé pour les pipelines applicatifs modernes :

  • Fenêtre de contexte étendue : Grâce à un mécanisme d'attention creuse de type DeepSeek Sparse Attention offrant une capacité théorique de 1 048 576 tokens, Mistral expose une fenêtre de contexte de 1 million de tokens, assortie d'une capacité de génération maximale de 128 000 tokens en sortie.
  • Raisonnement ajustable : Le modèle intègre un paramètre de réflexion (reasoning_effort) configurable selon trois niveaux : low, high et max, ce dernier constituant le réglage par défaut.
  • Fonctionnalités avancées : Il prend en charge l'appel d'outils et de fonctions au format compatible OpenAI, les sorties structurées (JSON), le préfixage de requêtes, les sorties prédites et le traitement par lots (batch processing).

Évaluation et performances face à la concurrence

Les données publiées par Z.ai mettent en avant des résultats particulièrement élevés dans les tâches de programmation autonome et la manipulation d'environnements d'exécution complexes :

  • Environnements en ligne de commande : Le modèle obtient des scores de 88,2 sur Terminal Bench 2.1 et 28,3 sur Terminal Bench 3.0, ainsi que 28,5 sur Agents’ Last Exam CLI.
  • Génie logiciel agentique : Il enregistre 66,9 sur DeepSWE v1.1 et 78,1 sur FrontierSWE, tout en affichant une progression de 50 % sur le benchmark propriétaire Z.ai Code Bench par rapport à GLM 5.2.
  • Cybersécurité : GLM 5.3 se distingue avec un score de 84,5 sur le banc d'essai CyberGym.

Dans les comparaisons fournies par son concepteur, GLM 5.3 surpasse des modèles comme Claude Opus 4.8 sur Terminal Bench 2.1 (85,0), Terminal Bench 3.0 (21,1) et CyberGym (78,1). En revanche, il s'incline face à GPT-5.6 Sol sur Terminal Bench 2.1 (88,8) et demeure en retrait face à Fable 5 sur plusieurs évaluations d'exploitation de vulnérabilités. Il convient toutefois de souligner que ces résultats proviennent directement des rapports de Z.ai et dépendent de harnais d'évaluation et de budgets de calcul spécifiques ; ils ne sauraient remplacer des évaluations indépendantes standardisées.

Cas d'usage recommandés et limites opérationnelles

L'orientation architecturale de GLM 5.3 en fait une solution prioritairement taillée pour les flux d'ingénierie logicielle de grande envergure :

  • Refactorisation et analyse de bases de code : Grâce à sa fenêtre d'un million de tokens, le modèle est capable d'ingérer l'intégralité d'un référentiel logiciel pour en extraire l'architecture, auditer les dépendances ou réaliser des modifications transversales.
  • Agents autonomes de développement : Son aisance avec les interfaces en ligne de commande et les appels d'outils permet d'automatiser des scénarios complexes de diagnostic, d'exécution de tests et de déploiement.
  • Audit de sécurité : Ses aptitudes avancées en cybersécurité facilitent l'identification de failles potentielles dans le code source.

Néanmoins, plusieurs réserves doivent être prises en compte. La fiche technique publiée par NVIDIA avertit que le modèle peut occasionnellement produire des réponses inexactes ou biaisées, et présenter des défaillances dans les raisonnements multi-étapes très intriqués. En matière de cybersécurité, ses capacités offensives théoriques imposent la mise en place de garde-fous stricts et d'une supervision humaine systématique. Enfin, sur le plan réglementaire, la licence de distribution des poids impose aux opérateurs MaaS générant plus de 10 milliards de dollars de chiffre d'affaires annuel de soumettre leur déploiement commercial à un audit de sécurité préalable auprès de Z.ai.

Sur l'infrastructure directe de Mistral, le modèle est facturé 1,40 dollar par million de tokens d'entrée, 0,14 dollar par million de tokens d'entrée mis en cache, et 4,40 dollars par million de tokens générés.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Raisonnement

Peut enchaîner une réflexion prolongée avant de répondre, utile pour les tâches difficiles.

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Z.ai GLM 5.3 sur

    Dernière version

    mistral:zai-glm-5-3

    OutilsRaisonnement
    Fenêtre de contexte
    1 000 000 jetons
    Sortie maximale
    128 000 jetons
    Architecture
    MoE (744B total, 40B actifs)
    Fenêtre de contexte
    1 000 000 tokens
    Génération maximale
    128 000 tokens
    Modalités
    Texte-vers-texte exclusivement
    Raisonnement
    Configurable (low, high, max)
    Prix d'entrée plateforme
    30,00 $ / M tokens
    Prix de sortie plateforme
    50,00 $ / M tokens

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca