Texte

Z.ai

GLM 5.3 Flash

GLM-5.3-Flash de Z.ai : un modèle Mixture-of-Experts de 320B paramètres optimisé pour le long contexte, le développement visuel et les agents.

Dernière version
GLM-5.3-Flash
Numéro de version
5.3
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Un nouveau jalon pour l'architecture GLM

Le 26 août 2026, le fournisseur Z.ai a franchi une étape importante en publiant GLM-5.3-Flash. Avant son lancement officiel, ce modèle a été testé de manière anonyme sous le pseudonyme « Ox Alpha » sur les plateformes OpenRouter et OpenCode, une démarche destinée à évaluer son comportement face à des charges de travail réelles. Présenté comme le tout premier modèle nativement multimodal de la famille GLM-5, il se distingue également par son accessibilité : ses poids de modèle ont été publiés sous licence MIT libre de droits sur la plateforme Hugging Face.

Une architecture MoE ultra-optimisée pour le long contexte

Sur le plan architectural, GLM-5.3-Flash repose sur une structure de type Mixture-of-Experts (MoE) comptant un total massif de 320 milliards de paramètres. Grâce au principe de routage dynamique propre aux architectures MoE, seuls 18 milliards de paramètres sont activés lors de chaque étape d'inférence. Cette configuration permet de concilier la puissance de représentation d'un modèle de très grande taille avec la réactivité d'un modèle beaucoup plus compact.

Z.ai a entraîné un tout nouveau modèle de base en intégrant des innovations structurelles majeures : - Une architecture d'attention hybride, qui combine de l'attention clairsemée (sparse attention) et de l'attention linéaire. - L'implémentation de connexions spécifiques nommées Manifold-Constrained Hyper-Connections (mHC).

L'intérêt de cette recherche est avant tout d'ordre économique et computationnel. En comparaison directe avec le modèle GLM-5.3 classique, ces technologies permettent de diviser par 3,01 le coût de calcul lié à l'attention et par 4,44 la taille du cache KV (Key-Value). Le modèle s'avère donc particulièrement taillé pour traiter de très longs contextes sans subir l'habituelle explosion des besoins en mémoire vive.

Modalités d'interaction et contrôle du raisonnement

Dans le cadre de son intégration via OpenRouter, GLM-5.3-Flash accepte des données d'entrée sous forme de texte, d'image et de vidéo. En sortie, le modèle génère exclusivement du texte. Il ne s'agit donc pas d'un modèle génératif multimodal complet produisant des images, des vidéos ou de l'audio. Pour la partie visuelle, l'API accepte des fichiers via URL ou encodés en Base64 (Data URL) et prend en charge l'analyse simultanée de plusieurs images.

Le modèle dispose d'une gigantesque fenêtre de contexte de 1 048 576 tokens (soit 1 Mo) et permet de générer des réponses continues atteignant jusqu'à 131 072 tokens.

Une particularité notable réside dans l'activation obligatoire de ses capacités de raisonnement. Contrairement à d'autres architectures où cette option est débrayable, le raisonnement est ici systématique. L'API propose trois niveaux d'intensité : « low », « high » et « max ». Par défaut, OpenRouter applique le niveau « max », que le fournisseur recommande expressément pour la résolution de tâches complexes. Le modèle supporte également des fonctionnalités avancées indispensables aux intégrations modernes : l'appel d'outils et de fonctions (tool/function calling), la structuration stricte des réponses (structured outputs), le streaming de tokens ainsi que le cache de contexte.

Performances et positionnement concurrentiel

Les données publiées par Z.ai positionnent GLM-5.3-Flash comme une solution hautement compétitive sur le plan du rapport coût/performance, particulièrement pour l'écriture de code et le déploiement d'agents autonomes à exécution prolongée.

Sur la fiche Hugging Face officielle, le modèle affiche des scores notables : - 84,3 sur le benchmark Terminal-Bench 2.1 ; - 63,4 sur le benchmark DeepSWE v1.1 (contre 46,2 pour l'ancienne version GLM-5.2) ; - 55,3 sur l'évaluation complexe Humanity's Last Exam (avec utilisation d'outils) ; - 48,8 sur AutomationBench (contre 26,2 pour GLM-5.2).

D'après les affirmations de Z.ai, ces gains permettent à GLM-5.3-Flash de surpasser nettement GLM-5.2 sur les tâches d'agent et de programmation, tout en s'approchant des performances de modèles de premier plan comme Claude Opus 4.8 sur ce segment de tâches. Il convient toutefois de rappeler que ces mesures proviennent directement des rapports d'évaluation du fournisseur et n'ont pas encore fait l'objet de vérifications indépendantes approfondies.

Cas d'usage cibles et limites du modèle

Grâce à sa gestion du long contexte et ses aptitudes visuelles, GLM-5.3-Flash s'avère particulièrement pertinent pour : - Le développement de logiciels : création d'agents de développement autonomes, correction et évolution automatique de bases de code complexes. - L'analyse visuelle technique : inspection d'interfaces utilisateurs (GUI), validation de maquettes front-end, analyse de rendus 3D ou d'interactions dans des scènes Blender. - Le traitement documentaire : extraction de données à partir de documents denses, de tableaux financiers complexes ou de rapports volumineux.

Le modèle comporte toutefois des limites structurelles qu'il convient de prendre en compte avant toute intégration : - L'obligation d'utiliser le mode raisonnement peut induire une latence incompressible et un surcoût lors du traitement de requêtes simples qui n'exigent pas une telle puissance de calcul. - La sortie reste strictement textuelle, limitant son usage pour des workflows créatifs nécessitant de la génération d'images ou de l'audio. - Des inconnues subsistent quant à la date exacte de sa limite de connaissances (knowledge cutoff) et ses débits maximaux en production.

Le modèle GLM-5.3-Flash bénéficie actuellement d'une tarification promotionnelle de lancement particulièrement agressive sur OpenRouter. Les tarifs officiels s'établissent à 0,075 $ par million de tokens d'entrée, 0,015 $ par million de tokens d'entrée lus depuis le cache, et 0,25 $ par million de tokens générés en sortie. Ces tarifs affichent une réduction de 50 % par rapport à la grille tarifaire standard (0,15 $ / 0,03 $ / 0,50 $) et resteront valables jusqu'au 9 septembre 2026 à 24 h (UTC+8).

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Vision

Analyse d'images fournies en entrée (photos, captures, documents visuels).

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    GLM-5.3-Flash

    Dernière version

    z-ai/glm-5.3-flash

    VisionOutils
    Fenêtre de contexte
    1 048 576 tokens
    Limite de génération
    131 072 tokens
    Architecture
    Mixture-of-Experts (320B totaux / 18B activés)
    Licence
    MIT
    Entrées acceptées
    Texte, Image, Vidéo
    Sortie
    Texte uniquement

    Tarif annoncé : 0.05 $ en entrée, 0.14 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca