Texte

Qwen

Qwen3.8 2.4t A95b:batch

Le colosse open-weight d'Alibaba doté d'une architecture MoE à 2,4 billions de paramètres et d'un raisonnement natif systématique.

Dernière version
Qwen3.8-2.4T-A95B
Numéro de version
2.4
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Le paysage des grands modèles de langage franchit une nouvelle étape avec l'introduction de Qwen3.8-2.4T-A95B par Qwen/Alibaba. Annoncé initialement sous sa version commerciale Qwen3.8-Max le 2 août 2026, la publication de ses poids ouverts le 12 août 2026 marque un jalon historique. Il s’agit en effet de la première publication de poids ouverts pour un modèle appartenant à la classe très haut de gamme « Qwen-Max », offrant ainsi aux chercheurs et développeurs une alternative open-weight de premier plan.

Une architecture d'une envergure inédite

Qwen3.8-2.4T-A95B repose sur une architecture à mélange d'experts (MoE) de taille colossale. Le modèle totalise pas moins de 2,4 billions (terme utilisé pour désigner les trillions anglo-saxons) de paramètres, dont 95 milliards sont activés de manière dynamique par token.

Cette structure complexe s'articule autour de plusieurs spécifications techniques clés : - Distribution des experts : Le système s'appuie sur un total de 512 experts routés. Pour chaque token traité, 10 experts sont sélectionnés de façon ciblée, complétés par un expert partagé systématiquement sollicité afin de maintenir une cohérence globale. - Profondeur et Attention : Le réseau compte 92 couches. Afin de surmonter les goulots d'étranglement de mémoire liés aux contextes de très grande taille, le modèle combine habilement l'attention linéaire et l'attention complète. Cette architecture hybride permet de drastiquement limiter l'expansion du cache d'attention (KV Cache). - Optimisation de la génération : L'intégration d'une tête de prédiction multi-token (MTP) vient accélérer le décodage et la fluidité des réponses.

Ce modèle texte-à-texte causal a été spécifiquement entraîné pour exceller dans la programmation informatique, la recherche académique, le raisonnement logique complexe et les workflows agentiques s'étendant sur de longues durées.

Capacités, modalités et contraintes opérationnelles

Malgré son envergure, le modèle impose certaines limites fonctionnelles strictes qu'il convient de prendre en compte lors de son intégration : - Exclusivité textuelle : Le modèle Qwen3.8-2.4T-A95B est strictement limité au texte (text-only). Il ne prend en charge aucune modalité visuelle, audio ou vidéo. - Raisonnement natif et obligatoire : Le mécanisme de réflexion du modèle est actif par défaut et ne peut pas être désactivé. Les réponses générées débutent ainsi systématiquement par un bloc de raisonnement interne détaillé. Les utilisateurs peuvent configurer ce processus selon trois niveaux d'intensité : low, medium ou xhigh (le niveau xhigh étant appliqué par défaut). - Compatibilité avancée : Sur la plateforme OpenRouter, le modèle gère nativement l'appel d'outils (tool calling), la sélection d'outils (tool choice) ainsi que la structuration fine des données de sortie via des schémas JSON.

En matière de contexte, la fiche technique de Qwen indique une fenêtre native de 262 144 tokens, extensible jusqu'à un volume impressionnant de 1 010 000 tokens. Pour le déploiement de type :batch, OpenRouter s'aligne sur les capacités de son fournisseur principal en déclarant une fenêtre d'entrée maximale de 1 010 000 tokens et un plafond maximal de complétion (génération de sortie) fixé à 909 000 tokens. Pour optimiser l'utilisation pratique, les équipes de Qwen recommandent d'allouer au maximum 262 144 tokens pour le raisonnement interne et de limiter la réponse finale à 131 072 tokens.

Positionnement et performances face à la concurrence

Les évaluations de performance publiées placent Qwen3.8-Max parmi l'élite des modèles actuels, surpassant parfois de grands modèles propriétaires fermés sur des tâches académiques et complexes : - PaperBench : Qwen obtient un score remarquable de 93,0, dépassant des rivaux de renom tels que GPT-5.6 Sol (90,5), Fable 5 (88,8) et Opus 4.8 (80,3). - Terminal Bench 2.1 : Le modèle atteint une note de 86,6, démontrant de solides capacités de manipulation de terminaux et d'environnements d'exécution. - SWE-bench Pro & FrontierSWE : Qwen s'illustre respectivement à 67,7 et 73,5. Bien que ces scores soient élevés, ils restent toutefois en retrait face aux résultats obtenus par Fable 5 sur ces mêmes benchmarks orientés ingénierie logicielle.

Il reste nécessaire de manipuler ces comparaisons avec une relative prudence : Qwen rappelle que les méthodologies d'évaluation peuvent différer, que certaines mesures relèvent de tests internes et que des modèles concurrents comme Fable 5 recourent parfois à des mécanismes de routage ou de bascules dynamiques entre plusieurs modèles.

Tarification et hébergement

L'exploitation de ce modèle à grande échelle nécessite d'anticiper deux aspects majeurs : le coût d'appel de l'API et l'infrastructure requise en cas d'auto-hébergement.

Pour la déclinaison :batch disponible via OpenRouter, les tarifs s'établissent de la manière suivante : - Entrée : 2,50 $ par million de tokens. - Sortie : 6,25 $ par million de tokens. - Lecture de cache (Prompt Cache) : 0,50 $ par million de tokens.

En cas d'auto-hébergement, l'empreinte matérielle s'avère pharaonique. La documentation technique officielle de vLLM-Ascend évalue la taille des poids bruts au format BF16/FP16 à environ 4,89 To. Un tel volume restreint le déploiement natif sans perte à des infrastructures de calcul de pointe multi-accélérateurs. Bien que des variantes quantifiées permettent d'atténuer ces contraintes de stockage, elles s'accompagnent généralement de risques de dégradation de la précision du raisonnement.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Raisonnement

Peut enchaîner une réflexion prolongée avant de répondre, utile pour les tâches difficiles.

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Qwen3.8-2.4T-A95B

    Dernière version

    qwen/qwen3.8-2.4t-a95b:batch

    OutilsRaisonnement
    Fenêtre de contexte
    1 010 000 jetons
    Sortie maximale
    909 000 jetons
    Fenêtre de contexte maximale
    1 010 000 tokens
    Limite de complétion
    909 000 tokens
    Paramètres totaux (MoE)
    2,4 billions (2,4T)
    Paramètres activés par token
    95 milliards (95B)
    Structure d'attention
    Hybride linéaire et complète (92 couches)

    Tarif annoncé : 2.00 $ en entrée, 6.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca