Ce que fait ce modèle
Une évolution majeure de la gamme Qwen
Publié le 14 août 2026, le modèle Qwen3.8-27B s'inscrit comme une évolution stratégique de la génération Qwen3.5 d'Alibaba. Conçu sous licence libre Apache-2.0, ce modèle à poids ouverts pèse environ 55,6 Go au format BF16. Il cible spécifiquement les tâches complexes liées au code, à la recherche scientifique, au travail professionnel autonome et au déploiement d'agents à horizon long.
Une architecture hybride et des modalités natives
Sur le plan technique, Qwen3.8-27B repose sur une architecture dense de 27 milliards de paramètres (référencée à 28 milliards selon le décompte du dépôt Hugging Face) structurée en 64 couches. Sa particularité réside dans son architecture hybride, qui alterne entre le mécanisme Gated DeltaNet (une forme d'attention linéaire) et le Gated Attention classique. Cette conception vise à optimiser l'efficacité computationnelle sur les longues séquences.
Pour accélérer le décodage au sein des serveurs compatibles, le modèle intègre également la prédiction multi-jetons (MTP, ou Multi-Token Prediction).
En matière de modalités, Qwen3.8-27B se positionne comme un modèle vision-langage natif. S'il produit exclusivement du texte en sortie, il accepte en entrée une grande diversité de formats : - Du texte brut ; - Des images (notamment pour l'analyse de documents complexes et de diagrammes STEM) ; - Des vidéos pouvant atteindre une durée horaire.
En revanche, ce modèle ne dispose d'aucune capacité native pour le traitement ou la génération d'audio, ni pour la synthèse vocale ou la création d'images.
Gestion du contexte et raisonnement dynamique
Qwen3.8-27B propose une fenêtre de contexte native très large de 262 144 jetons. Grâce aux techniques de mise à l'échelle YaRN (Yet another RoPE extensioN), cette fenêtre peut être étendue jusqu'à 1 million de jetons. Toutefois, le fournisseur met en garde contre l'utilisation systématique de YaRN : les configurations statiques peuvent dégrader les performances du modèle sur les contextes courts. Pour les tâches nécessitant un traitement massif, la documentation recommande de configurer le système avec un maximum de 262 144 jetons alloués au raisonnement interne et 131 072 jetons pour la réponse finale, le tout encapsulé dans le contexte étendu de 1 million de jetons.
Le mécanisme de raisonnement (« thinking ») est activé par défaut. Les utilisateurs peuvent ajuster ce comportement selon trois niveaux d'intensité afin d'arbitrer entre le coût, la latence et la profondeur de l'analyse : - low (faible) ; - medium (moyen) ; - xhigh (très élevé, activé par défaut).
De plus, la fonctionnalité preserve_thinking permet de conserver les traces de raisonnement des tours de conversation précédents. Cette option s'avère particulièrement puissante pour les agents multi-étapes, bien qu'elle augmente mécaniquement le volume de contexte à traiter.
Positionnement et performances comparatives
Les performances publiées par le fournisseur mettent en évidence les capacités de Qwen3.8-27B, notamment face à des modèles de tailles supérieures ou des générations antérieures. Sur plusieurs critères d'ingénierie logicielle, le modèle surpasse Qwen3.6-27B et Qwen3.7-Plus.
Voici un aperçu des résultats revendiqués par Alibaba : - SWE-bench Pro : Qwen3.8-27B obtient un score de 61,7, devançant les 53,4 reportés pour Opus 4.6 Max. - LiveCodeBench v6 : Le modèle atteint 90,3. - Terminal Bench 2.1 : Il affiche un score de 73,0 (contre 78,2 pour Opus 4.6 Max). - GPQA Diamond : Il s'établit à 89,2 (contre 91,3 pour Opus 4.6 Max). - HLE (Humanity Last Exam) : Le score est de 30,8 (contre 40,0 pour Opus 4.6 Max). - NL2Repo-Bench : Il obtient 42,3 (contre 47,6 pour Opus 4.6 Max).
Ces résultats, bien qu'impressionnants pour un modèle de 27 milliards de paramètres, doivent être analysés avec la prudence de rigueur, les protocoles d'évaluation n'étant pas toujours homogènes d'un constructeur à l'autre.
Cas d'usage cibles et limites connues
Le modèle est particulièrement recommandé pour : - Le développement logiciel agentique et l'analyse approfondie de dépôts de code (repositories) ; - L'automatisation de tâches de bureau complexes et l'utilisation d'outils tiers ; - L'automatisation d'interfaces graphiques (GUI), qu'elles soient web, mobiles ou de bureau ; - L'analyse de documents denses et de flux vidéo longs.
Malgré ces forces, plusieurs limites doivent être prises en compte. L'empreinte mémoire requise devient extrêmement importante lors du traitement de contextes très longs. De plus, l'activation d'un paramètre presence_penalty trop élevé peut altérer la qualité des réponses, provoquant parfois des mélanges de langues ou une baisse globale de performance.
Sur OpenRouter, les tarifs applicables pour Qwen3.8-27B s'élèvent à 0,45 $ par million de jetons en entrée et 3,2 $ par million de jetons en sortie.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Texte
Type principal de contenu traité ou produit par ce modèle.
Vision
Analyse d'images fournies en entrée (photos, captures, documents visuels).
Outils
Peut appeler des outils ou des fonctions (recherche, calcul, actions).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
Qwen3.8-27B
Dernière versionqwen/qwen3.8-27bVisionOutils- Taille du modèle
- 27 milliards de paramètres (dense)
- Fenêtre de contexte
- 262 144 jetons (extensible à 1 000 000 via YaRN)
- Architecture
- Hybride Gated DeltaNet / Gated Attention avec MTP
- Modalités d'entrée
- Texte, Images, Vidéos (durée horaire)
- Licence
- Apache-2.0
Tarif annoncé : 0.42 $ en entrée, 3.00 $ en sortie, par million de jetons (USD)