Ce que fait ce modèle
La recherche d'efficacité et de compacité dans le secteur de l'intelligence artificielle franchit une nouvelle étape avec l'introduction de Qwen3.5-9B. Ce modèle ouvert développé par les équipes de Qwen se distingue par un équilibre remarquable entre sa taille de 9 milliards de paramètres et ses aptitudes avancées en raisonnement et en compréhension visuelle. Proposé sur l'agrégateur OpenRouter sous l'identifiant qwen/qwen3.5-9b:batch, ce modèle suscite un vif intérêt. Bien que la sémantique exacte de sa variante :batch (délais d'exécution, conditions de traitement spécifiques) ne soit pas encore détaillée publiquement dans les registres d'OpenRouter, les caractéristiques et performances du modèle sous-jacent démontrent un potentiel exceptionnel pour les intégrations d'agents et le traitement de données complexes.
Date et contexte de sortie
La famille de modèles Qwen3.5 a été annoncée officiellement par Qwen le 15 février 2026. Cette annonce s'est initialement articulée autour de leur modèle géant à mélange d'experts (MoE), le Qwen3.5-397B-A17B. Très rapidement après, le dépôt officiel QwenLM/Qwen a indiqué la mise à disposition des déclinaisons denses de taille inférieure (0,8B, 2B, 4B et 9B) sur les plateformes Hugging Face et ModelScope le 2 mars 2026.
Du côté d'OpenRouter, la date de sortie affichée pour Qwen3.5-9B est le 10 mars 2026. Cette date correspond vraisemblablement au référencement et à la mise à disposition du modèle chez l'agrégateur, plutôt qu'à la publication initiale des poids par le constructeur.
Capacités multimodales et caractéristiques techniques
Qwen3.5-9B est un modèle causal de 9 milliards de paramètres doté d'un encodeur de vision intégré. Contrairement à de nombreuses architectures concurrentes, il a été entraîné de manière unifiée sur des jetons de texte, d'image et de vidéo.
Ses modalités d'interaction se configurent ainsi : - En entrée : le modèle accepte les requêtes textuelles, les images fixes ainsi que les vidéos. - En sortie : il produit exclusivement du texte. - Exclusions : aucune entrée ni sortie audio n'est prise en charge, et le modèle ne génère pas d'images.
Sur le plan fonctionnel, Qwen3.5-9B prend nativement en charge l'appel de fonctions (function calling) et la génération de sorties structurées via un schéma JSON. Ces outils sont particulièrement robustes pour concevoir des workflows agentiques. De plus, son mode de raisonnement (reasoning) est activé par défaut. Il convient de souligner que, contrairement aux versions Qwen3 antérieures, les commandes textuelles /think et /nothink ne constituent plus un commutateur officiellement pris en charge pour contrôler ce comportement.
Gestion du contexte et de la complétion
L'un des atouts majeurs de cette architecture réside dans sa gestion de la mémoire à long terme : - Contexte natif : la fenêtre de contexte native s'élève à 262 144 jetons. - Extension de contexte : d'après sa fiche technique officielle, la fenêtre de contexte peut être étendue jusqu'à environ 1 010 000 jetons en utilisant des techniques de mise à l'échelle RoPE comme YaRN. Il est crucial de noter qu'il s'agit d'une possibilité technique d'extension et non d'une capacité native ou d'une garantie de qualité parfaite à un million de jetons. - Limite de complétion : OpenRouter annonce un plafond de 81 920 jetons de complétion. Les phases d'entrée et de sortie partagent ce budget global de contexte.
Positionnement concurrentiel et performances
Les évaluations publiées par Qwen (qui relèvent d'auto-déclarations et non d'un audit indépendant) positionnent le modèle de 9 milliards de paramètres à un niveau de performance surprenant, dépassant parfois des modèles bien plus volumineux sur des tâches de logique et de vision :
- Raisonnement scientifique (GPQA Diamond) : le modèle obtient le score de 81,7, surpassant ainsi des géants comme GPT-OSS-120B (80,1) et Qwen3-Next-80B-A3B (77,2).
- Logique et connaissances globales : il affiche 82,5 sur MMLU-Pro, 91,5 sur IFEval, 63,0 sur AA-LCR et 55,2 sur LongBench v2.
- Compréhension visuelle : sur les benchmarks de vision, Qwen rapporte un score de 78,4 sur MMMU, 70,1 sur MMMU-Pro et 90,1 sur MMBench EN-DEV.
Cependant, les limites physiques d'un modèle à 9 milliards de paramètres réapparaissent sur les tâches de programmation hautement complexes. Sur LiveCodeBench v6, Qwen3.5-9B obtient un score de 65,6, restant sensiblement en retrait par rapport aux performances de GPT-OSS-120B qui culmine à 82,7.
Cas d'usage concrets et limites
Grâce à sa polyvalence, Qwen3.5-9B s'avère particulièrement pertinent pour : - L'analyse approfondie de documents textuels longs et d'éléments visuels (comme des graphiques complexes ou des enregistrements vidéo). - L'implémentation de systèmes de RAG (Retrieval-Augmented Generation) nécessitant une large fenêtre de contexte. - L'assistance au code intermédiaire et l'automatisation d'extractions structurées via des schémas JSON complexes. - Le pilotage d'agents outillés exploitant l'appel de fonctions.
En matière de limites, les utilisateurs doivent garder à l'esprit qu'il s'agit d'un modèle de taille intermédiaire, intrinsèquement moins robuste sur les problèmes de programmation de haut niveau. De plus, les benchmarks de référence sont principalement auto-déclarés par le concepteur et le modèle ne s'accompagne pas d'évaluations détaillées concernant la sûreté ou le contrôle des hallucinations.
Une fois cette activation réalisée, la tarification applicable pour ce modèle sur notre plateforme sera configurée de la manière suivante (par million de jetons) : - Jetons d'entrée (Input) : 0,17 $ - Jetons de sortie (Output) : 0,25 $
Cette tarification positionne le modèle comme une alternative extrêmement compétitive pour les entreprises souhaitant intégrer des fonctionnalités multimodales avancées à moindre coût.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Texte
Type principal de contenu traité ou produit par ce modèle.
Vision
Analyse d'images fournies en entrée (photos, captures, documents visuels).
Fichiers
Peut s'appuyer sur des fichiers joints (documents, extraits) en plus du texte.
Outils
Peut appeler des outils ou des fonctions (recherche, calcul, actions).
Raisonnement
Peut enchaîner une réflexion prolongée avant de répondre, utile pour les tâches difficiles.
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
Qwen3.5-9B (Batch)
Dernière versionqwen/qwen3.5-9b:batchVisionFichiersOutilsRaisonnement- Fenêtre de contexte
- 262 144 jetons
- Sortie maximale
- 81 920 jetons
- Taille du modèle
- 9 milliards de paramètres
- Fenêtre de contexte native
- 262 144 jetons
- Limite de complétion (OpenRouter)
- 81 920 jetons
- Modalités d'entrée
- Texte, Image, Vidéo
- Modalités de sortie
- Texte uniquement
Tarif annoncé : 0.17 $ en entrée, 0.25 $ en sortie, par million de jetons (USD)