Ce que fait ce modèle
Présentation du modèle Ling-3.0-flash-VL
Développé par InclusionAI — entité associée au groupe Ant selon les informations rapportées par le média spécialisé IT之家 —, Ling-3.0-flash-VL constitue le premier jalon multimodal natif de la série de modèles Ling. Dévoilé publiquement avec l'ouverture de ses poids sous licence permissive MIT autour du 9 septembre 2026, le modèle a été référencé sur les plateformes de mesure et d'accès comme OpenRouter et Artificial Analysis dès le 10 septembre 2026.
Proposé sur OpenRouter sous l'identifiant inclusionai/ling-3.0-flash-vl:free, ce système cherche à concilier une grande envergure paramétrique avec un coût d'inférence modéré grâce à une conception clairsemée (Sparse Mixture-of-Experts).
Architecture technique et modalités prises en charge
Ling-3.0-flash-VL s'appuie sur une architecture de type Sparse MoE totalisant 124 milliards de paramètres, dont seulement 5,5 milliards sont activés par token lors de la passe avant. Cette approche permet de conserver une empreinte de calcul contenue tout en bénéficiant de la capacité de mémorisation et de représentation d'un très grand modèle.
Sur le plan multimodal, le modèle accepte en entrée du texte, des images fixes et des flux vidéo. Sa sortie demeure exclusivement textuelle : il ne s'agit donc aucunement d'un modèle génératif d'images ou de vidéos. Concernant les signaux audio, la documentation technique ne décrit aucune prise en charge, qu'il s'agisse de l'entrée ou de la sortie ; cette capacité doit ainsi être considérée comme non documentée.
Le traitement visuel repose sur un encodeur de type Vision Transformer (ViT), articulé au cœur linguistique par un projecteur MLP à deux couches. Pour la compréhension des vidéos, l'architecture emploie VideoRoPE afin de gérer simultanément les positions spatiales et la cohérence temporelle entre les trames. InclusionAI met par ailleurs en exergue une boucle visuelle formalisée en quatre étapes : « observation → action → vérification → correction », conçue spécifiquement pour les agents devant valider visuellement le résultat de leurs interactions avant de poursuivre une tâche.
Caractéristiques sur OpenRouter et capacités d'inférence
Sur la passerelle OpenRouter, la déclinaison inclusionai/ling-3.0-flash-vl:free se distingue par des spécifications étendues :
- Fenêtre de contexte : 262 144 tokens, autorisant l'ingestion de vidéos longues ou d'ensembles volumineux de documents.
- Longueur maximale de complétion : jusqu'à 32 768 tokens en sortie.
- Raisonnement explicite (« thinking ») : activé par défaut dans la configuration de référence du modèle, mais débrayable selon les besoins applicatifs.
- Appel d'outils : support natif des fonctions (
toolsettool_choice), facilitant son insertion dans des flux agentiques. - Format de réponse : le paramètre
response_formatn'est pas pris en charge par l'endpoint, ce qui empêche d'imposer formellement une grammaire ou une structure JSON stricte au niveau de l'API.
Positionnement et analyses de performances
L'évaluation des performances de Ling-3.0-flash-VL nécessite de bien distinguer les données diffusées par le fournisseur des bancs d'essai indépendants. Sur la fiche Hugging Face officielle, InclusionAI revendique un score de 42 sur l'Artificial Analysis Intelligence Index v4.1.1 (soit une progression de 4 points par rapport à la version purement textuelle Ling-3.0-flash), mettant en avant des aptitudes notables en lecture documentaire, interprétation de graphiques et automatisation d'interfaces utilisateur (GUI).
De son côté, la mesure indépendante publiée par Artificial Analysis sous la méthodologie Intelligence Index v4.3 attribue au modèle un score de 25. Malgré cet écart méthodologique qui interdit une comparaison directe entre les deux versions d'indices, Artificial Analysis positionne le modèle au 2e rang sur 64 au sein de sa classe de référence des modèles à poids ouverts, mesurant un débit d'environ 145 tokens par seconde. Sur OpenRouter, les métriques affichées s'élèvent à 57 pour le Coding Index et 30 pour l'Agentic Index, offrant des repères indicatifs sur ses aptitudes pratiques.
Cas d'usage recommandés et limites opérationnelles
Grâce à sa fenêtre de 262k tokens et à son encodeur visuo-temporel, Ling-3.0-flash-VL se prête particulièrement bien à :
- L'analyse approfondie de documents denses, de rapports financiers illustrés et de tableaux complexes.
- Le question-réponse sur des contenus vidéo ou des séquences d'images chronologiques.
- L'automatisation d'interfaces logicielles et la génération de code frontal à partir de maquettes ou de captures d'écran.
- Le pilotage d'agents autonomes opérant dans des boucles de rétroaction visuelle.
Cependant, plusieurs contraintes doivent être prises en compte. L'absence de support pour le formatage JSON strict complique l'extraction de données rigoureusement typées sans étape de validation logicielle en aval. Bien que la variante :free d'OpenRouter propose une tarification à 0 $ par million de tokens (en entrée comme en sortie), elle demeure sujette aux limitations de débit, aux files d'attente et aux quotas variables propres aux accès gratuits. Enfin, pour les organisations souhaitant exploiter le modèle en local sur l'intégralité du contexte de 256k tokens, les prérequis matériels recommandés par l'éditeur s'avèrent considérables, nécessitant quatre processeurs graphiques de 141 Go ou huit cartes de 80 Go.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Texte
Type principal de contenu traité ou produit par ce modèle.
Vision
Analyse d'images fournies en entrée (photos, captures, documents visuels).
Fichiers
Peut s'appuyer sur des fichiers joints (documents, extraits) en plus du texte.
Outils
Peut appeler des outils ou des fonctions (recherche, calcul, actions).
Raisonnement
Peut enchaîner une réflexion prolongée avant de répondre, utile pour les tâches difficiles.
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
Ling-3.0-Flash-VL sur
Dernière versioninclusionai/ling-3.0-flash-vl:freeVisionFichiersOutilsRaisonnement- Fenêtre de contexte
- 262 144 jetons
- Sortie maximale
- 32 768 jetons
- Architecture
- Sparse MoE (124B total, 5,5B activés par token)
- Fenêtre de contexte
- 262 144 tokens
- Génération maximale
- 32 768 tokens
- Modalités d'entrée
- Texte, Image, Vidéo
- Modalités de sortie
- Texte
- Licence
- MIT
- Tarification OpenRouter
- 0 $ / million de tokens (entrée et sortie)
Tarif annoncé : 0.00 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)