Texte

InclusionAI

Ling 3.0 Flash VL

Modèle MoE multimodal d'InclusionAI sous licence MIT, alliant vision, vidéo et raisonnement à coût réduit.

Dernière version
Ling-3.0-flash-VL
Numéro de version
3.0
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Présentation du modèle et nouveautés

Développé par InclusionAI — organisation associée au groupe technologique Ant Group —, Ling-3.0-flash-VL constitue le premier modèle nativement multimodal au sein de la lignée Ling. Conçu comme une extension visuelle de Ling-3.0-flash, il se distingue par la mise à disposition de ses poids sous licence permissive MIT sur Hugging Face. Cette approche ouvre la voie à une intégration et une exploitation commerciale directe, sous réserve du respect des conditions de sa licence.

Référencé sur la plateforme OpenRouter depuis septembre 2026, ce modèle combine des capacités de vision avancées et des mécanismes de raisonnement approfondi. Il s'adresse aux développeurs et aux entreprises recherchant une solution visuelle ouverte, performante et économique pour traiter des flux mêlant texte, images et flux vidéo.

Architecture technique et modalités prises en charge

Ling-3.0-flash-VL repose sur une architecture de type Mixture of Experts (MoE) totalisant 124 milliards de paramètres, dont seulement 5,5 milliards sont activés par token. Cette structure hybride s'articule autour de 42 couches combinant KDA et Gated MLA, associées à un encodeur visuel ViT (Vision Transformer) et à un projecteur MLP à deux couches.

Au niveau des modalités : - Entrées acceptées : Texte, images et vidéos. - Sorties produites : Texte exclusivement. Le modèle ne génère ni images ni vidéos, et n'intègre aucune fonction de traitement audio.

Le système embarque nativement le mode de raisonnement (« thinking » activé par défaut dans le template officiel), la prise en charge de l'appel d'outils et de fonctions (tool calling), ainsi que la génération de sorties structurées conformes à un schéma JSON via OpenRouter.

Concernant la gestion du contexte, une distinction technique s'impose entre les capacités théoriques et les déploiements hébergés. La documentation d'InclusionAI mentionne une fenêtre de contexte allant jusqu'à 256 K tokens (avec une recette d'inférence SGLang s'appuyant sur YaRN pour atteindre 262 144 tokens). En revanche, l'instance actuellement routée sur OpenRouter via DeepInfra est configurée avec une fenêtre de contexte de 131 072 tokens et un plafond de génération fixé à 32 768 tokens (les tokens de réflexion étant décomptés de cette limite).

Positionnement et performances mesurées

Ling-3.0-flash-VL se positionne sur le segment des modèles ouverts hautement efficients, où l'activation parcimonieuse des paramètres permet d'allier rapidité d'exécution et maîtrise des coûts d'inférence.

Sur le plan des repères chiffrés, l'éditeur revendique un score de 42 à l'indice Artificial Analysis Intelligence Index v4.1.1. Toutefois, l'évaluation indépendante réalisée par Artificial Analysis sur la version v4.3 de son indice attribue au modèle un score de 25/100. Bien que ces deux versions d'index ne soient pas directement comparables, ce résultat positionne Ling-3.0-flash-VL à la 2e place sur 64 modèles open weights de taille similaire, surpassant nettement la médiane de la catégorie établie à 8.

Sur les autres métriques relevées : - GPQA Diamond : 86,2 % - AA-LCR : 78,3 % - Coding Index : 57,0 - Agentic Index : 30,0

En matière de débit, Artificial Analysis mesure une vitesse moyenne d'environ 145 tokens par seconde. L'organisme note cependant une forte verbosité : le modèle a consommé 160 millions de tokens de sortie lors de son évaluation globale, contre une médiane de référence établie à 84 millions.

Cas d'usage recommandés et limites

La documentation développeur d'Ant Ling oriente l'utilisation du modèle vers des tâches d'analyse visuelle et d'interaction applicative :

  • Automatisation d'interfaces et agents visuels : Grâce à sa logique d'interaction cyclique « observer → agir → vérifier → corriger », le modèle s'adapte bien à la navigation autonome dans des interfaces logicielles.
  • Développement frontend : Traduction directe de maquettes ou de captures d'écran en code.
  • Analyse de documents complexes : Extraction et interprétation de rapports illustrés, graphiques et tableaux.
  • Compréhension vidéo : Réponses à des requêtes fondées sur des séquences vidéo.

Le modèle présente néanmoins certaines contraintes opérationnelles : 1. Absence de multimodalité en sortie : Aucune production visuelle ou audio n'est permise. 2. Ressources d'auto-hébergement massives : Pour déployer le modèle à pleine charge (256 K tokens), la documentation technique requiert une infrastructure matérielle lourde, préconisant au minimum quatre accélérateurs de classe H200 ou H20 (141 Go). 3. Gestion de la verbosité : Le mode de réflexion interne a tendance à produire des réponses volumineuses, ce qui peut accroître la latence ressentie et gonfler la facture sur des volumes élevés.

Sur le canal OpenRouter, la tarification est particulièrement compétitive avec un coût affiché de 0,06 $ par million de tokens d'entrée, 0,18 $ par million de tokens de sortie et 0,012 $ par million de tokens lus depuis le cache.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Vision

Analyse d'images fournies en entrée (photos, captures, documents visuels).

Fichiers

Peut s'appuyer sur des fichiers joints (documents, extraits) en plus du texte.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Raisonnement

Peut enchaîner une réflexion prolongée avant de répondre, utile pour les tâches difficiles.

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Ling-3.0-flash-VL

    Dernière version

    inclusionai/ling-3.0-flash-vl

    VisionFichiersOutilsRaisonnement
    Fenêtre de contexte
    131 072 jetons
    Sortie maximale
    32 768 jetons
    Architecture
    MoE (124B paramètres totaux, 5,5B activés/token)
    Licence
    MIT (Open Weights)
    Fenêtre de contexte (OpenRouter)
    131 072 tokens (jusqu'à 256K documentés)
    Génération maximale
    32 768 tokens
    Modalités d'entrée
    Texte, Image, Vidéo
    Modalité de sortie
    Texte exclusivement
    Tarification OpenRouter
    0,06 $ / M (entrée) — 0,18 $ / M (sortie)

    Tarif annoncé : 0.02 $ en entrée, 0.06 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca