Ce que fait ce modèle
Une ambiguïté d'identification : Ling-3.0-tiny contre Ling-3.0-flash
Lors de nos analyses de la plateforme OpenRouter, l'identifiant inclusionai/ling-3.0-tiny:free a été détecté. Cependant, les recherches rigoureuses ne permettent pas de trouver de documentation officielle, de dépôt Hugging Face ou de page produit spécifique pour une version « tiny ». Le catalogue officiel d'InclusionAI sur OpenRouter répertorie en revanche le modèle Ling-3.0-flash:free.
Il est fort probable que l'identifiant « tiny » résulte d'une confusion de nommage avec la version « flash ». En l'absence de confirmation officielle, nous ne pouvons pas attribuer de caractéristiques techniques propres à une version « tiny ». Cet article se propose donc d'analyser en détail le modèle parent documenté, Ling-3.0-flash, afin de comprendre les technologies sous-jacentes qui animeraient cette gamme de modèles.
L'architecture de Ling-3.0-flash : Un MoE optimisé
Lancé le 23 juillet 2026 par InclusionAI, le modèle Ling-3.0-flash se positionne comme une solution de raisonnement hybride natif (« native hybrid reasoning »). Conçu spécifiquement pour l'inférence agentique en production, il cherche à concilier efficacité économique, faible latence et réduction de la consommation de jetons.
Sur le plan architectural, Ling-3.0-flash est un modèle de type Mixture-of-Experts (MoE) dont les poids sont publiés sous licence MIT. Il affiche des dimensions impressionnantes : - 124 milliards de paramètres totaux ; - 5,1 milliards de paramètres activés par jeton.
Cette configuration permet de bénéficier de la puissance de représentation d'un très grand modèle tout en maintenant des coûts de calcul et une latence comparables à ceux d'un modèle beaucoup plus léger.
Capacités fonctionnelles et modalités supportées
Le modèle Ling-3.0-flash a été entraîné de manière intensive pour exceller dans les tâches complexes et interactives. InclusionAI met en avant un entraînement sur plus de 10 000 environnements interactifs, englobant des agents de code, des agents généralistes et des tâches de recherche approfondie (« deep research »).
Ses capacités confirmées incluent : - La génération de texte conversationnelle ; - Le raisonnement complexe activé par défaut ; - L'appel d'outils (« tool calling ») ; - L'exécution de tâches multi-étapes dans des scénarios agentiques.
Concernant les modalités, Ling-3.0-flash se concentre exclusivement sur le texte et le code. Aucune source officielle ne confirme de capacités natives pour la vision, l'entrée audio, la synthèse vocale ou la génération d'images. Ces modalités doivent être considérées comme non démontrées pour la version Flash, et totalement inconnues pour l'identifiant « tiny ».
Gestion du contexte et limites de sortie
Pour le traitement de documents volumineux, Ling-3.0-flash propose une fenêtre de contexte très large : - 262 K tokens selon les spécifications d'OpenRouter ; - Un entraînement progressif documenté jusqu'à 256 K tokens par InclusionAI.
En ce qui concerne les limites de génération en sortie, aucun plafond universel n'est explicitement défini pour l'API. Toutefois, les protocoles d'évaluation internes ont mesuré des performances allant jusqu'à 32 K nouveaux tokens, et jusqu'à 128 K tokens sur le benchmark MiniAppBench. Pour l'identifiant « tiny », ces valeurs de contexte et de sortie restent non vérifiables.
Performances et positionnement concurrentiel
Les benchmarks publiés par InclusionAI sur Hugging Face positionnent Ling-3.0-flash comme un concurrent sérieux dans le domaine du raisonnement et du développement logiciel : - SWE-bench Pro : 56,6 - SWE-bench Multilingual : 72,4 - AIME 2026 : 93,2 - HMMT Feb 2026 : 87 - Humanity's Last Exam : 22,7
L'éditeur affirme que ce modèle égale ou surpasse des architectures de la classe des 1000 milliards de paramètres (1T) sur plusieurs évaluations, tout en mobilisant une fraction de leurs paramètres actifs. Il convient toutefois de rappeler que ces mesures proviennent de l'éditeur et peuvent dépendre de configurations de prompts ou de juges LLM spécifiques.
En termes de tarification, le modèle apparenté inclusionai/ling-3.0-flash:free est proposé sur OpenRouter via le fournisseur NovitaAI au tarif de 0,00 $ par million de tokens (en entrée comme en sortie). Si une version « tiny » venait à être confirmée et activée sous les mêmes conditions de gratuité, elle représenterait une option extrêmement compétitive pour le prototypage d'agents autonomes et d'assistants de programmation.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Texte
Type principal de contenu traité ou produit par ce modèle.
Outils
Peut appeler des outils ou des fonctions (recherche, calcul, actions).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
InclusionAI Ling-3.0-tiny
Dernière versioninclusionai/ling-3.0-tiny:freeOutils- Architecture (Gamme Flash)
- MoE (124B totaux / 5,1B actifs)
- Fenêtre de contexte (Gamme Flash)
- 256 K à 262 K tokens
- Licence
- MIT
- Tarif OpenRouter (Flash:free)
- 0,00 $ / million de tokens