Ce que fait ce modèle
Le paysage des modèles de langage s'enrichit d'une nouvelle proposition particulièrement optimisée pour les déploiements en production : Ling-3.0-flash. Apparu le 23 juillet 2026 dans le catalogue public d'OpenRouter sous l'identifiant inclusionai/ling-3.0-flash:free (avec pour slug canonique inclusionai/ling-3.0-flash-20260723), ce modèle développé par InclusionAI se positionne comme une solution hautement efficace pour l'inférence agentique à grande échelle.
Hébergé par Novita AI et rendu disponible simultanément sur OpenRouter et Vercel AI Gateway, Ling-3.0-flash met l'accent sur la réduction des coûts et l'optimisation du budget de tokens, tout en offrant des capacités de traitement avancées.
Une architecture Mixture-of-Experts (MoE) de grande envergure
Au cœur de Ling-3.0-flash se trouve une architecture de type Mixture-of-Experts (MoE) totalisant 124 milliards de paramètres. Toutefois, grâce à la sélection dynamique des experts, seuls environ 5,1 milliards de paramètres sont activés par token. Cette conception permet de concilier la richesse de représentation d'un très grand modèle avec la rapidité d'exécution et la sobriété matérielle d'un modèle beaucoup plus compact.
Sur le plan des modalités, Ling-3.0-flash se concentre exclusivement sur le traitement textuel (entrée texte, sortie texte). Il ne dispose pas de capacités natives pour la vision, l'audio, la vidéo ou la génération d'images. Cette spécialisation stricte renforce son efficacité sur les tâches logiques et textuelles complexes.
Une fenêtre de contexte massive et des fonctionnalités orientées agents
L'un des points forts majeurs de ce modèle est sa gestion du contexte. Ling-3.0-flash propose une fenêtre de contexte officielle de 262 144 tokens (soit environ 256K), permettant d'ingérer de volumineux documents ou des historiques de conversation étendus. Côté génération, la limite maximale est fixée à 32 768 tokens (max_completion_tokens), offrant une grande liberté pour les tâches de rédaction ou de synthèse de longue haleine.
Conçu pour s'intégrer de manière transparente dans des architectures d'agents, le modèle prend en charge un large éventail de paramètres avancés : - Appels d'outils (Tool use) : Support complet des paramètres tools et tool_choice. - Raisonnement à la demande : Le modèle intègre des capacités de raisonnement (reasoning, include_reasoning), bien que cette option ne soit pas activée par défaut et reste optionnelle. - Contrôle fin de la génération : Paramètres classiques de température, top_p, top_k, seed, logprobs, ainsi que la gestion des pénalités de fréquence, présence et répétition.
Performances opérationnelles constatées
Bien qu'InclusionAI n'ait pas publié de benchmarks de qualité officiels pour ce modèle, les données opérationnelles fournies par Vercel AI Gateway sur le trafic réel mettent en évidence d'excellentes performances d'inférence : - Latence au premier token (TTFT) : Mesurée entre 0,9 et 1,2 seconde (p50). - Débit (Throughput) : Évalué entre 305 et 437 tokens par seconde (p50).
Ces métriques dynamiques confirment le positionnement "Flash" du modèle, garantissant une réactivité essentielle pour les applications interactives et les workflows d'agents en temps réel. Sur les forums spécialisés comme Reddit, la communauté commence à comparer des versions de test ("Ling-3.0-flash(RC3)-Thinking") à des modèles de référence comme DeepSeek V4 Flash, soulignant l'intérêt croissant pour cette alternative.
Cas d'usage, limites et tarification gratuite
Ling-3.0-flash est particulièrement recommandé pour : - Le déploiement d'agents autonomes nécessitant des appels d'outils fréquents. - Les workflows de production à faible coût. - Le traitement de documents longs (résumés, extraction d'informations). - Les tâches nécessitant un raisonnement logique étape par étape (via l'activation de l'option de raisonnement).
Limites identifiées : - Absence de multimodalité native. - Manque de benchmarks de qualité officiels standardisés. - Code source et poids du modèle non ouverts publiquement à ce jour.
Tarification et quotas : Actuellement proposé sous le suffixe :free sur OpenRouter, le modèle affiche un coût de 0 $ par million de tokens (entrée et sortie). Néanmoins, les règles d'OpenRouter pour les modèles gratuits s'appliquent : les utilisateurs disposent de 50 requêtes gratuites par jour, limite qui peut être portée à 1000 requêtes par jour pour les comptes ayant acquis au moins 10 crédits sur la plateforme.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Texte
Type principal de contenu traité ou produit par ce modèle.
Outils
Peut appeler des outils ou des fonctions (recherche, calcul, actions).
Historique des versions
1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- Date non communiquée
Ling-3.0-flash
Dernière versioninclusionai/ling-3.0-flash:freeOutils- Architecture
- Mixture-of-Experts (MoE)
- Paramètres totaux
- 124 milliards
- Paramètres activés
- 5,1 milliards par token
- Fenêtre de contexte
- 262 144 tokens (~256K)
- Limite de génération
- 32 768 tokens
- Tarif
- Gratuit (0 $ / million de tokens)