Texte

InclusionAI

Ling 3.0 Flash:free

Ling-3.0-flash d'InclusionAI, un modèle MoE de 124B paramètres disponible gratuitement sur OpenRouter pour vos agents IA.

Dernière version
Ling-3.0-flash
Numéro de version
3.0
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Le paysage des modèles de langage s'enrichit d'une nouvelle proposition particulièrement optimisée pour les déploiements en production : Ling-3.0-flash. Apparu le 23 juillet 2026 dans le catalogue public d'OpenRouter sous l'identifiant inclusionai/ling-3.0-flash:free (avec pour slug canonique inclusionai/ling-3.0-flash-20260723), ce modèle développé par InclusionAI se positionne comme une solution hautement efficace pour l'inférence agentique à grande échelle.

Hébergé par Novita AI et rendu disponible simultanément sur OpenRouter et Vercel AI Gateway, Ling-3.0-flash met l'accent sur la réduction des coûts et l'optimisation du budget de tokens, tout en offrant des capacités de traitement avancées.

Une architecture Mixture-of-Experts (MoE) de grande envergure

Au cœur de Ling-3.0-flash se trouve une architecture de type Mixture-of-Experts (MoE) totalisant 124 milliards de paramètres. Toutefois, grâce à la sélection dynamique des experts, seuls environ 5,1 milliards de paramètres sont activés par token. Cette conception permet de concilier la richesse de représentation d'un très grand modèle avec la rapidité d'exécution et la sobriété matérielle d'un modèle beaucoup plus compact.

Sur le plan des modalités, Ling-3.0-flash se concentre exclusivement sur le traitement textuel (entrée texte, sortie texte). Il ne dispose pas de capacités natives pour la vision, l'audio, la vidéo ou la génération d'images. Cette spécialisation stricte renforce son efficacité sur les tâches logiques et textuelles complexes.

Une fenêtre de contexte massive et des fonctionnalités orientées agents

L'un des points forts majeurs de ce modèle est sa gestion du contexte. Ling-3.0-flash propose une fenêtre de contexte officielle de 262 144 tokens (soit environ 256K), permettant d'ingérer de volumineux documents ou des historiques de conversation étendus. Côté génération, la limite maximale est fixée à 32 768 tokens (max_completion_tokens), offrant une grande liberté pour les tâches de rédaction ou de synthèse de longue haleine.

Conçu pour s'intégrer de manière transparente dans des architectures d'agents, le modèle prend en charge un large éventail de paramètres avancés : - Appels d'outils (Tool use) : Support complet des paramètres tools et tool_choice. - Raisonnement à la demande : Le modèle intègre des capacités de raisonnement (reasoning, include_reasoning), bien que cette option ne soit pas activée par défaut et reste optionnelle. - Contrôle fin de la génération : Paramètres classiques de température, top_p, top_k, seed, logprobs, ainsi que la gestion des pénalités de fréquence, présence et répétition.

Performances opérationnelles constatées

Bien qu'InclusionAI n'ait pas publié de benchmarks de qualité officiels pour ce modèle, les données opérationnelles fournies par Vercel AI Gateway sur le trafic réel mettent en évidence d'excellentes performances d'inférence : - Latence au premier token (TTFT) : Mesurée entre 0,9 et 1,2 seconde (p50). - Débit (Throughput) : Évalué entre 305 et 437 tokens par seconde (p50).

Ces métriques dynamiques confirment le positionnement "Flash" du modèle, garantissant une réactivité essentielle pour les applications interactives et les workflows d'agents en temps réel. Sur les forums spécialisés comme Reddit, la communauté commence à comparer des versions de test ("Ling-3.0-flash(RC3)-Thinking") à des modèles de référence comme DeepSeek V4 Flash, soulignant l'intérêt croissant pour cette alternative.

Cas d'usage, limites et tarification gratuite

Ling-3.0-flash est particulièrement recommandé pour : - Le déploiement d'agents autonomes nécessitant des appels d'outils fréquents. - Les workflows de production à faible coût. - Le traitement de documents longs (résumés, extraction d'informations). - Les tâches nécessitant un raisonnement logique étape par étape (via l'activation de l'option de raisonnement).

Limites identifiées : - Absence de multimodalité native. - Manque de benchmarks de qualité officiels standardisés. - Code source et poids du modèle non ouverts publiquement à ce jour.

Tarification et quotas : Actuellement proposé sous le suffixe :free sur OpenRouter, le modèle affiche un coût de 0 $ par million de tokens (entrée et sortie). Néanmoins, les règles d'OpenRouter pour les modèles gratuits s'appliquent : les utilisateurs disposent de 50 requêtes gratuites par jour, limite qui peut être portée à 1000 requêtes par jour pour les comptes ayant acquis au moins 10 crédits sur la plateforme.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Ling-3.0-flash

    Dernière version

    inclusionai/ling-3.0-flash:free

    Outils
    Architecture
    Mixture-of-Experts (MoE)
    Paramètres totaux
    124 milliards
    Paramètres activés
    5,1 milliards par token
    Fenêtre de contexte
    262 144 tokens (~256K)
    Limite de génération
    32 768 tokens
    Tarif
    Gratuit (0 $ / million de tokens)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca