Texte

Thinkingmachines

Inkling:free

Inkling, le premier modèle à poids ouverts de Thinking Machines Lab, doté d'un raisonnement ajustable et disponible gratuitement sur OpenRouter.

Dernière version
Inkling de Thinking Machines
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Présentation d'Inkling : la nouvelle frontière du Mixture of Experts

Le paysage de l'intelligence artificielle accueille un nouvel acteur majeur avec l'arrivée d'Inkling, le premier modèle fondation à poids ouverts conçu par Thinking Machines Lab. Lancé officiellement le 15 juillet 2026 sous licence permissive Apache 2.0, Inkling se distingue par sa flexibilité d'intégration et son architecture innovante. Ce modèle est accessible via OpenRouter sous l'identifiant 'thinkingmachines/inkling:free', offrant une alternative ouverte et performante pour les architectures d'agents complexes.

Inkling n'est pas simplement un modèle supplémentaire ; il incarne une approche pragmatique de l'IA générative en combinant une architecture de type Mixture of Experts (MoE) et une gestion native de la multimodalité. Ses poids ouverts sont librement téléchargeables, et il est également intégré à Tinker, la plateforme de personnalisation de Thinking Machines Lab, permettant des ajustements fins pour des besoins métiers spécifiques.

Une architecture MoE et des capacités multimodales avancées

Sous le capot, Inkling s'appuie sur une architecture de transformeur autorégressif de type Mixture of Experts (MoE). Au total, le modèle compte 975 milliards de paramètres, dont 41 milliards de paramètres actifs par token. Cette conception lui permet d'optimiser les ressources de calcul tout en conservant une immense capacité de mémorisation et de traitement de l'information.

Le modèle a été préentraîné sur un corpus de 45 000 milliards de tokens, englobant du texte, des images, de l'audio et de la vidéo. Grâce à cet entraînement riche, il accepte des entrées hautement diverses : - Du texte classique. - Des images (avec des dimensions recommandées allant de 40 à 4 096 pixels par dimension). - De l'audio (fichiers WAV à 16 kHz, d'une durée maximale d'environ 20 minutes).

En revanche, il convient de noter qu'Inkling est un modèle à sortie exclusivement textuelle. S'il s'avère particulièrement performant pour transcrire, analyser ou raisonner sur des flux visuels et sonores, il ne génère pas de nouveaux médias (pas d'images, d'audio ou de vidéo en sortie).

L'un des différenciateurs fonctionnels majeurs d'Inkling réside dans son effort de raisonnement réglable. Les développeurs peuvent configurer le modèle pour arbitrer dynamiquement entre la latence (et le coût associé) et la profondeur du raisonnement requis. Cette flexibilité permet d'adapter le comportement de l'IA selon la complexité de la tâche demandée.

Positionnement concurrentiel et performances

Les évaluations publiées par Thinking Machines Lab démontrent de solides capacités lorsque le niveau d'effort de raisonnement est poussé à son maximum (0,99) : - 97,1 % sur AIME 2026 - 87,2 % sur GPQA Diamond - 77,6 % sur SWE-bench Verified - 73,5 % sur MMMU Pro - 77,2 % sur MMAU - 63,8 % sur Terminal Bench 2.1

Face aux géants actuels, Inkling s'impose comme un concurrent de premier plan parmi les modèles ouverts, bien qu'il ne domine pas de manière absolue. Des modèles comme Kimi K2.6, GLM 5.2 et plusieurs alternatives propriétaires le devancent sur divers tests de code et de raisonnement complexe. Thinking Machines Lab précise d'ailleurs qu'Inkling n'est pas conçu pour être le plus puissant dans l'absolu, mais plutôt pour servir de socle multimodal efficace, équilibré et hautement personnalisable. Il convient d'interpréter ces résultats auto-publiés avec prudence, car certains benchmarks reposent sur des protocoles de test internes.

Cas d'usage, contexte et limites d'utilisation

Inkling est particulièrement optimisé pour des tâches techniques de haut niveau : - Le développement de code agentique et les assistants de programmation. - L'utilisation d'outils complexes et les agents basés sur le RAG (Retrieval-Augmented Generation). - Le suivi d'instructions complexes et le dialogue multilingue. - Le fine-tuning spécifique pour des applications industrielles.

Concernant le contexte, le modèle affiche une fenêtre native maximale de 1 million de tokens. Toutefois, sur l'endpoint OpenRouter (en version batch), la limite de contexte disponible est actuellement fixée à 524 288 tokens. Pour des raisons de stabilité méthodologique, Thinking Machines Lab indique avoir limité ses évaluations de code agentique à des trajectoires de 256 000 tokens. La limite de sortie maximale sur l'API gratuite n'est pas documentée de manière vérifiable.

Il est essentiel de respecter certaines précautions avec l'endpoint gratuit d'OpenRouter. Cette version gratuite est principalement destinée aux tests et aux systèmes agentiques. L'absence de tarification implique une contrepartie : les sessions sont journalisées et utilisées par le laboratoire pour améliorer ses modèles. Il est donc formellement déconseillé d'y soumettre des données confidentielles, des données personnelles, des visages ou des voix identifiables. Pour des besoins de production sécurisés, l'endpoint payant s'affiche à 1,00 $ par million de tokens en entrée et 4,05 $ par million de tokens en sortie.

Enfin, le modèle présente les limites classiques des grands transformeurs : hallucinations potentielles, dégradation des performances lors de très longues conversations, biais hérités des données d'entraînement et base de connaissances figée dans le temps. Tout usage critique (notamment médical, juridique ou stratégique) doit impérativement faire l'objet d'une supervision humaine.

Le modèle 'thinkingmachines/inkling:free' est actuellement détecté par notre plateforme. Il est configuré avec un tarif d'accès de 0 $ par million de tokens, tant pour les données d'entrée que pour les données de sortie.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Vision

Analyse d'images fournies en entrée (photos, captures, documents visuels).

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Raisonnement

Peut enchaîner une réflexion prolongée avant de répondre, utile pour les tâches difficiles.

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Inkling de Thinking Machines

    Dernière version

    thinkingmachines/inkling:free

    VisionOutilsRaisonnement
    Fenêtre de contexte
    524 288 tokens (OpenRouter)
    Paramètres totaux
    975 milliards (MoE)
    Paramètres actifs
    41 milliards par token
    Licence
    Apache 2.0

    Tarif annoncé : 0.00 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca