Texte

Thinkingmachines

Inkling

Inkling, le modèle multimodal à poids ouverts de Thinking Machines Lab, conçu pour la personnalisation d'entreprise et le raisonnement complexe.

Dernière version
Thinking Machines Inkling
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Le 15 juillet 2026, l'écosystème de l'intelligence artificielle a franchi une étape importante avec l'annonce officielle d'Inkling, le tout premier modèle public développé par Thinking Machines Lab. Conçu entièrement à partir de zéro (« from scratch ») et publié sous licence à poids ouverts, ce modèle incarne la vision stratégique de l'entreprise. Relayée par des médias de référence tels qu'Axios et TechCrunch, cette sortie met en lumière un positionnement clair : plutôt que de proposer un énième agent conversationnel grand public et uniforme (« one-size-fits-all »), Thinking Machines privilégie des modèles hautement personnalisables, spécifiquement taillés pour répondre aux besoins complexes des entreprises.

Une architecture Mixture-of-Experts de pointe

Inkling repose sur une architecture de type Transformer autorégressif décodeur seul (decoder-only) de 66 couches, exploitant la technologie Mixture-of-Experts (MoE). Ses dimensions sont colossales : il compte pas moins de 975 milliards de paramètres au total, dont 41 milliards de paramètres actifs par token. Le routage est d'une grande finesse, s'appuyant sur un total de 256 experts routés, avec 6 experts activés par token et 2 experts partagés pour stabiliser et enrichir les représentations.

Ce modèle se distingue également par sa nature multimodale native. Inkling est capable de traiter des entrées textuelles, visuelles (images) et sonores (audio). Son pré-entraînement a été réalisé sur un corpus massif de 45 000 milliards de tokens, englobant du texte, des images, de l'audio et des données vidéo. Il convient toutefois de préciser qu'Inkling n'est pas un modèle de génération d'images ou de synthèse vocale : s'il peut analyser et raisonner sur des données multimodales complexes en entrée, ses réponses en sortie sont exclusivement textuelles (format UTF-8).

Gestion du contexte et tarification

La gestion du contexte d'Inkling varie selon l'environnement d'exécution. Si Thinking Machines annonce une capacité théorique allant jusqu'à 1 million de tokens pour la version à poids ouverts, les limites pratiques diffèrent. Sur la plateforme Tinker de l'éditeur, la fenêtre est restreinte à 64K ou 256K tokens. Les analyses d'Artificial Analysis confirment cette distinction : 256K via l'API Tinker et 1M pour les poids ouverts. Sur OpenRouter, l'API expose une longueur de contexte maximale de 1 048 576 tokens, bien que le fournisseur principal actuel affiche une limite de 524 288 tokens. La limite de génération de sortie (max_completion_tokens) n'étant pas explicitement publiée par OpenRouter (valeur nulle), elle doit être considérée comme non documentée à ce jour.

En matière de tarification sur OpenRouter, Inkling se positionne de manière très compétitive : - 1,00 $ par million de tokens en entrée (input) - 4,05 $ par million de tokens en sortie (output) - 0,17 $ par million de tokens pour la lecture du cache (cache read)

À titre de comparaison, les tarifs officiels sur la plateforme Tinker s'avèrent plus élevés et dépendent de la fenêtre de contexte choisie (allant de 1,87 $ / 4,68 $ en 64K à 3,74 $ / 9,36 $ en 256K par million de tokens d'entrée/sortie), rendant l'accès via OpenRouter particulièrement attractif.

Performances et positionnement sur le marché

Thinking Machines adopte une posture d'une grande honnêteté intellectuelle concernant les performances d'Inkling. L'entreprise précise d'emblée que son modèle n'a pas vocation à être le « plus puissant modèle global » du marché, mais plutôt une solution généraliste, robuste et facilement adaptable.

Néanmoins, les benchmarks officiels (mesurés avec un niveau d'effort de 0,99) révèlent des capacités de raisonnement et de calcul de premier ordre : - AIME 2026 : 97,1 % - GPQA Diamond : 87,2 % - SWE-bench Verified : 77,6 % - SWE-bench Pro Public : 54,3 % - MMMU Pro : 73,5 % - MMAU : 77,2 % - VoiceBench : 91,4 %

Ces résultats placent Inkling dans une position très compétitive face à d'autres modèles ouverts de renom tels que Kimi K2.5/K2.6, GLM 5.2, DeepSeek V4 Pro ou Nemotron 3 Ultra. Bien qu'il reste généralement devancé par les meilleurs modèles propriétaires fermés sur certaines tâches hautement spécialisées, Artificial Analysis le qualifie de premier modèle de production de premier plan pour Thinking Machines, le désignant comme le modèle ouvert américain de tête dans son index de référence, avec un score d'intelligence global de 41.

Cas d'usage recommandés et limites connues

Grâce à sa polyvalence et à son architecture MoE, Inkling excelle dans plusieurs domaines clés : - Le développement d'agents autonomes capables d'interagir avec des outils externes. - L'assistance au code et la résolution de bugs complexes (comme en témoignent ses scores sur SWE-bench). - Les systèmes de recherche d'information augmentée par génération (RAG) exploitant de larges bases de connaissances. - Les tâches d'alignement et d'instruction-following pour des applications métiers. - Le traitement multimodal combinant l'analyse d'images et de fichiers audio. - Le fine-tuning ciblé via la plateforme Tinker pour adapter le modèle aux spécificités d'une industrie.

Cependant, plusieurs limites doivent être prises en compte par les équipes techniques. Tout d'abord, l'absence de génération multimodale native (le modèle ne produit que du texte) restreint son usage à de l'analyse pure. De plus, l'hébergement autonome de ses 975 milliards de paramètres requiert une infrastructure matérielle extrêmement lourde et coûteuse. Enfin, conformément aux recommandations de la carte Hugging Face, il convient d'éviter d'employer Inkling pour des tâches critiques, médicales ou juridiques sans la mise en place de garde-fous stricts et d'une supervision humaine systématique.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Vision

Analyse d'images fournies en entrée (photos, captures, documents visuels).

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Raisonnement

Peut enchaîner une réflexion prolongée avant de répondre, utile pour les tâches difficiles.

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Thinking Machines Inkling

    Dernière version

    thinkingmachines/inkling

    VisionOutilsRaisonnement
    Architecture
    Mixture-of-Experts (MoE) autoregressif
    Paramètres totaux
    975 milliards
    Paramètres actifs
    41 milliards par token
    Fenêtre de contexte
    Jusqu'à 1 048 576 tokens (OpenRouter)
    Modalités d'entrée
    Texte, Image, Audio
    Modalité de sortie
    Texte uniquement (UTF-8)

    Tarif annoncé : 1.00 $ en entrée, 4.05 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca