Texte

Thinkingmachines

Inkling Small:free

Inkling-Small, le modèle MoE de 276 Md de paramètres qui allie raisonnement poussé, multimodalité et efficacité algorithmique.

Dernière version
d'Inkling-Small de Thinking Machines
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Le 30 juillet 2026, le laboratoire Thinking Machines Lab a officiellement lancé son nouveau modèle, Inkling-Small (thinkingmachines/inkling-small:free). Cette annonce est survenue deux semaines après celle de son aîné, Inkling, un colosse de 975 milliards de paramètres. Conçu initialement sous forme de préversion, Inkling-Small a bénéficié d'un ajustement de son mélange de préentraînement, d'une distillation partielle « on-policy » issue du modèle principal et d'un apprentissage par renforcement axé sur le codage agentique pendant deux semaines. Le but de cette démarche est clair : proposer des performances proches de celles du modèle phare, voire supérieures sur certains tests de code et de raisonnement, pour seulement un quart de sa taille.

Une architecture MoE et des capacités multimodales avancées

Inkling-Small repose sur une architecture de transformeur autorégressif multimodal à experts clairsemés (MoE). Sur un total de 276 milliards de paramètres, le modèle n'en active que 12 milliards par jeton (tokens), ce qui lui permet de concilier profondeur de traitement et efficacité de calcul.

En matière de modalités, le modèle est capable de traiter des entrées hétérogènes comprenant du texte, des images et de l'audio. Toutefois, sa génération reste strictement textuelle : il ne s'agit en aucun cas d'un modèle capable de générer des images, des voix ou des vidéos. Thinking Machines met particulièrement l'accent sur sa capacité de raisonnement à effort réglable, ses performances en codage, son aptitude à orchestrer des agents, son efficacité dans les flux de génération augmentée par récupération (RAG), le suivi d'instructions complexes ainsi que les échanges multilingues. De plus, sur la plateforme OpenRouter, le modèle prend intégralement en charge les appels de fonctions (tools, tool_choice) ainsi que les sorties structurées via JSON Schema. Une spécificité technique notable réside dans sa capacité à exploiter Python pour inspecter, recadrer ou agrandir des images, ce qui s'avère particulièrement pertinent pour l'analyse minutieuse de documents, de graphiques ou de diagrammes complexes.

Positionnement et performances face à la concurrence

Bien que les mesures proviennent en partie des données du fournisseur ou de tests externes compilés, Inkling-Small affiche des résultats de premier plan : - SWE-Bench Verified : 80,2 % (dépassant ainsi les 77,6 % du grand modèle Inkling). - Terminal-Bench 2.1 : 64,7 %. - Humanity's Last Exam (HLE) sans outils : 31,6 % (contre 29,7 % pour Inkling). - GPQA Diamond : 89,5 %. - MMMU Pro : 74,0 %. - MMAU : 77,0 %.

Selon l'analyse menée par le cabinet indépendant Artificial Analysis, Inkling-Small obtient un score de 40 sur son Intelligence Index, le plaçant ainsi à égalité avec DeepSeek V4 Flash et à un point seulement d'Inkling.

Néanmoins, cette réduction de taille s'accompagne d'un déficit marqué en matière de connaissances factuelles précises. Sur le benchmark d'évaluation de la véracité SimpleQA Verified, Inkling-Small s'effondre à 20,6 % de réussite, contre 43,9 % pour le modèle Inkling complet. L'analyse d'Artificial Analysis confirme également des lacunes relatives sur des tâches agentiques spécialisées, notamment dans le secteur bancaire.

Cas d'usage cibles et limites opérationnelles

Grâce à sa fenêtre de contexte phénoménale de 1 048 576 jetons et sa capacité de génération maximale de 262 144 jetons, Inkling-Small est taillé pour l'analyse de vastes corpus de données, le traitement de codes source volumineux et les sessions de travail prolongées. La possibilité d'interagir nativement avec Python pour la manipulation d'images en fait un allié de choix pour la numérisation et l'interprétation de rapports financiers ou scientifiques d'envergure.

Cependant, le modèle souffre de limites inhérentes à sa nature : - Des risques d'hallucinations et des erreurs occasionnelles dans le suivi d'instructions complexes. - Une dégradation progressive des performances lors de conversations multi-tours particulièrement longues. - Des biais potentiels et des disparités de qualité en fonction des langues ou des domaines abordés.

L'éditeur recommande formellement d'éviter son utilisation pour des applications critiques (médicales, juridiques ou de sécurité) sans la mise en place de garde-fous logiciels stricts et d'une validation humaine systématique.

Pour les équipes souhaitant auto-héberger le modèle sous sa licence open source Apache 2.0, l'infrastructure requise reste substantielle : il faut compter au moins 600 Go de VRAM agrégée en BF16, ou 180 Go en exploitant le checkpoint quantifié au format NVFP4.

Une attention particulière doit être portée aux modalités d'utilisation de cet endpoint gratuit d'OpenRouter. Ce dernier est spécifiquement réservé aux environnements d'évaluation et d'exécution agentique (agentic harnesses). En contrepartie de cette gratuité, les prompts soumis ainsi que les réponses générées sont intégralement journalisés par Thinking Machines Lab afin d'améliorer leurs futurs produits. Par conséquent, il est impératif de ne pas y faire transiter de données personnelles, d'informations confidentielles ou de secrets industriels sous peine de compromettre la confidentialité de vos projets.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Vision

Analyse d'images fournies en entrée (photos, captures, documents visuels).

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Raisonnement

Peut enchaîner une réflexion prolongée avant de répondre, utile pour les tâches difficiles.

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    d'Inkling-Small de Thinking Machines

    Dernière version

    thinkingmachines/inkling-small:free

    VisionOutilsRaisonnement
    Fenêtre de contexte
    1 048 576 jetons
    Génération maximale
    262 144 jetons
    Paramètres totaux
    276 Md
    Paramètres actifs
    12 Md
    Licence
    Apache 2.0

    Tarif annoncé : 0.00 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca