Texte

Thinkingmachines

Inkling Small

Inkling-Small, un modèle MoE de 276B paramètres combinant raisonnement multimodal avancé, efficacité et flexibilité sur OpenRouter.

Dernière version
d'Inkling-Small de Thinking Machines
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Le paysage des modèles d'intelligence artificielle ouverts franchit une nouvelle étape avec l'arrivée d'Inkling-Small, développé par Thinking Machines Lab. Publié officiellement le 30 juillet 2026 après une phase de prévisualisation initiée à la mi-juillet, ce modèle se positionne comme une alternative hautement efficiente au sein de la famille Inkling.

En s'appuyant sur une architecture de type Mixture-of-Experts (MoE), Inkling-Small cherche à offrir un compromis optimal entre la puissance de calcul, la latence et le coût opérationnel, tout en ouvrant ses poids à la communauté sous licence Apache-2.0.

Une architecture MoE optimisée pour l'efficience

Contrairement aux modèles denses traditionnels, Inkling-Small utilise une structure MoE de 276 milliards de paramètres au total, dont seulement 12 milliards sont actifs par jeton. Cette conception lui permet de rivaliser avec des architectures bien plus lourdes tout en maintenant des besoins d'inférence modérés. À titre de comparaison, le modèle Inkling principal affiche 975 milliards de paramètres au total pour 41 milliards actifs.

Disponible en formats BF16 et NVFP4, Inkling-Small est conçu pour être déployé localement ou personnalisé via des processus d'ajustement fin (fine-tuning) sur la plateforme Tinker de l'éditeur.

Capacités multimodales et contrôle du raisonnement

Inkling-Small est un modèle autorégressif multimodal qui se distingue par sa flexibilité d'entrée. Il est capable de traiter simultanément : Du texte ; Des images (avec des dimensions recommandées allant de 40 à 4 096 pixels) ; * De l'audio (au format WAV 16 kHz, pour des séquences idéalement inférieures à deux minutes).

Il convient de noter que le modèle ne génère pas de contenu multimodal en sortie : ses réponses sont strictement textuelles.

L'une des fonctionnalités phares de son intégration est la gestion d'un effort de raisonnement réglable. Via l'API, les utilisateurs peuvent configurer ce paramètre sur une échelle allant de none à max. Cette option permet d'arbitrer finement entre la vitesse d'exécution, le volume de jetons de raisonnement générés et la qualité globale de la réponse.

Au niveau de la gestion du contexte, bien que l'architecture d'Inkling-Small supporte théoriquement jusqu'à 1 million de jetons, les limites d'intégration varient. Sur l'API d'OpenRouter, la fenêtre de contexte effectivement exposée est de 524 288 jetons, avec une capacité maximale de génération fixée à 262 144 jetons en sortie.

Performances et positionnement concurrentiel

Les évaluations publiées par Thinking Machines Lab mettent en avant d'excellentes capacités de raisonnement logique et de programmation, en particulier lorsque l'effort de raisonnement est poussé à son maximum. Le modèle obtient des scores notables sur plusieurs benchmarks de référence : 95,5 % sur AIME 2026 (mathématiques) ; 89,5 % sur GPQA Diamond (questions scientifiques de niveau doctoral) ; 80,2 % sur SWE-bench Verified et 55,9 % sur SWE-bench Pro (résolution de problèmes logiciels complexes) ; 64,7 % sur Terminal-Bench 2.1 ; * 31,6 % sur Humanity’s Last Exam.

De manière surprenante, Inkling-Small surpasse le grand modèle Inkling sur certaines tâches de code agentique et de raisonnement pur. En revanche, il s'avère nettement moins performant en matière de factualité pure, comme le montre son score de 20,6 % sur SimpleQA Verified (contre 43,9 % pour le grand Inkling).

Face à des concurrents tels que DeepSeek V4 Flash, Qwen3.5 397B-A17B, MiMo V2.5 ou Nemotron 3 Ultra, Inkling-Small se montre très compétitif, bien qu'il ne domine pas uniformément l'ensemble des tests ni les modèles propriétaires fermés. Ces comparaisons doivent également être analysées avec précaution, certains benchmarks utilisant des protocoles d'évaluation internes ou des scores auto-déclarés.

Cas d'usage et limites d'utilisation

Grâce à sa polyvalence, Inkling-Small est particulièrement recommandé pour : Le développement d'assistants de programmation et le codage agentique ; L'utilisation d'outils externes (tool use) ; Les systèmes de recherche augmentée par génération (RAG) ; L'analyse de documents complexes, de graphiques et de diagrammes ; * La transcription et la compréhension de la parole.

Cependant, plusieurs limites doivent être prises en compte pour une intégration en production. Thinking Machines signale des risques d'hallucinations, un suivi parfois imparfait des instructions complexes, ainsi qu'une dégradation des performances lors de conversations particulièrement longues. De plus, la couverture multilingue reste inégale et des biais peuvent apparaître.

Sur le plan de la sécurité, le modèle peut parfois céder à des requêtes malveillantes si celles-ci sont présentées sous forme de jeux de rôle ou formulées de manière indirecte. Une supervision humaine et l'implémentation de garde-fous applicatifs sont donc fortement conseillées, en particulier dans les secteurs sensibles comme la santé, le droit ou la sécurité.

Sur le plan tarifaire, alors que l'infrastructure Tinker propose le modèle en version bêta serverless à des tarifs de 0,30 $/million de jetons d'entrée (0,06 $ avec cache) et 1,20 $/million de jetons de sortie, l'accès via OpenRouter présente une tarification spécifique : 0,58 $ / million de jetons en entrée ; 0,116 $ / million de jetons pour la lecture du cache ; * 1,44 $ / million de jetons en sortie.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Vision

Analyse d'images fournies en entrée (photos, captures, documents visuels).

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Raisonnement

Peut enchaîner une réflexion prolongée avant de répondre, utile pour les tâches difficiles.

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    d'Inkling-Small de Thinking Machines

    Dernière version

    thinkingmachines/inkling-small

    VisionOutilsRaisonnement
    Architecture
    Mixture-of-Experts (MoE) - 276B paramètres (12B actifs)
    Licence
    Apache-2.0
    Fenêtre de contexte (OpenRouter)
    524 288 tokens
    Limite de sortie (OpenRouter)
    262 144 tokens
    Modalités d'entrée
    Texte, Image, Audio (WAV 16 kHz)
    Modalité de sortie
    Texte uniquement

    Tarif annoncé : 0.45 $ en entrée, 1.20 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca