Texte

Thinkingmachines

Inkling Small:batch

Inkling-Small de Thinking Machines Lab, un modèle MoE de 276B paramètres alliant raisonnement avancé, vision et traitement audio.

Dernière version
d'Inkling-Small (batch)
Type
Texte
Versions recensées
1

Ce que fait ce modèle

Une nouvelle référence open-weights signée Thinking Machines Lab

Le paysage de l'intelligence artificielle open-weights franchit une étape décisive avec la publication, le 30 juillet 2026, d'Inkling-Small par le laboratoire Thinking Machines Lab. Distribué sous licence Apache 2.0, ce modèle s'impose comme une version optimisée et plus compacte de la famille Inkling.

Sur le plan architectural, Inkling-Small repose sur un transformeur de type Mixture-of-Experts (MoE) totalisant 276 milliards de paramètres, dont 12 milliards sont activés de manière dynamique pour chaque token. Cette approche permet de concilier la puissance théorique d'un très grand modèle avec la réactivité et la sobriété computationnelle d'une architecture plus légère lors de l'inférence. Entraîné après le modèle Inkling principal, Inkling-Small bénéficie d'un mélange de données enrichi et de recettes d'apprentissage perfectionnées. Un checkpoint « preview » a notamment profité d'une distillation on-policy directement issue d'Inkling, complétée par deux semaines de perfectionnement par apprentissage par renforcement (RL) spécifiquement orienté vers les tâches de code agentique.

Capacités multimodales et flexibilité du raisonnement

Inkling-Small se distingue par une approche multimodale native. Le modèle est capable de traiter conjointement du texte enrichi, des images haute résolution ainsi que des fichiers audio au format WAV (échantillonnés à 16 kHz, pour une durée idéale de moins de deux minutes). Il convient toutefois de souligner qu'il s'agit d'un modèle à sortie purement textuelle : il ne génère pas d'images, de voix ou de fichiers vidéo.

L'une des grandes forces de cette déclinaison réside dans la gestion de son effort de raisonnement. Via la route d'intégration OpenRouter, les développeurs peuvent ajuster l'intensité de la réflexion du modèle selon plusieurs paliers bien définis : none, minimal ou max. Cette granularité permet d'adapter le comportement de l'IA aux exigences de rapidité ou de profondeur de l'application cliente.

Par ailleurs, l'API prend pleinement en charge les appels d'outils et de fonctions via les paramètres tools et tool_choice. Bien que le modèle gère très efficacement la structuration de données, la route ne prend pas nativement en charge le paramètre response_format pour garantir des sorties structurées de manière déterministe. Les applications devront donc procéder à une validation systématique du JSON en aval.

Positionnement concurrentiel et performances comparées

Les évaluations rigoureuses partagées par le constructeur mettent en évidence l'efficacité redoutable d'Inkling-Small, qui surpasse parfois son aîné sur des tâches complexes lorsqu'il est configuré sur un niveau de raisonnement élevé :

  • Raisonnement scientifique et académique : Le modèle atteint un score remarquable de 89,5 % sur le benchmark GPQA Diamond et s'illustre avec 31,6 % sur Humanity's Last Exam (dépassant les 29,7 % affichés par le modèle Inkling standard).
  • Compétences en mathématiques et programmation : Inkling-Small brille particulièrement sur AIME 2026 avec un score de 95,5 %, tandis qu'il s'impose comme un outil agentique d'élite en affichant 80,2 % sur SWE-bench Verified et 64,7 % sur Terminal-Bench 2.1.
  • Capacités multimodales : En vision, le modèle enregistre 74,0 % sur MMMU Pro. Ses performances audio se traduisent par un score de 77,0 % sur MMAU et de 90,1 % sur VoiceBench.

Il convient néanmoins d'apporter une nuance importante quant à la factualité pure. Sur le benchmark SimpleQA Verified, le grand modèle Inkling conserve l'avantage avec un taux de réussite de 26,0 % contre 20,6 % pour Inkling-Small. De plus, ces métriques de performance, bien que prometteuses, doivent être analysées avec recul, le fabricant ayant parfois recours à des protocoles d'évaluation internes ou à des résultats auto-reportés.

Cas d'usage pratiques et limites de l'architecture

Grâce à sa polyvalence et ses facultés agentiques, Inkling-Small est particulièrement recommandé pour les applications professionnelles suivantes :

  • Le développement assisté et la complétion de code au sein d'environnements complexes.
  • Le déploiement d'agents autonomes interagissant avec des API externes.
  • Les architectures de génération augmentée par récupération (RAG) exploitant de volumineux corpus documentaires.
  • L'analyse combinée de documents textuels, de graphiques visuels et d'enregistrements audio.

Cependant, les utilisateurs doivent composer avec des contraintes opérationnelles précises. Si le modèle est téléchargeable pour un hébergement sur site, son exécution en précision native BF16 exige une infrastructure matérielle massive avec au moins 600 Go de VRAM agrégée. L'utilisation du format compressé NVFP4 permet de ramener ce prérequis à 180 Go de VRAM.

Sur le plan comportemental, le modèle n'est pas exempt des faiblesses inhérentes aux grands modèles de langage. Des hallucinations factuelles peuvent survenir, l'alignement sur les instructions peut s'éroder au fil des longues sessions de chat, et des biais culturels ou linguistiques subsistent. De surcroît, le modèle montre des vulnérabilités face à des techniques de contournement de sécurité (« jailbreaks ») lorsqu'elles exploitent des formulations indirectes ou des scénarios de jeu de rôle. À ce titre, Thinking Machines Lab préconise une validation humaine stricte et des garde-fous applicatifs additionnels pour tout déploiement dans des secteurs hautement critiques comme le médical ou le juridique.

Pour sa déclinaison distribuée via la route :batch d'OpenRouter, Inkling-Small offre une enveloppe opérationnelle optimisée :

  • Fenêtre de contexte maximale effective : 524 288 tokens (bien que la fenêtre native théorique s'élève à 1 million de tokens).
  • Limite de complétion : 471 859 tokens maximum par requête.
  • Tarification de l'inférence : Une tarification très attractive s'applique avec 0,50 $ par million de tokens d'entrée, 1,20 $ par million de tokens de sortie, et un coût réduit à 0,10 $ par million de tokens pour la lecture d'éléments depuis le cache.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Texte

Type principal de contenu traité ou produit par ce modèle.

Vision

Analyse d'images fournies en entrée (photos, captures, documents visuels).

Fichiers

Peut s'appuyer sur des fichiers joints (documents, extraits) en plus du texte.

Outils

Peut appeler des outils ou des fonctions (recherche, calcul, actions).

Raisonnement

Peut enchaîner une réflexion prolongée avant de répondre, utile pour les tâches difficiles.

Audio

Traite ou produit de l'audio (voix, musique, effets).

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    d'Inkling-Small (batch)

    Dernière version

    thinkingmachines/inkling-small:batch

    VisionFichiersOutilsRaisonnementAudio
    Fenêtre de contexte
    524 288 jetons
    Sortie maximale
    471 859 jetons
    Fenêtre de contexte (OpenRouter)
    524 288 tokens
    Plafond de complétion
    471 859 tokens
    Architecture MoE
    276B paramètres (12B actifs par token)
    Licence
    Apache 2.0
    Tarification d'entrée
    0,50 $ / million de tokens
    Tarification de sortie
    1,20 $ / million de tokens

    Tarif annoncé : 0.50 $ en entrée, 1.20 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca