Inkling réduit sa taille sans abandonner ses capacités multimodales
Le modèle Inkling-Small de Thinking Machines Lab réduit ses paramètres actifs à 12 milliards. Une optimisation qui redéfinit le coût du raisonnement.
Inkling-Small est une version open weights plus compacte du modèle de Thinking Machines Lab. Son architecture Mixture-of-Experts réunit 276 milliards de paramètres au total, mais n’en active que 12 milliards pour chaque requête, contre 41 milliards pour Inkling. L’entreprise rend disponibles les poids complets du modèle, sans pour autant présenter le projet comme open source.
Le modèle accepte nativement le texte, les images et l’audio, avec une fenêtre de contexte pouvant atteindre un million de tokens. Son niveau de raisonnement peut être ajusté selon cinq paliers, afin de moduler la quantité de calcul utilisée en fonction du coût, de la vitesse ou de la difficulté de la tâche.
Malgré sa taille réduite, Inkling-Small dépasse son prédécesseur sur plusieurs évaluations de raisonnement et d’usage d’outils. Il obtient 31,6 % sur Humanity’s Last Exam sans outils, contre 29,7 % pour Inkling, ainsi que 80,2 % sur SWE-bench Verified et 64,7 % sur Terminal-Bench 2.1. Le modèle principal conserve toutefois un avantage sur la couverture des connaissances et la factualité.
Cette efficacité repose notamment sur une nouvelle composition des données d’entraînement, une recette d’apprentissage revue et une phase de distillation utilisant Inkling comme professeur. Thinking Machines Lab a également poursuivi pendant deux semaines l’entraînement par renforcement consacré au code et aux tâches agentiques.
Inkling-Small peut être affiné dans Tinker ou utilisé dans Tinker Playground pour des échanges en texte, image et audio. Son entraînement a été réalisé sur des systèmes NVIDIA GB300 NVL72.