TwiL-LM3 mise sur la spécialisation plutôt que sur la taille

TwiL-LM mise sur des modèles de 1,7 et 3 milliards de paramètres spécialisés dans la logique formelle, avec exécution locale et poids sous licence non commerciale.

TwiL-LM est une nouvelle famille de modèles spécialisés dans le raisonnement formel développée par le webAI Intelligence Lab. Deux variantes sont mises en avant, à 1,7 et 3 milliards de paramètres, avec un positionnement volontairement étroit : traduire du langage naturel en logique formelle, vérifier si une conclusion découle de prémisses et traiter des raisonnements déductifs en plusieurs étapes.

La version TwiL-LM3 constitue la plus performante des deux. Dans la suite de cinq benchmarks utilisée par webAI, le modèle de 3 milliards de paramètres dépasse gpt-oss-120b sur quatre évaluations malgré un nombre de paramètres environ 40 fois inférieur. webAI rapporte notamment 96,4 contre 65,2 en rule induction, 87,6 contre 43,3 en semantic parsing, 64,6 contre 63,1 en formalisation Lean et 52 contre 7 sur une tâche imposant un format de réponse exact. gpt-oss-120b conserve l’avantage sur l’entailment labeling, avec 77,5 contre 68,7.

Ces résultats concernent toutefois une spécialisation bien précise et ne permettent pas de conclure à une supériorité générale du petit modèle. webAI positionne TwiL comme une couche de raisonnement pouvant intervenir dans des usages tels que le tool calling, les sorties structurées, la vérification de règles, certaines tâches de code ou l’analyse de conditions contractuelles.

La société met également en avant l’exécution locale. Dans ses propres tests, TwiL-LM3 atteint 32,9 réponses par seconde contre 12,6 pour gpt-oss-120b. La variante 1,7B est encore plus compacte : sa version quantifiée Q4KM pèse environ 1,06 Go et peut être utilisée avec llama.cpp. Le dépôt officiel précise toutefois que cette version est en réalité un adaptateur LoRA appliqué à SmolLM2-1.7B-Instruct, avec environ 72 millions de paramètres entraînables supplémentaires.

Le modèle 1,7B est surtout destiné à la logique formelle et son propre model card appelle à la prudence hors de ce périmètre. Les résultats publiés montrent par exemple des gains sur LogicBench, mais des performances inférieures au modèle de base sur plusieurs évaluations généralistes comme GSM8K ou ARC-Challenge. webAI recommande également de coupler les sorties formelles sensibles avec un solveur symbolique, un theorem prover ou une autre forme de vérification.

Un point mérite enfin d’être distingué dans la communication de l’entreprise. David Stout présente TwiL-LM3 comme une publication « open-source » sur 𝕏, mais le dépôt officiel disponible sur Hugging Face utilise la webAI Non-Commercial License v1.0. Cette licence réserve l’utilisation des poids à la recherche et à l’éducation non commerciales. Il est donc plus précis de parler de poids téléchargeables sous licence non commerciale que d’open source au sens habituel.