Liquid AI ouvre deux modèles capables de décider sans générer de texte

Les modèles d1 de Liquid AI suppriment la génération de tokens pour accélérer la classification et le routage. Une approche qui réduit la latence locale.

Liquid AI publie d1-3B et d1-omni-600M, deux modèles open weight conçus non pas pour rédiger une réponse, mais pour prendre une décision structurée en un seul passage. La famille d1 cible des usages comme le reranking, la modération, la classification, les garde-fous d’agents, l’inspection visuelle ou le routage de commandes vocales.

Le principe les distingue des modèles génératifs classiques. Les modèles d1 ne produisent aucun token de sortie. Ils reçoivent un état, par exemple du texte, du JSON, une image ou un signal audio, ainsi qu’une série de questions ou d’options, puis retournent directement des réponses typées à partir de leur distribution de probabilités. Cette architecture réduit mécaniquement le temps passé à générer et à parser une réponse textuelle.

Le plus grand modèle, d1-3B disponible sur Hugging Face, repose sur LFM2.5-VL-3B et accepte simultanément texte et images. Il compte environ 3,1 milliards de paramètres et dispose d’un contexte de 32 768 tokens. Liquid AI le recommande notamment pour le routage, la classification, l’évaluation de réponses, les garde-fous d’agents et l’inspection visuelle.

Selon les évaluations publiées par Liquid AI, d1-3B obtient 48,57 sur le Decision Index v0.2.1, ce qui le place en tête des modèles de moins de 10 milliards de paramètres testés sur ce benchmark et légèrement devant Decider 35B-A3B, crédité de 47,11. Sur sept benchmarks textuels publics, Liquid AI rapporte également une moyenne de 82,9, devant Decider 4B à 81,1. Ces résultats restent ceux communiqués par l’entreprise.

Le second modèle, d1-omni-600M, est beaucoup plus compact. Sa taille réelle est d’environ 587 millions de paramètres et il repose sur LFM2.5-Encoder-350M, auquel Liquid AI a ajouté des encodeurs dédiés à la vision et à l’audio. Il peut traiter texte + image ou texte + audio, avec jusqu’à 30 secondes de parole dans un seul passage.

Cette variante expérimentale vise surtout les appareils où l’empreinte mémoire devient critique. Liquid AI cite le routage de commandes vocales, la modération locale ou la classification d’intentions. Sur ses propres comparaisons textuelles, d1-omni-600M atteint notamment 95,8 sur Civil Comments et 79,5 sur PAWS-X, les meilleurs scores du tableau publié par l’entreprise sur la détection de toxicité et l’identification de paraphrases.

L’autre axe du lancement concerne directement l’inférence locale. Liquid AI annonce un support dès le départ de llama.cpp et un fonctionnement sur l’ensemble de la gamme NVIDIA, du DGX aux machines RTX puis aux Jetson embarqués. Sur d1-3B, l’entreprise mesure 8 ms pour une décision simple sur RTX 4090, 16 ms sur Jetson AGX Thor, 26 ms sur AGX Orin 64 Go et 50 ms sur Orin Nano. Sur AMD MI325X, le même test descend à 9 ms.

Pour les usages visuels, Liquid AI mesure le traitement d’une image de 384 px en 17 ms sur RTX 4090, 18 ms sur AMD MI325X, 35 ms sur Jetson AGX Thor et 202 ms sur Orin Nano. Ces chiffres correspondent à des mesures réalisées par Liquid AI, une requête à la fois, et ne constituent donc pas des benchmarks indépendants de déploiement réel.

Liquid AI fournit aussi une version quantifiée de d1-3B destinée notamment aux GPU NVIDIA et aux Jetson. d1-3B-w8a8 utilise des poids et activations INT8 et réduit la taille du checkpoint d’environ 6,2 Go à 3,8 Go. L’objectif est de laisser davantage de mémoire disponible aux autres composants d’une application embarquée.

Pour illustrer ces usages, Liquid AI a construit dix démonstrations reposant sur un flux de caméra en direct, du jeu contrôlé par gestes à la modération visuelle. Chaque image est évaluée à travers un seul passage du modèle. En collaboration avec NVIDIA, l’entreprise montre également d1-3B pilotant une navigation dans Isaac Sim avec le modèle exécuté sur un Jetson.

La famille d1 ne sort pas de nulle part. Quelques jours plus tôt, Liquid AI avait présenté son premier modèle d1 propriétaire, capable d’analyser texte et images et comparé à GPT-6.1 Sol et Claude Opus 5.5 sur plusieurs scénarios décisionnels. Avec Open d1, l’entreprise décline désormais cette approche sous forme de modèles téléchargeables et exécutables localement.

L’intérêt de d1 tient donc moins à sa capacité à converser qu’à son refus même de le faire. Là où un modèle généraliste doit générer une réponse avant qu’un système puisse l’interpréter, d1 est conçu pour retourner directement une décision exploitable. Sur un serveur, un poste de travail ou un appareil embarqué, cette spécialisation peut réduire fortement la latence et le coût pour toutes les tâches où une réponse longue n’apporte rien.