Un VLM open weights taillé pour les usages locaux et temps réel
LFM2.5-VL-3B associe vision, compréhension d’interfaces et function calling dans un modèle open weights de 3 milliards de paramètres conçu pour tourner en local.
LFM2.5-VL-3B étend la famille LFM2.5 aux usages multimodaux avec un modèle de 3,1 milliards de paramètres capable d’analyser des écrans, documents, graphiques et scènes du monde physique. Il peut également localiser des objets à partir d’une instruction, traiter plusieurs images et appeler des fonctions depuis une entrée texte ou image.
Le modèle repose sur la base LFM2.5-2.6B associée à un encodeur visuel SigLIP2 NaFlex de 400 millions de paramètres. Liquid AI indique avoir porté le pré-entraînement à environ 34 000 milliards de tokens, multiplié par quatre le volume consacré à la vision et étendu le vocabulaire à 128 000 entrées. Le post-training combine SFT avec distillation depuis un modèle plus important, Antidoom training et reinforcement learning multi-récompenses.
Une partie du travail porte sur l’interaction avec les interfaces. Selon les évaluations de Liquid AI, LFM2.5-VL-3B atteint 80,7 en moyenne sur ScreenSpot-v2, contre 51,2 pour Gemma-4-E4B. Sur RefCOCO, le score moyen passe de 57,1 avec LFM2-VL-3B à 87,9, tandis que ToolSandbox progresse de 26,4 à 59,5. Le modèle atteint également 84,3 sur TextVQA et 73,1 sur RealWorldQA. Ces résultats proviennent du protocole de benchmark publié par Liquid AI et ne constituent pas une évaluation indépendante.
LFM2.5-VL-3B reste un modèle sans raisonnement explicite, conçu pour répondre directement afin de réduire la latence. Liquid AI mesure 228 tokens par seconde sur Apple M5 Max et 116 sur AMD Ryzen AI Max+ 395, avec environ 3 Go de mémoire. Sur un Galaxy S26 Ultra, l’entreprise indique atteindre 20 tokens par seconde. Sur une NVIDIA H100, ses tests font état d’environ 34 ms avant le premier token sur une entrée multi-images et d’un débit proche de 11 000 tokens de sortie par seconde à forte concurrence.
Le modèle est proposé en open weights et prend en charge dès sa sortie llama.cpp, MLX, vLLM, SGLang et ONNX. Liquid AI fournit également des versions GGUF, MLX et ONNX, ainsi qu’une démonstration WebGPU permettant d’exécuter le modèle directement sur l’appareil. Cette combinaison vise notamment les agents capables de lire et manipuler des interfaces, l’analyse documentaire, l’OCR, le grounding et les applications multimodales locales.