Un modèle de 280 millions de paramètres accélère LFM2.5-VL sans modifier ses réponses
Liquid AI adapte son speculative decoding DSpark aux modèles vision-langage avec un drafter expérimental pour LFM2.5-VL-3B. La méthode atteint jusqu’à 3,13 fois la vitesse de décodage initiale sur Apple Silicon et 2,66 fois sur H100, sans modifier la distribution des réponses du modèle cible.
Prédire plusieurs tokens avant de les vérifier
Faire répondre plus vite un modèle vision-langage ne nécessite pas forcément de modifier le modèle lui-même. Avec LFM2.5-VL-DSpark, Liquid AI transpose au multimodal une technique déjà utilisée sur ses modèles textuels : le speculative decoding.
Un modèle auxiliaire beaucoup plus léger anticipe plusieurs tokens à partir des états internes de LFM2.5-VL-3B. Le modèle principal vérifie ensuite ce bloc en une seule passe plutôt que de générer chaque token successivement.
Pour le drafter, la distinction entre texte et image a déjà largement disparu à ce stade du calcul. Les tokens textuels et les représentations issues des images sont présents sous forme de tenseurs dans les couches internes du modèle, ce qui permet à Liquid AI de reprendre le même principe que pour ses modèles textuels. 279,5 millions de paramètres supplémentaires
Le drafter retenu compte quatre couches utilisant uniquement de l’attention et 279,5 millions de paramètres. Son ajout augmente de 8,9 % le nombre de paramètres du système déployé. Les embeddings et la LM head restent partagés avec le modèle cible et ne sont donc pas dupliqués.
Liquid AI a entraîné différentes variantes avant de retenir un block size de 9 pendant l’entraînement, puis 8 ou 9 à l’inférence selon le matériel. L’ensemble des expériences et ablations consacrées au drafter a été entraîné sur du matériel AMD avec le framework interne de Liquid AI.
Le checkpoint est publié sur Hugging Face, avec une version GGUF. L’inférence est prise en charge par llama.cpp, MLX-VLM et SGLang. Jusqu’à 3,13 fois plus rapide sur Apple Silicon
Liquid AI a évalué DSpark sur six catégories de tâches visuelles, dont le VQA général, la lecture de texte dans les images, le captioning, l’analyse de graphiques, le raisonnement complexe et les conversations multi-tours.
Sur un MacBook Pro M5 Max avec MLX, le décodage est entre 2,30 et 3,13 fois plus rapide selon la tâche. Le gain mesuré sur l’ensemble du traitement se situe entre 1,56 et 2,62 fois.
Avec llama.cpp sur un M3 Ultra, l’accélération du décodage varie de 1,57 à 2,14 fois, pour un gain end-to-end compris entre 1,30 et 1,77 fois.
Sur une H100 80 Go avec SGLang, Liquid AI mesure entre 2,04 et 2,66 fois plus de débit pendant le décodage et entre 1,64 et 2,27 fois sur l’ensemble du traitement.
Ces mesures ont été réalisées à batch size 1 et température 0, en FP16 sur Apple Silicon et BF16 sur H100. Liquid AI utilise Pipette pour collecter ses résultats de performance. Accélérer sans changer la distribution des réponses
Le speculative decoding ne consiste pas à accepter systématiquement les propositions du petit modèle. Chaque token proposé reste vérifié par LFM2.5-VL-3B. Lorsqu’une proposition ne correspond pas à sa distribution, le modèle cible la rejette et génère une correction.
Avec des paramètres d’échantillonnage identiques, cette procédure conserve la distribution du modèle cible. Liquid AI qualifie donc la méthode de « lossless » : le drafter modifie la manière dont la génération est calculée, pas le modèle dont provient la réponse.
L’efficacité dépend toutefois du taux d’acceptation. Plus le drafter anticipe correctement les prochains tokens, plus plusieurs tokens peuvent être validés au cours d’une seule passe du modèle principal. Une température plus élevée augmente les divergences entre les deux modèles et réduit donc les gains de débit. L’image reste le principal angle mort
DSpark n’accélère pas toutes les étapes d’un modèle vision-langage. Avant de produire du texte, une image doit toujours passer par l’encodeur visuel, puis les centaines de tokens visuels obtenus doivent être traités pendant le prefill.
Le drafter n’intervient que pendant le décodage. Une tâche consacrant beaucoup de temps à l’analyse initiale de l’image bénéficiera donc moins de DSpark qu’une tâche générant une réponse longue.
L’écart apparaît directement dans les mesures de Liquid AI : le décodage peut atteindre 3,13 fois la vitesse initiale sur M5 Max, tandis que le gain end-to-end maximal descend à 2,62 fois. Sur M3 Ultra, les maxima passent respectivement de 2,14 à 1,77 fois.
Le gain dépend ainsi moins de la présence d’une image que de la proportion du temps total passée à générer des tokens après son traitement.