Un encodeur qui lit treize pages d'un coup, sans GPU
Les encodeurs Liquid AI lisent treize pages de texte sur un simple processeur. Ce que ces modèles open weights changent pour le traitement de données.
Tout le bruit va aux modèles qui écrivent. Les encodeurs, eux, ne produisent pas de texte : ils lisent, et convertissent ce qu'ils lisent en représentations exploitables pour classer, router ou filtrer. Ce sont les briques qui tournent en continu derrière un service, souvent sur simple processeur plutôt que sur carte graphique. Liquid AI en publie deux, LFM2.5-Encoder-230M et LFM2.5-Encoder-350M, en open weights.
Les deux modèles ne partent pas de zéro. Ils reprennent l'architecture hybride LFM2 et convertissent un décodeur causal, qui ne regarde que ce qui précède, en encodeur bidirectionnel, où chaque token voit aussi ce qui suit. Trois modifications le permettent : le masque d'attention devient bidirectionnel, les convolutions courtes lisent des deux côtés grâce à un remplissage symétrique, et l'entraînement masque 30 % des tokens là où BERT en masquait 15 %. Une seconde phase étend ensuite le contexte à 8 192 tokens, soit treize à quinze pages avalées d'une traite.
L'atout se voit surtout sur processeur, et d'autant plus que l'entrée s'allonge. À pleine longueur de contexte, l'entreprise mesure environ vingt-huit secondes par passe pour le modèle à 230 millions de paramètres, contre plus d'une minute et demie pour ModernBERT-base, soit un facteur de 3,7. Sur carte graphique l'écart se resserre, ModernBERT gardant même l'avantage en deçà d'un millier de tokens. Sur les tâches de classification, le modèle à 350 millions se place quatrième sur quatorze, derrière trois modèles plus volumineux dont un de presque dix fois sa taille.
Une chose distingue cette publication du lot. Le protocole d'évaluation est décrit, taux d'apprentissage choisi sur des tirages écartés du décompte puis moyenne sur cinq tirages neufs, et l'ensemble du dispositif, lanceurs et résultats bruts compris, est ouvert sur GitHub. Les modèles restent des bases à affiner tâche par tâche. Des démonstrations tournant sur processeur seul illustrent le routage de prompts, la détection de données personnelles et la vérification d'un texte contre des règles écrites en langage courant. En marge, l'encodeur est détourné en agent conversationnel qui compose sa réponse en démasquant progressivement, au lieu de l'écrire de gauche à droite.