AngelSpec accélère les réponses en faisant rédiger un brouillon à l’IA

Le framework AngelSpec de Tencent accélère la génération de texte en faisant vérifier des brouillons de tokens. Une optimisation pour la production.

Pour produire une réponse, un grand modèle génère habituellement les tokens les uns après les autres. AngelSpec cherche à raccourcir cette mécanique grâce au décodage spéculatif : un modèle plus léger propose plusieurs tokens à l’avance, puis le modèle principal les vérifie en une seule fois. Les propositions validées sont conservées, les autres sont remplacées, sans modifier le résultat attendu du modèle principal.

Le framework réunit plusieurs méthodes de création de ces brouillons. MTP privilégie des séquences courtes et convient davantage aux conversations ouvertes, où plusieurs formulations restent possibles. DFly produit davantage de tokens en parallèle et se montre plus adapté au code ou aux mathématiques, dont les suites sont généralement plus prévisibles. AngelSpec permet d’entraîner, d’évaluer et de comparer ces différentes architectures au sein d’un même environnement.

Un second mécanisme, baptisé D-cut, ajuste la quantité de texte à vérifier selon la charge du serveur et la confiance accordée à chaque proposition. Plutôt que de contrôler systématiquement l’intégralité des brouillons, il conserve en priorité les passages ayant le plus de chances d’être acceptés, afin d’éviter des calculs inutiles.

Sur Hy3-A21B, Tencent indique que DFly multiplie la vitesse de génération par 1,98 à 2,40 par rapport à une génération token par token, selon le nombre de requêtes traitées simultanément. Son débit moyen dépasserait également celui de DFlash de 10,5 à 11,8 %. Le code d’entraînement, plusieurs modèles de brouillon et les outils nécessaires à leur intégration sont publiés en open source.