La compression de modèles avance côté Pruna

Pruna v0.3.4 optimise son framework open source avec Llama.cpp, le token merging et KVPress pour stabiliser la compression de modèles d'IA.

Avec sa version v0.3.4, Pruna élargit son framework open source d’optimisation de modèles avec trois apports venus de contributeurs externes : l’intégration de Llama.cpp, le token merging pour la classification d’images et KVPress pour la compression du KV cache. Cette version travaille aussi la compatibilité avec Transformers 5, TorchAO jusqu’à 0.17.0 et des versions plus récentes de Torch, tout en supprimant certaines dépendances devenues instables ou obsolètes.

L’intérêt se situe moins dans une nouveauté spectaculaire que dans la consolidation de l’outil : installations plus fiables, meilleure stabilité selon les backends, corrections autour de la compilation, des datasets audio, des tests et de la gestion des dépendances.

La documentation progresse également, notamment pour faciliter les contributions, l’ajout d’extras et la politique de contribution assistée par IA.