Réduction de la précision numérique des poids (par exemple fp8, int4) pour alléger et accélérer un modèle.