Qu'est-ce que KV cache ?

Mémoire qui stocke les clés et valeurs d'attention déjà calculées pendant la génération d'un LLM, pour ne pas les recalculer à chaque nouveau jeton. Accélère l'inférence mais occupe de la VRAM proportionnelle à la longueur du contexte.