Inférence & performance
KV cache
Mémoire qui conserve certaines représentations calculées par les couches d’attention pour éviter de les recalculer à chaque étape.
Comprendre la notion
Sa taille contribue à la consommation mémoire et à la capacité de servir des contextes longs ou plusieurs séquences. Les stratégies de partage et de réutilisation dépendent du runtime.
Exemple d’utilisation
Un moteur conserve l’état du contexte pendant la génération.
Point de vigilance
Le partage d’un cache doit respecter les frontières d’accès de l’application.