Inférence & performance
Prefill
Phase d’inférence durant laquelle le modèle traite les éléments du contexte initial.
Comprendre la notion
Elle prépare notamment les représentations utilisées pendant la génération. La longueur du contexte et l’organisation du calcul influencent son coût et le délai avant le début de la réponse.
Exemple d’utilisation
Un long dossier doit être traité avant l’émission des premiers tokens.
Point de vigilance
Les optimisations dépendent du moteur et du matériel.