Inférence & performance
Decode
Phase durant laquelle un modèle génératif produit les éléments successifs de sa sortie.
Comprendre la notion
La génération utilise l’état préparé et mis à jour au fil des tokens. Sa performance dépend notamment de la mémoire, de la concurrence et de l’organisation des lots.
Exemple d’utilisation
Une réponse s’affiche progressivement après le premier token.
Point de vigilance
Le débit total du serveur et la fluidité d’une réponse sont deux mesures différentes.