Inférence & performance
Inter-token latency (ITL)
Temps observé entre les tokens successifs pendant la génération.
Comprendre la notion
Il contribue à la perception de fluidité. Les distributions et les interruptions sont plus informatives qu’une seule moyenne lorsque plusieurs requêtes partagent le serveur.
Exemple d’utilisation
Observer les pauses pendant une réponse diffusée en continu.
Point de vigilance
La granularité de diffusion peut différer du token interne.