Inférence & performance
Latence
La latence est le temps écoulé entre une action ou une requête et le résultat mesuré à un point défini.
Comprendre la notion
Elle peut couvrir le réseau, les files d’attente, le calcul et l’affichage. La médiane ne décrit pas les requêtes les plus lentes : des percentiles comme le p95 aident à suivre l’expérience d’une part plus large des utilisateurs. Pour une réponse diffusée progressivement, distinguer premier résultat et fin du traitement.
Exemple d’utilisation
Une API suit le délai jusqu’au premier token et le délai jusqu’à la réponse complète.
Point de vigilance
Comparer des latences exige le même périmètre, une charge comparable et des tailles d’entrée documentées.
Articles associés
- Choisir un modèle d’IA : construire un benchmark adapté à son métier
- Superviser un SaaS : détecter les incidents avant les utilisateurs
- Retrieve-for-Train : une autre approche de la recherche par IA
- RAG ou fine-tuning : choisir selon le problème à résoudre
- Jev de TypeSafe : comprendre l’IA de décision de Diogo Almeida