Inférence & performance
Batching
Regroupement de travaux pour les exécuter ensemble et mieux utiliser certaines ressources.
StartHub accompagne les dirigeants à chaque étape du développement de leur entreprise en réunissant stratégie, expertise et les meilleurs partenaires autour de leurs projets.
Comprendre les notions utiles pour structurer un projet, piloter une entreprise et éclairer ses décisions.
1–12 sur 15 définitions
Effacer les filtresInférence & performance
Regroupement de travaux pour les exécuter ensemble et mieux utiliser certaines ressources.
Inférence & performance
Un cache conserve temporairement un résultat ou une donnée afin d’éviter de refaire un traitement ou un accès coûteux.
Inférence & performance
Le CPU est le processeur généraliste qui exécute les instructions principales d’un système informatique.
Inférence & performance
Le débit mesure la quantité de travail traitée par un système pendant une unité de temps.
Inférence & performance
Phase durant laquelle un modèle génératif produit les éléments successifs de sa sortie.
Inférence & performance
Le GPU est un processeur conçu pour exécuter de nombreux calculs en parallèle, utilisé notamment pour les graphismes et certains traitements d’IA.
Inférence & performance
Temps observé entre les tokens successifs pendant la génération.
Inférence & performance
Mémoire qui conserve certaines représentations calculées par les couches d’attention pour éviter de les recalculer à chaque étape.
Inférence & performance
La latence est le temps écoulé entre une action ou une requête et le résultat mesuré à un point défini.
Inférence & performance
Répartition de certaines opérations et représentations d’un modèle entre plusieurs dispositifs de calcul.
Inférence & performance
Phase d’inférence durant laquelle le modèle traite les éléments du contexte initial.
Inférence & performance
Choix du modèle ou du chemin de traitement utilisé pour une requête.