IA : modèles
Inférence
Exécution d’un modèle entraîné pour produire un résultat à partir d’une nouvelle entrée.
Comprendre la notion
Elle se distingue de l’entraînement, qui modifie les paramètres. Son coût et sa latence dépendent notamment du modèle, du matériel, de la longueur des entrées et de la concurrence des requêtes.
Exemple d’utilisation
Une API calcule une réponse sans réentraîner le modèle pour cet appel.
Point de vigilance
Un test isolé ne représente pas nécessairement la charge de production.
Références pour approfondir
Articles associés
- Quand l’IA coûte moins cher : pourquoi le budget total peut quand même augmenter
- NVIDIA et CUDA : pourquoi le logiciel compte autant que la puce dans un projet IA
- ASML et TSMC : comprendre la chaîne industrielle derrière les puces d’IA
- IA de raisonnement : quel budget de calcul consacrer à chaque décision ?
- s1 et le test-time scaling : comprendre l’effort de calcul au moment de répondre