IA : modèles
Apprentissage par renforcement
L’apprentissage par renforcement optimise une stratégie d’action à partir de retours, souvent exprimés sous forme de récompense.
Comprendre la notion
Un agent interagit avec un environnement et ajuste son comportement pour améliorer un objectif cumulé. Concevoir la récompense est déterminant : un objectif mal formulé peut favoriser des comportements efficaces pour le score mais inadaptés au besoin. Les essais en simulation limitent certains risques d’expérimentation.
Exemple d’utilisation
Un système explore des règles de planification dans un simulateur avant toute utilisation sur une installation réelle.
Point de vigilance
Une bonne récompense dans le simulateur ne garantit pas un bon comportement dans un environnement différent.