IA : modèles
RLHF — apprentissage à partir de préférences humaines
Le RLHF utilise des retours humains dans un processus d’apprentissage par renforcement pour orienter le comportement d’un modèle.
Comprendre la notion
Des comparaisons de réponses peuvent alimenter un modèle de récompense, puis une étape d’optimisation. Cette famille de méthodes cherche notamment à rapprocher les réponses des préférences attendues. D’autres méthodes d’alignement existent ; toute adaptation par préférences n’est pas nécessairement du RLHF.
Exemple d’utilisation
Des évaluateurs préfèrent une réponse qui reconnaît son incertitude à une réponse catégorique mais non étayée.
Point de vigilance
Les préférences des évaluateurs ne garantissent pas la vérité factuelle. Elles doivent être complétées par des tests métier et de fiabilité.