StartHub accompagne les dirigeants à chaque étape du développement de leur entreprise en réunissant stratégie, expertise et les meilleurs partenaires autour de leurs projets.

Contact
Téléphone +352 27 04 82 37
Adresse 16 Zone d'Activités Economiques L-8287 Kehlen
Suivez-nous
Contact
Téléphone +352 27 04 82 37
Adresse 16 Zone d'Activités Economiques L-8287 Kehlen
Suivez-nous

RLHF — apprentissage à partir de préférences humaines

IA : modèles

RLHF — apprentissage à partir de préférences humaines

Le RLHF utilise des retours humains dans un processus d’apprentissage par renforcement pour orienter le comportement d’un modèle.

Comprendre la notion

Des comparaisons de réponses peuvent alimenter un modèle de récompense, puis une étape d’optimisation. Cette famille de méthodes cherche notamment à rapprocher les réponses des préférences attendues. D’autres méthodes d’alignement existent ; toute adaptation par préférences n’est pas nécessairement du RLHF.

Exemple d’utilisation

Des évaluateurs préfèrent une réponse qui reconnaît son incertitude à une réponse catégorique mais non étayée.

Point de vigilance

Les préférences des évaluateurs ne garantissent pas la vérité factuelle. Elles doivent être complétées par des tests métier et de fiabilité.

Bâtissons l'avenir ensemble.

Vous pouvez modifier votre choix à tout moment depuis « Gérer les cookies » en bas de page.

Votre choix est conservé pendant six mois dans ce navigateur. Aucun outil publicitaire n’est installé. La mesure d’audience est facultative.

Détails sur les cookies

Rechercher sur le site

Saisissez au moins deux caractères.