Aller au contenu

RLHF

Technique d’entraînement qui aligne les modèles sur les préférences humaines via un modèle de récompense appris à partir d’évaluations humaines.

Le RLHF explique en grande partie pourquoi les chatbots paraissent serviables et polis au lieu de simplement prédire du texte probable. Des variantes récentes comme DPO obtiennent un alignement comparable avec un entraînement plus simple.

Ressources associées