人类反馈强化学习(RLHF)一种训练技术,基于人类评分学习奖励模型,使模型对齐人类偏好。RLHF 是聊天机器人显得有用、礼貌而非仅仅预测可能文本的重要原因。DPO 等更新的变体用更简单的训练方式实现类似的对齐效果。