RLHF
사람의 평가로 학습한 보상 모델을 통해 모델을 인간 선호에 맞추는 학습 기법입니다.
챗봇이 그럴듯한 텍스트 예측기를 넘어 도움이 되고 예의 바르게 느껴지는 데는 RLHF의 공이 큽니다. DPO 같은 최신 변형은 더 단순한 학습 구성으로 비슷한 정렬 효과를 냅니다.
사람의 평가로 학습한 보상 모델을 통해 모델을 인간 선호에 맞추는 학습 기법입니다.
챗봇이 그럴듯한 텍스트 예측기를 넘어 도움이 되고 예의 바르게 느껴지는 데는 RLHF의 공이 큽니다. DPO 같은 최신 변형은 더 단순한 학습 구성으로 비슷한 정렬 효과를 냅니다.