コンテンツへスキップ

人間のフィードバックによる強化学習(RLHF)

人間の評価から学んだ報酬モデルを用いて、モデルを人間の好みに合わせる学習技法。

RLHF は、チャットボットが単に確からしい文を予測するのではなく有用で礼儀正しく感じられる大きな理由。DPO などの新手法はより簡単な学習で同様の整合を実現する。

関連リソース