コンテンツへスキップ
//
AI RESOURCE
HUB
リソース
ユースケース
コレクション
比較
プロンプト
チュートリアル
用語集
English
简体中文
日本語
Español
Français
Deutsch
한국어
[メニュー]
ホーム
/
用語集
/
人間のフィードバックによる強化学習(RLHF)
人間のフィードバックによる強化学習(RLHF)
人間の評価から学んだ報酬モデルを用いて、モデルを人間の好みに合わせる学習技法。
関連リソース
LLM ファインチューニング実践
大規模言語モデルのファインチューニング方法を学習。LoRA や QLoRA などの効率的な手法を含む。