跳到内容
//
AI RESOURCE
HUB
资源索引
用途
合集
对比
提示词
教程
术语表
English
简体中文
日本語
Español
Français
Deutsch
한국어
[菜单]
首页
/
术语表
/
人类反馈强化学习(RLHF)
人类反馈强化学习(RLHF)
一种训练技术,基于人类评分学习奖励模型,使模型对齐人类偏好。
相关资源
大模型微调实战
学习如何微调大语言模型,包括 LoRA、QLoRA 等高效微调方法。