跳到内容

AI 对齐

专注于确保 AI 系统行为符合人类价值观与预期目标的领域。

实践中它涵盖 RLHF、红队测试、护栏与拒答训练等技术,使模型有用、诚实且无害。随着自主 Agent 在现实中采取行动,它变得愈发关键。

相关资源