AI 对齐专注于确保 AI 系统行为符合人类价值观与预期目标的领域。实践中它涵盖 RLHF、红队测试、护栏与拒答训练等技术,使模型有用、诚实且无害。随着自主 Agent 在现实中采取行动,它变得愈发关键。