본문으로 건너뛰기

AI 안전과 정렬

AI 시스템이 인간의 가치와 의도된 목표에 맞게 행동하도록 보장하는 분야입니다.

실무적으로는 RLHF, 레드티밍, 가드레일, 거부 학습처럼 모델을 유용하고 정직하며 무해하게 유지하는 기법들을 아우릅니다. 자율 에이전트가 실제 세계에서 행동할수록 그 중요성은 커집니다.

관련 리소스