AI 안전과 정렬
AI 시스템이 인간의 가치와 의도된 목표에 맞게 행동하도록 보장하는 분야입니다.
실무적으로는 RLHF, 레드티밍, 가드레일, 거부 학습처럼 모델을 유용하고 정직하며 무해하게 유지하는 기법들을 아우릅니다. 자율 에이전트가 실제 세계에서 행동할수록 그 중요성은 커집니다.
AI 시스템이 인간의 가치와 의도된 목표에 맞게 행동하도록 보장하는 분야입니다.
실무적으로는 RLHF, 레드티밍, 가드레일, 거부 학습처럼 모델을 유용하고 정직하며 무해하게 유지하는 기법들을 아우릅니다. 자율 에이전트가 실제 세계에서 행동할수록 그 중요성은 커집니다.