인간의 선호로부터 배우기
Learning from human preferences

TL;DR AI
1분핵심 요약
AI 에이전트는 행동 영상 클립에 대한 인간의 비교를 바탕으로 보상 모델을 추론하며 백플립을 배우게 됐다.
처음에는 무작위 행동으로 시작했지만, 인간의 선호 판단을 활용한 강화학습으로 성능을 개선했다.
또한 불확실한 경우에만 선별적으로 피드백을 요청해 학습 효율을 높였다.
이 방법은 사람이 직접 설계한 보상 없이도 적은 양의 인간 피드백으로 복잡한 과제를 학습할 수 있음을 보여준다.

