언어 바꾸기English
이전 목록

인간의 선호로부터 배우기

Learning from human preferences

TL;DR AI

핵심 요약

1분
  1. AI 에이전트는 행동 영상 클립에 대한 인간의 비교를 바탕으로 보상 모델을 추론하며 백플립을 배우게 됐다.

  2. 처음에는 무작위 행동으로 시작했지만, 인간의 선호 판단을 활용한 강화학습으로 성능을 개선했다.

  3. 또한 불확실한 경우에만 선별적으로 피드백을 요청해 학습 효율을 높였다.

  4. 이 방법은 사람이 직접 설계한 보상 없이도 적은 양의 인간 피드백으로 복잡한 과제를 학습할 수 있음을 보여준다.

원문 보기