RLHF의 이면: 보상 모델의 자기지도식 개선을 위한 온-폴리시 피드백
The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement
TL;DR AI
1분핵심 요약
연구진은 RLHF용 보상 모델을 자체적으로 개선하는 자기지도 프레임워크 SAVE를 제안했다.
SAVE는 온폴리시 응답을 가치 함수로 평가하고, 애매한 사례를 걸러낸 뒤, 대비 학습 목적함수로 보상 모델을 학습한다.
이 방법은 6개 벤치마크에서 강한 성능을 보였고, 여러 RL 알고리즘과 정책 백본에서도 일관된 향상을 냈다.
인간 선호 라벨 의존도를 줄이고, 정책이 바뀌어도 보상 모델 학습을 더 안정적으로 유지할 수 있다.
