비지도 프로세스 보상 모델
Unsupervised Process Reward Models
TL;DR AI
1분핵심 요약
연구진은 다음 토큰 확률을 이용해 최초 오류 지점을 찾는 비지도 과정 보상 모델 uPRM을 제안했다.
이 방법은 인간의 단계별 라벨 없이도 추론 검증과 오류 탐지를 수행할 수 있게 한다.
ProcessBench에서 uPRM은 지도학습 및 기존 기준선과 비교해 경쟁력 있거나 더 나은 성능을 보였다.
또한 강화학습 성능도 개선해, 추론용 보상 모델을 더 저렴하게 학습할 수 있는 길을 제시했다.
