학습된 신뢰성을 활용한 프로세스 보상
Process Rewards with Learned Reliability
TL;DR AI
1분핵심 요약
연구진은 각 단계의 성공 확률과 예측 신뢰도를 함께 추정하는 프로세스 보상 모델 BetaPRM을 제안했다. Beta-Binomial 방식이 핵심이다.
학습된 신뢰도 신호는 Adaptive Computation Allocation에 활용돼, 필요한 경우에만 계산 자원을 더 쓰도록 만들었다.
Best-of-N 추론에서 BetaPRM은 선택 성능을 높이면서도 토큰 사용량을 최대 33.57%까지 줄였다.
이번 연구는 단계별 보상 모델이 자기 신뢰도를 함께 추정할 때, 정확도와 효율성의 균형을 더 잘 맞출 수 있음을 보여준다.
