언어 바꾸기English
이전 목록

모든 루브릭이 똑같이 가르치지는 않는다: RLVR을 위한 정책 인지형 루브릭 보상

Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR

TL;DR AI

핵심 요약

1분
  1. 연구진은 RL 후학습에 쓰이는 많은 루브릭 기준이 실제로는 특정 정책에 대해 대비 학습 신호를 만들지 못한다는 점을 발견했다.

  2. 고정된 루브릭 가중치는 학습 압력을 잘못된 방향으로 보낼 수 있어, 팀은 최종 평가 기준은 유지하되 학습 중 기준 가중치를 조정하는 POW3R를 제안했다.

  3. POW3R는 여러 정책과 설정, 특히 멀티모달 및 HealthBench 계열 평가에서 기준 방법보다 더 좋은 성능을 보였다.

  4. 비슷한 성능을 약 2.5~4배 적은 학습 단계로 달성해 샘플 효율성도 높였다.

원문 보기