어디서뿐 아니라 언제도: RLVR을 위한 시간적 스케줄링
Not Only Where, But When: Temporal Scheduling for RLVR
TL;DR AI
1분핵심 요약
연구진은 RLVR에서 보상 할당 기준을 시간에 따라 조정하는 temporal scheduling을 제안했다. 초기에는 토큰 수준의 특정 행동에 집중하고, 후반에는 더 넓은 최적화로 전환한다.
trajectory percentile을 활용해 행동을 구분하는 방식이 잘 작동했으며, 학습 안정성도 향상됐다.
이 방법은 정책 다양성을 유지하면서 수학 및 일반 추론 벤치마크 성능을 끌어올렸다.
