CEPO: 대조적 증거 정책 최적화를 사용한 RLVR 자기 증류
CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization
TL;DR AI
1분핵심 요약
연구진은 검증 가능한 보상을 활용한 강화학습용 대비적 자기증류 기법 CEPO를 제안했다.
CEPO는 거부된 롤아웃을 부정 교사로 활용해 핵심 추론 단계와 불필요한 토큰을 구분한다.
이 방법은 학습 보장성을 유지하면서 공헌도 할당을 개선하고, 추가 샘플링 비용도 들지 않는다.
CEPO는 멀티모달 수학 벤치마크에서 GRPO, OPSD, SDPO 등 기존 방법보다 더 높은 성능을 보였다.
