그룹 상대 정책 최적화에서의 어드밴티지 붕괴: 진단과 완화
Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation

TL;DR AI
1분핵심 요약
연구진은 GRPO에서 보상이 균일한 배치가 비효율적인 그래디언트를 만들어 학습이 멈추는 ‘advantage collapse’ 문제를 확인했다.
이 문제를 측정하기 위해 무의미한 학습 배치의 비율을 나타내는 Advantage Collapse Rate(ACR)를 제안했다.
해결책으로 추가 롤아웃 없이 가상 보상 샘플을 활용해 붕괴를 줄이는 AVSPO를 제시했다.
AVSPO는 여러 모델 규모에서 대형 언어모델의 학습 안정성과 벤치마크 성능을 개선했다.
