언어 모델을 위한 RLVR에서의 학습 불가능성 현상
The Unlearnability Phenomenon in RLVR for Language Models
TL;DR AI
1분핵심 요약
연구진은 정답 롤아웃이 존재해도 일부 어려운 RLVR 학습 예제는 언어 모델이 끝내 학습하지 못한다는 점을 확인했다.
논문은 이런 실패의 원인을 단순한 최적화 부족이 아니라 낮은 예제 간 그래디언트 유사도와 잘못된 내부 표현으로 설명한다.
샘플링 개선, 최적화 방법 변경, 데이터 증강 같은 일반적 대응책도 문제를 해결하지 못했다.
이번 결과는 현재 RL 기반 추론 학습에 구조적 한계가 있을 수 있으며, 더 나은 학습만으로는 모든 난제를 풀 수 없음을 시사한다.
