언어 바꾸기English
이전 목록

언어 모델을 위한 RLVR에서의 학습 불가능성 현상

The Unlearnability Phenomenon in RLVR for Language Models

TL;DR AI

핵심 요약

1분
  1. 연구진은 정답 롤아웃이 존재해도 일부 어려운 RLVR 학습 예제는 언어 모델이 끝내 학습하지 못한다는 점을 확인했다.

  2. 논문은 이런 실패의 원인을 단순한 최적화 부족이 아니라 낮은 예제 간 그래디언트 유사도와 잘못된 내부 표현으로 설명한다.

  3. 샘플링 개선, 최적화 방법 변경, 데이터 증강 같은 일반적 대응책도 문제를 해결하지 못했다.

  4. 이번 결과는 현재 RL 기반 추론 학습에 구조적 한계가 있을 수 있으며, 더 나은 학습만으로는 모든 난제를 풀 수 없음을 시사한다.

원문 보기