언어 바꾸기English
이전 목록

최소한의 RLVR 훈련만으로 충분하다: Rank-1 궤적을 통한 LLM 외삽

You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories

TL;DR AI

핵심 요약

1분
  1. 연구진은 LLM의 RLVR 업데이트가 매우 저랭크이며, 대부분의 변화가 학습 초반부터 거의 선형적인 rank-1 궤적으로 포착된다는 점을 발견했다.

  2. 이 패턴을 바탕으로 RELEX를 제안했으며, 초기 체크포인트의 방향을 선형회귀로 추정해 이후 시점을 별도 예측기 없이 외삽한다.

  3. RELEX는 전체 RLVR 학습과 비슷하거나 더 나은 벤치마크 성능을 보이면서도 약 15% 수준의 계산량만 사용한다.

  4. 이는 짧은 학습만으로도 RLVR의 상당한 효과를 회수할 수 있음을 시사하며, LLM 추론 학습의 동역학에 대한 새로운 해석을 제공한다.

원문 보기