추론 연쇄에서 검증 가능한 하위 문제로: 커리큘럼 강화학습이 LLM 추론의 크레딧 할당을 가능하게 한다
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
TL;DR AI
1분핵심 요약
연구진은 LLM 추론을 위한 커리큘럼 강화학습 기법 SCRL을 제안했다.
SCRL은 기준 추론 경로를 검증 가능한 하위 문제로 나누고, 하위 문제 단위로 보상을 정규화해 credit assignment를 개선한다.
7개 수학 벤치마크에서 강력한 커리큘럼 학습 기준선보다 더 좋은 성능을 보였고, 어려운 시험에서 정확도와 통과율을 높였다.
이 방법은 어려운 문제에서 정답이 너무 적게 나와 학습이 비효율적인 핵심 병목을 해결한다.
