GoLongRL: 멀티태스크 정렬을 통한 역량 지향 장문 컨텍스트 강화학습
GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
TL;DR AI
1분핵심 요약
GoLongRL은 9개 역량 유형을 아우르는 2.3만 샘플 규모의 완전 공개 장문 컨텍스트 RLVR 프레임워크다.
학습 과정에서는 TMN-Reweight를 적용해 서로 다른 멀티태스크 보상을 더 안정적으로 조정한다.
보고된 성능은 비공개 데이터셋 기준선을 앞섰고, 훨씬 큰 선도 모델들과 비슷한 수준에 도달했다.
이 연구는 장문 추론을 강화하는 공개 데이터, 코드, 학습 레시피를 함께 제공한다.
