언어 바꾸기English
이전 목록

GoLongRL: 멀티태스크 정렬을 통한 역량 지향 장문 컨텍스트 강화학습

GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment

TL;DR AI

핵심 요약

1분
  1. GoLongRL은 9개 역량 유형을 아우르는 2.3만 샘플 규모의 완전 공개 장문 컨텍스트 RLVR 프레임워크다.

  2. 학습 과정에서는 TMN-Reweight를 적용해 서로 다른 멀티태스크 보상을 더 안정적으로 조정한다.

  3. 보고된 성능은 비공개 데이터셋 기준선을 앞섰고, 훨씬 큰 선도 모델들과 비슷한 수준에 도달했다.

  4. 이 연구는 장문 추론을 강화하는 공개 데이터, 코드, 학습 레시피를 함께 제공한다.

원문 보기