LongTraceRL: 검색 에이전트 궤적과 루브릭 보상으로 긴 문맥 추론 학습
LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards
TL;DR AI
1분핵심 요약
연구진은 LLM의 장문 맥락 추론을 위한 강화학습 프레임워크 LongTraceRL을 제안했다.
검색 에이전트 궤적과 지식그래프 기반 다중 홉 질문으로 더 어려운 학습 예시를 만들고, 단계적 방해 요소를 추가했다.
정답에만 엔티티 수준의 rubric 보상을 적용해, 근거에 더 충실한 추론을 유도했다.
5개 벤치마크와 4B~30B 규모 모델에서 강력한 기준선을 앞서며 장문 맥락 과제 성능을 높였다.
