언어 바꾸기English
이전 목록

LongTraceRL: 검색 에이전트 궤적과 루브릭 보상으로 긴 문맥 추론 학습

LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards

TL;DR AI

핵심 요약

1분
  1. 연구진은 LLM의 장문 맥락 추론을 위한 강화학습 프레임워크 LongTraceRL을 제안했다.

  2. 검색 에이전트 궤적과 지식그래프 기반 다중 홉 질문으로 더 어려운 학습 예시를 만들고, 단계적 방해 요소를 추가했다.

  3. 정답에만 엔티티 수준의 rubric 보상을 적용해, 근거에 더 충실한 추론을 유도했다.

  4. 5개 벤치마크와 4B~30B 규모 모델에서 강력한 기준선을 앞서며 장문 맥락 과제 성능을 높였다.

원문 보기