이전 목록

프리픽스 리플레이를 활용한 멀티턴 온폴리시 증류

Multi-Turn On-Policy Distillation with Prefix Replay

TL;DR AI

핵심 요약

1분
  1. 이 논문은 다중 턴 LLM 에이전트용 Replayed-Prefix On-Policy Distillation(ReOPD)을 제안한다.

  2. 저장된 교사 궤적을 prefix로 재사용해, 새 환경 상호작용 없이도 촘촘한 교사 감독으로 학생 모델을 학습시킨다.

  3. 다중 턴 OPD에서 발생하는 ‘prefix trap’을 발견하고, 더 이른 prefix를 더 자주 쓰는 단계적 감쇠 샘플링으로 완화한다.

  4. 그 결과 환경 롤아웃과 교사 질의 비용을 줄이면서도 성능을 유지해, 에이전트형 태스크의 확장성을 높인다.

원문 보기