프리픽스 리플레이를 활용한 멀티턴 온폴리시 증류
Multi-Turn On-Policy Distillation with Prefix Replay
TL;DR AI
1분핵심 요약
이 논문은 다중 턴 LLM 에이전트용 Replayed-Prefix On-Policy Distillation(ReOPD)을 제안한다.
저장된 교사 궤적을 prefix로 재사용해, 새 환경 상호작용 없이도 촘촘한 교사 감독으로 학생 모델을 학습시킨다.
다중 턴 OPD에서 발생하는 ‘prefix trap’을 발견하고, 더 이른 prefix를 더 자주 쓰는 단계적 감쇠 샘플링으로 완화한다.
그 결과 환경 롤아웃과 교사 질의 비용을 줄이면서도 성능을 유지해, 에이전트형 태스크의 확장성을 높인다.