적을수록 더 좋다: 온-폴리시 증류를 위한 조기 중단 롤아웃
Less is More: Early Stopping Rollout for On-Policy Distillation
TL;DR AI
1분핵심 요약
새로운 Early Stopping Rollout 방식은 on-policy distillation에서 교사 모델이 생성한 궤적을 앞부분 N토큰만 사용해 off-policy teacher decay를 줄입니다.
전체 롤아웃보다 더 안정적으로 학습되며, 다양한 과제·모델 크기·설정에서 성능도 더 좋게 나오는 경우가 많습니다.
FFT와 LoRA 학습 모두에서 최대 24배의 속도 향상을 보고했습니다.
또한 cascading alignment와 sub-mode commitment가 잘린 롤아웃도 이후 토큰 개선에 도움이 되며, 때로는 교사 성능을 넘어서는 이유라고 설명합니다.
