모든 불일치가 학습 가능한 것은 아니다: 온-폴리시 증류에서의 토큰 학습 가능성
Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation
TL;DR AI
1분핵심 요약
이 논문은 온-폴리시 증류에서 학습 가능한 교사 수정과 맞지 않는 불일치를 구분하기 위해 Token Teachability를 제안한다.
이를 바탕으로 TA-OPD를 제안해, 모든 토큰 차이를 학습하지 않고 teachability가 높은 위치만 선택한다.
Qwen2.5와 Qwen3 실험에서 TA-OPD는 전체 토큰 OPD와 비슷하거나 더 나은 성능을 보였고, 사용 토큰은 약 5%에 그쳤다.
보상 모델이나 검증기 없이도 적은 교사 신호로 더 효율적으로 학습할 수 있음을 보여준다.
