언어 바꾸기English
이전 목록

모든 불일치가 학습 가능한 것은 아니다: 온-폴리시 증류에서의 토큰 학습 가능성

Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation

TL;DR AI

핵심 요약

1분
  1. 이 논문은 온-폴리시 증류에서 학습 가능한 교사 수정과 맞지 않는 불일치를 구분하기 위해 Token Teachability를 제안한다.

  2. 이를 바탕으로 TA-OPD를 제안해, 모든 토큰 차이를 학습하지 않고 teachability가 높은 위치만 선택한다.

  3. Qwen2.5와 Qwen3 실험에서 TA-OPD는 전체 토큰 OPD와 비슷하거나 더 나은 성능을 보였고, 사용 토큰은 약 5%에 그쳤다.

  4. 보상 모델이나 검증기 없이도 적은 교사 신호로 더 효율적으로 학습할 수 있음을 보여준다.

원문 보기