온-폴리시 증류를 위한 신뢰 영역 기반 행동 블렌딩
Trust-Region Behavior Blending for On-Policy Distillation
TL;DR AI
1분핵심 요약
Trust-Region Behavior Blending은 on-policy distillation을 위한 새로운 워밍업 기법이다.
초기에는 품질이 낮은 학생의 롤아웃을 학생 중심 KL 트러스트 리전 안에서 가장 가까운 교사 유사 행동으로 대체하면서, distillation loss는 그대로 유지한다.
KL 제약은 점차 0까지 줄어들어, 이후에는 다시 순수한 학생 롤아웃으로 학습하게 된다.
수학 추론 distillation 실험에서는 비교한 방법들 중 평균 성능이 가장 좋았다.
