언어 바꾸기English
이전 목록

β-OPSD: 정책 최적화로 추론하고 자기 증류로 학습하기

β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

TL;DR AI

핵심 요약

1분
  1. 연구진은 추론 모델 학습을 위한 β-OPSD를 제안했다. 이는 on-policy self-distillation을 일반화해 KL 가중치를 제어 가능한 파라미터로 다룬다.

  2. β-OPSD는 기준 정책과 교사 정책을 섞은 닫힌형태의 정책을 유도하고, 이를 효율적인 로짓 보간과 return-to-go 기반 크레딧 할당으로 구현한다.

  3. 수학 추론 벤치마크 실험에서 기존 OPSD보다 더 안정적이면서도 다운스트림 정확도가 더 높게 나타났다.

  4. 이 방법은 정책 최적화와 self-distillation을 더 원칙적이고 실용적으로 결합해, 불안정성을 줄이면서 추론 성능을 높이는 데 의미가 있다.

원문 보기