언어 바꾸기English
이전 목록

자기 증류를 통한 루브릭 기반 강화학습 향상

Enhancing Rubric-based RL via Self-Distillation

TL;DR AI

핵심 요약

2분
  1. 연구진은 대형 언어모델의 rubric 기반 강화학습에서 두 가지 문제, 즉 최적화되지 않은 기준과 학습 신호가 사라지는 기준을 지적했다.

  2. 이를 해결하기 위해 Criterion-Distilled Policy Optimization(CriPO)을 제안했으며, on-policy self-distillation과 두 가지 self-teacher를 활용한다.

  3. criterion-injection self-teacher는 빠진 행동을 학습시키고, counterfactual self-teacher는 억제된 토큰 수준의 장점을 되살린다.

  4. 의학·과학 벤치마크에서 CriPO는 약 절반의 최적화 단계만으로 더 나은 성능을 보였다.

  5. 외부 rollout guidance에 의존하지 않아 추론 시 불일치를 줄이면서 열린형 LLM 학습을 개선한다.

원문 보기