언어 바꾸기English
이전 목록

DRIFT: 효율적인 멀티턴 최적화를 위한 분리형 롤아웃과 중요도 가중 미세조정

DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization

TL;DR AI

핵심 요약

1분
  1. 연구진은 언어 모델의 효율적인 다중 턴 최적화를 위한 학습 프레임워크 DRIFT를 제안했다.

  2. DRIFT는 고정된 기준 정책에서 상호작용 궤적을 샘플링하고, 보상 기반 중요도 가중치를 적용한 지도 미세조정을 통해 정책 업데이트를 분리한다.

  3. 이 방식은 전체 온라인 강화학습 없이도 다중 턴 RL의 장점을 유지하면서 비용과 학습 복잡도를 줄이는 것을 목표로 한다.

  4. 실험 결과 DRIFT는 대형 언어 모델 과제에서 다중 턴 RL 기준선과 비슷하거나 더 나은 성능을 보였다.

원문 보기