언어 바꾸기English
이전 목록

DRIFT: 효율적인 다중 턴 최적화를 위한 분리형 롤아웃과 중요도 가중 미세조정

DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization

TL;DR AI

핵심 요약

1분
  1. 연구진은 다중 턴 언어 모델 최적화를 위한 학습 프레임워크 DRIFT를 제안했다.

  2. DRIFT는 고정된 기준 정책에서 오프라인 궤적을 샘플링해 데이터 수집과 최적화를 분리한다.

  3. 반복적인 온라인 RL 롤아웃 대신, 보상 기반 중요도 가중치를 적용한 지도 미세조정을 사용한다.

  4. 이 방식은 더 낮은 학습 비용으로 다중 턴 RL 기준선과 비슷하거나 더 나은 성능을 보인다고 보고됐다.

원문 보기