언어 바꾸기English
이전 목록

더 나은 추론 일반화를 위한 SFT 데이터 적응 학습

Learning to Adapt SFT Data for Better Reasoning Generalization

TL;DR AI

핵심 요약

1분
  1. 연구진은 모델의 분포에 더 잘 맞도록 SFT 데이터를 적응시키는 DART를 제안했다.

  2. DART는 기존 SFT 데모를 강화학습으로 변환해 모델에 맞는 감독 신호로 만든 뒤 미세조정에 사용한다.

  3. 이 방법은 여러 언어 모델과 데이터셋에서 추론 일반화 성능을 높였다.

  4. 고정된 학습 데이터를 더 효과적으로 활용할 수 있는 실용적인 방법으로, 강화학습 단독 의존을 줄여준다.

원문 보기