언어 바꾸기English
이전 목록

Hugging Face가 TRL v1.0 출시: SFT, 보상 모델링, DPO 및 GRPO 워크플로를 위한 통합 사후 학습 스택

Hugging Face Releases TRL v1.0: A Unified Post-Training Stack for SFT, Reward Modeling, DPO, and GRPO Workflows

TL;DR AI

핵심 요약

2분
  1. Hugging Face가 TRL v1.0을 공개하며 안정적이고 프로덕션용 프레임워크로 전환했습니다.

  2. TRL v1.0은 Post-Training 파이프라인을 정리해 SFT(지도 미세조정), Reward Modeling, Alignment(강화학습)를 포함합니다.

  3. 단일 표준화된 API를 제공하며 핵심 축은 CLI, 통합 설정 시스템, 그리고 DPO·GRPO·KTO 등의 정렬 알고리즘입니다.

  4. Reward Modeling은 인간 선호를 예측하는 별도 모델을 학습해 응답을 평가하고, 정렬은 학습 중 텍스트를 생성하는 온라인 방식 또는 고정 데이터셋을 이용하는 오프라인 방식으로 달성됩니다.

  5. trl CLI는 YAML 또는 커맨드라인 인수를 통한 설정 기반이고 trl sft --model_name_or_path meta-llama/Llama-3.1-8B --dataset_name openbmb/UltraInteract --output_dir ./sft_results 같은 진입점을 제공하며 Hugging Face Accelerate로 다양한 하드웨어에서 동일한 명령을 확장할 수 있습니다.

원문 보기