보상 편향 분포 매칭을 통한 소수 단계 생성기 강화
Reinforcing Few-step Generators via Reward-Tilted Distribution Matching

TL;DR AI
1분핵심 요약
연구진은 소수 단계 텍스트-투-이미지 생성기를 인간 선호도에 맞추기 위한 2단계 기법 RTDMD를 제안했다.
먼저 ambient-consistent distribution matching으로 생성기 추적을 개선한 뒤, 하이브리드 정책경사 기반 보상 최적화를 적용한다.
SD3, SD3.5, FLUX.2에서 4스텝 이미지 생성 기준 최신 최고 성능을 달성했다.
표준 미적·구성 평가에서 특히 큰 향상을 보이면서도 추론 속도는 빠르게 유지했다.
