Flow-OPD: 플로우 매칭 모델을 위한 온-폴리시 증류
Flow-OPD: On-Policy Distillation for Flow Matching Models
TL;DR AI
1분핵심 요약
연구진은 flow matching 기반 텍스트-이미지 모델을 위한 통합 후학습 프레임워크 Flow-OPD를 제안했다.
이 방법은 특화된 교사 모델, 콜드스타트 초기화, 온폴리시 샘플링, 작업 라우팅, 밀집 감독, 매니폴드 앵커 정규화를 결합한다.
목표는 범용 이미지 생성 모델을 여러 기준에 걸쳐 더 잘 정렬하고, 지표 간 절충과 보상 해킹을 줄이는 것이다.
벤치마크에서 Flow-OPD는 Stable Diffusion 3.5 Medium을 포함해 성능을 크게 향상시켰다.
