SFT에서 RL로 넘어가기: 멀티모달 RL을 위한 블랙박스 온-폴리시 증류 기반 사전 정렬
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
TL;DR AI
1분핵심 요약
연구진은 멀티모달 모델의 성능을 높이기 위해, 지도 미세조정과 강화학습 사이에 분포 정렬 단계를 넣는 PRISM 3단계 파이프라인을 제안했다.
PRISM은 블랙박스 온폴리시 증류와 policy-vs-MoE 판별자 게임을 활용해 SFT로 생기는 학습-추론 분포 불일치를 줄인다.
Qwen3-VL에서 GRPO, DAPO, GSPO 등 여러 RL 방식에 걸쳐 다운스트림 정확도를 개선했다.
멀티모달 추론 벤치마크에서도 유의미한 향상을 보여, RLVR 학습을 안정화하는 실용적 방법임을 시사했다.
