비디오 모델도 검증 가능한 보상으로 추론할 수 있다
Video Models Can Reason with Verifiable Rewards
TL;DR AI
1분핵심 요약
연구진은 비디오 확산 모델의 검증 가능한 추론 과제를 겨냥한 강화학습 프레임워크 VideoRLVR를 제안했다.
이 방법은 규칙 기반 보상, 세분화된 분해 피드백, 초기 단계 최적화를 활용해 Maze, FlowFree, Sokoban 성능을 높였다.
VideoRLVR는 절차적으로 생성된 벤치마크에서 지도학습 기준선과 다른 비교 모델들을 능가했다.
이 연구는 비디오 생성기가 사실적인 화면을 넘어서 명시적 공간·시간·논리 제약까지 따르도록 학습될 수 있음을 보여준다.
