픽셀 이전의 표현: 의미 기반 계층적 비디오 예측
Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction
TL;DR AI
1분핵심 요약
Re2Pix는 먼저 미래의 의미적 특징을 예측한 뒤, 이를 바탕으로 사실적인 다음 프레임을 생성하는 2단계 비디오 예측 프레임워크다.
고정된 비전 파운데이션 모델의 특징 공간에서 미래 표현을 예측하고, 이를 잠재 확산 모델에 조건으로 넣어 영상을 렌더링한다.
Nested dropout과 mixed supervision을 도입해 학습 시 정답 표현과 추론 시 예측 표현의 불일치를 줄였다.
이 방식은 시각적 사실성과 시간적 의미 일관성을 높여, 자율주행 같은 복잡한 동적 환경에서 특히 유용하다.
