이전 목록

분리된 데이터에서의 통합 비디오 밀집 예측

Unified Video Dense Prediction from Disjoint Data

TL;DR AI

핵심 요약

1분
  1. 연구진은 깊이, 법선, 분할, 경계, 인체 부위, 알베도, 셰이딩, 재질 등 8개 밀집 예측 작업을 수행하는 통합 비디오 모델 UniD를 제안했다.

  2. UniD는 모든 작업이 함께 주석된 데이터가 아니라, 작업별로 분리된 데이터셋에서 경량 task expert의 지식을 distillation해 학습한다.

  3. 사전학습된 diffusion prior를 백본으로 활용해, 다양한 작업과 비디오 장면 전반에서 높은 일반화 성능을 보였다.

  4. 이 방식은 고비용 pseudo-labeling 의존도를 낮추고, 불완전하게 분리된 데이터만으로도 통합 비디오 이해가 가능함을 보여준다.

원문 보기