행동 탐지를 위한 시점 불변성과 시간적 일관성 향상
Improving Viewpoint-Invariance and Temporal Consistency for Action Detection

TL;DR AI
1분핵심 요약
연구진은 비정제(untrimmed) 비디오를 위한 두 단계 인간 행동 탐지 프레임워크를 제안했다.
이 방법은 학습 시 가상 시점을 활용하고 시점 불변 temporal encoder를 적용해 카메라 각도 변화와 장거리 모션 의존성을 더 잘 처리한다.
모션 특징과 멀티스케일 temporal encoder, selective state-space model을 결합해 시간적 일관성을 높였다.
PKU-MMD와 BABEL 벤치마크에서 기존 방법을 앞서는 강한 성능 향상을 보였다.
이번 결과는 시점 변화와 긴 영상 구간을 견뎌야 하는 실제 비디오 이해 시스템 개선에 도움이 될 수 있다.
