언어 바꾸기English
이전 목록

긴 영상 이해를 위한 선형 확장 비디오 VLM

Linear Scaling Video VLMs for Long Video Understanding

TL;DR AI

핵심 요약

1분
  1. StateKV는 긴 비디오 VLM을 위한 추론 전용 기법으로, 프레임 간 문맥을 고정 크기 순환 상태에 보존하고 디코딩에는 전체 캐시를 사용한다.

  2. 세 개의 벤치마크와 일곱 개 모델에서 전체 self-attention에 가까운 성능을 유지했으며, 일반적인 슬라이딩 윈도우나 최근성 기반 스트리밍 방식보다 뛰어났다.

  3. 미세조정이나 구조 변경 없이 prefill 비용을 선형 시간으로 줄여, 긴 비디오 이해와 스트리밍 확장성을 높인다.

원문 보기