VideoSeeker: 네이티브 에이전틱 도구 호출을 통한 인스턴스 수준 비디오 이해 유도
VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation
TL;DR AI
1분핵심 요약
연구진은 시각적 프롬프트와 에이전트형 도구 사용을 결합한 인스턴스 단위 비디오 이해 프레임워크 VideoSeeker를 제안했다.
VideoSeeker는 완전 자동 데이터 합성 파이프라인을 사용하며, 지도학습과 강화학습을 함께 적용해 학습했다.
이 시스템은 미세한 시공간 로컬라이제이션과 비디오 검색 성능을 높여, 객체와 이벤트를 더 정확하게 지면화한다.
결과는 강력한 기존 방법뿐 아니라 GPT-4o, Gemini-2.5-Pro 같은 폐쇄형 모델보다도 향상된 성능을 보였다.
