언어 바꾸기English
이전 목록

VideoSeeker: 네이티브 에이전틱 도구 호출을 통한 인스턴스 수준 비디오 이해 유도

VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation

TL;DR AI

핵심 요약

1분
  1. 연구진은 시각적 프롬프트와 에이전트형 도구 사용을 결합한 인스턴스 단위 비디오 이해 프레임워크 VideoSeeker를 제안했다.

  2. VideoSeeker는 완전 자동 데이터 합성 파이프라인을 사용하며, 지도학습과 강화학습을 함께 적용해 학습했다.

  3. 이 시스템은 미세한 시공간 로컬라이제이션과 비디오 검색 성능을 높여, 객체와 이벤트를 더 정확하게 지면화한다.

  4. 결과는 강력한 기존 방법뿐 아니라 GPT-4o, Gemini-2.5-Pro 같은 폐쇄형 모델보다도 향상된 성능을 보였다.

원문 보기