언어 바꾸기English
이전 목록

Think, Act, Build: 비전·언어 모델 기반 제로샷 3D 시각 그라운딩 에이전트 프레임워크

Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding

TL;DR AI

핵심 요약

1분
  1. 논문은 2D VLM과 다중뷰 기하를 결합한 TAB 프레임워크를 제안한다.

  2. TAB는 원시 RGB-D 스트림에서 2D→3D 재구성 방식으로 3D-VG를 수행한다.

  3. Semantic-Anchored Geometric Expansion은 참조에서 위치를 고정해 프레임 간 위치를 전파한다.

  4. ScanRefer와 Nr3D 평가에서 TAB는 기존 제로샷 방법과 일부 지도 기준을 능가했다.

원문 보기