어디를 봐야 할까: 파운데이션 모델은 능동적 탐색을 통해 목표 시점에 도달할 수 있을까?
Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration?
TL;DR AI
1분핵심 요약
연구진은 파운데이션 모델이 목표 이미지를 맞추기 위해 3D 공간에서 능동적으로 움직일 수 있는지 평가하는 Target Viewpoint Reproduction(TVR)과 TVRBench 실내 벤치마크를 제안했다.
현재 모델들은 특히 여러 턴의 시각적 히스토리를 활용해야 하거나, 단순 회전이 아니라 이동으로 시점 차이를 해석해야 할 때 성능이 크게 떨어진다.
이번 결과는 오픈소스·클로즈드소스 모델과 9B 모델을 포함한 현재 모델들의 능동적 3D 공간 추론 한계를 분명히 보여준다.
시각-행동 지도 미세조정(SFT)과 다중 턴 GRPO를 결합한 통합 후학습 방식은 성공률을 크게 끌어올렸다.
