언어 바꾸기English
이전 목록

어디를 봐야 할까: 파운데이션 모델은 능동적 탐색을 통해 목표 시점에 도달할 수 있을까?

Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration?

TL;DR AI

핵심 요약

1분
  1. 연구진은 파운데이션 모델이 목표 이미지를 맞추기 위해 3D 공간에서 능동적으로 움직일 수 있는지 평가하는 Target Viewpoint Reproduction(TVR)과 TVRBench 실내 벤치마크를 제안했다.

  2. 현재 모델들은 특히 여러 턴의 시각적 히스토리를 활용해야 하거나, 단순 회전이 아니라 이동으로 시점 차이를 해석해야 할 때 성능이 크게 떨어진다.

  3. 이번 결과는 오픈소스·클로즈드소스 모델과 9B 모델을 포함한 현재 모델들의 능동적 3D 공간 추론 한계를 분명히 보여준다.

  4. 시각-행동 지도 미세조정(SFT)과 다중 턴 GRPO를 결합한 통합 후학습 방식은 성공률을 크게 끌어올렸다.

원문 보기