Why Far Looks Up: 비전-언어 모델의 공간 표현 탐구
Why Far Looks Up: Probing Spatial Representation in Vision-Language Models
TL;DR AI
1분핵심 요약
연구진은 여러 비전-언어 모델에서 수직 위치와 거리 인식이 강하게 연결되는 공간 편향을 발견했다.
이 편향은 자연 사진의 원근 단서를 닮았지만, 일반 사례와 반례 사례 사이에 성능 격차를 만든다.
모델이 커지고 벤치마크 점수가 올라가도 이런 지름길은 남아 있거나 더 강해질 수 있어, 실제 공간 추론 능력을 가린다.
이를 드러내기 위해 흔한 이미지 상관관계를 제거한 합성 벤치마크 SpatialTunnel을 제안했다.
공간 축이 더 분리된 모델일수록 공간 벤치마크에서 더 안정적이고 강한 견고성을 보였다.
