무엇을, 어떻게 상상할까? 크로스뷰 공간 추론을 위한 통합 멀티모달 모델의 시각적 사고
How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning
TL;DR AI
1분핵심 요약
연구진은 한 입력 뷰의 일부를 답변 경로에서는 가리고, 생각 이미지 토큰에는 보이게 하는 View Dropout을 제안했다.
top-down, panoramic, point-matching 방식의 시각적 추론을 비교한 결과, panoramic visual thinking이 가장 배우기 쉽고 추론에도 가장 유용했다.
View Dropout과 panoramic visual thinking을 함께 쓴 설정만이 교차 뷰 공간 추론을 일관되게 개선했다.
이 방법은 5개 out-of-domain 벤치마크에서 가장 좋은 성능을 보여, 학습 환경 밖에서도 더 잘 일반화됨을 입증했다.
