사물의 위치에서 용도까지: 멀티모달 LLM을 위한 공간-기능 지능 벤치마킹
From Where Things Are to What They’re For: Benchmarking Spatial–Functional Intelligence for Multimodal LLMs

TL;DR AI
1분핵심 요약
연구진은 1인칭 실내 영상을 바탕으로 한 새로운 벤치마크 SFI-Bench를 공개해, 멀티모달 LLM의 공간-기능 지능을 평가했다.
이 벤치마크는 1,700개가 넘는 질문으로 공간 배치, 물체 기능, 관계 추론, 조건부 개수 세기, 지식 기반 문제 해결을 다룬다.
실험 결과, 현재 모델들은 공간 기억과 외부·문맥 지식을 함께 활용하는 데 여전히 어려움을 보였다.
이번 벤치마크는 멀티모달 에이전트의 큰 약점을 드러내며, grounded intelligence 진전을 측정할 더 강한 기준을 제시한다.