보여주고 말하라: LLM 텍스트가 아닌 생성형 픽셀에서 공간 인지 평가하기
Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
TL;DR AI
1분핵심 요약
연구진은 이미지 생성 모델에서 구조화된 시각적 답변을 수집하는 프로토콜 ProVisE를 제안했다.
또한 14개 공간 추론 하위 과제를 포함한 470개 예시의 벤치마크 SpatialGen-Bench를 공개했다.
이번 평가는 이미지 생성 모델과 텍스트 출력 비전-언어 모델을 함께 비교해 공간 인지 능력을 측정했다.
픽셀 공간 답변은 일부 과제에서 이미지 모델에 도움이 됐지만, 더 복잡한 구성적 추론에서는 텍스트 모델이 여전히 우세했다.