이전 목록

보여주고 말하라: LLM 텍스트가 아닌 생성형 픽셀에서 공간 인지 평가하기

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

TL;DR AI

핵심 요약

1분
  1. 연구진은 이미지 생성 모델에서 구조화된 시각적 답변을 수집하는 프로토콜 ProVisE를 제안했다.

  2. 또한 14개 공간 추론 하위 과제를 포함한 470개 예시의 벤치마크 SpatialGen-Bench를 공개했다.

  3. 이번 평가는 이미지 생성 모델과 텍스트 출력 비전-언어 모델을 함께 비교해 공간 인지 능력을 측정했다.

  4. 픽셀 공간 답변은 일부 과제에서 이미지 모델에 도움이 됐지만, 더 복잡한 구성적 추론에서는 텍스트 모델이 여전히 우세했다.

원문 보기