PerceptionBench: 멀티모달 대규모 언어 모델의 원자적 시각 인지 평가
PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models
TL;DR AI
1분핵심 요약
연구진은 42개 기존 벤치마크를 바탕으로 멀티모달 대형 언어모델의 10가지 원자적 시각 지각 능력을 평가하는 PerceptionBench를 공개했다.
이 벤치마크는 지각 오류와 추론·지식 오류를 분리해 볼 수 있도록 검증된 단답형 문항 3,000개로 구성됐다.
16개의 최상위 MLLM을 테스트한 결과, 어느 모델도 정확도 60%를 넘지 못했고, 지각 관련 환각이 평균적으로 가장 취약했다.
전체 점수는 비슷해 보여도 실제 능력 프로필은 크게 달라질 수 있어, 시각 지각 실패를 더 정밀하게 진단할 수 있음을 보여준다.
