Artifact-Bench: AI 생성 동영상의 아티팩트를 탐지하고 평가하는 MLLM 성능 평가
Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos
TL;DR AI
1분핵심 요약
연구진은 AI 생성 영상의 결함을 찾아내는 벤치마크 Artifact-Bench를 공개했다.
이 벤치마크는 현실감 결함의 계층 구조를 바탕으로 실재/가짜 분류, 쌍대 비교, 세부 결함 식별의 3가지 과제를 포함한다.
19개 주요 멀티모달 LLM을 평가한 결과, 영상 현실성을 판단하는 능력 전반에서 큰 약점이 드러났다.
모델의 판단은 인간의 선호와 자주 어긋나, 평가 및 안전 용도에서 신뢰성 우려를 키운다.
