MiroEval: 과정과 결과에서 멀티모달 연구 에이전트 평가
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome
TL;DR AI
1분핵심 요약
MiroEval은 과정과 결과를 모두 평가하는 벤치마크와 프레임워크다.
벤치마크는 실제 사용자 기반의 100개 과제(텍스트70·멀티30)와 주기적 업데이트 파이프라인을 포함한다.
13개 시스템 평가에서 과정 품질이 결과를 예측했고 멀티모달 과제에서 성능이 3∼10점 하락했다.
