언어 바꾸기English
이전 목록

MiroEval: 과정과 결과에서 멀티모달 연구 에이전트 평가

MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome

TL;DR AI

핵심 요약

1분
  1. MiroEval은 과정과 결과를 모두 평가하는 벤치마크와 프레임워크다.

  2. 벤치마크는 실제 사용자 기반의 100개 과제(텍스트70·멀티30)와 주기적 업데이트 파이프라인을 포함한다.

  3. 13개 시스템 평가에서 과정 품질이 결과를 예측했고 멀티모달 과제에서 성능이 3∼10점 하락했다.

원문 보기