언어 바꾸기English
이전 목록

π-Bench: 장기 워크플로우에서 능동형 개인 비서 에이전트 평가

π-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows

TL;DR AI

핵심 요약

1분
  1. 연구진이 능동형 개인 비서 에이전트를 평가하는 벤치마크 π-Bench를 공개했다.

  2. 이 벤치마크는 5개 사용자 페르소나의 100개 멀티턴 과제로, 숨은 의도 탐지·작업 간 의존성·세션 간 연속성을 시험한다.

  3. 핵심 목표는 비서가 명시적 요청만 처리하는지, 아니면 사용자의 필요를 미리 파악해 대응하는지 측정하는 것이다.

  4. π-Bench는 일상과 업무 환경의 장기적 비서 행동을 더 현실적으로 평가할 수 있는 기준을 제시한다.

원문 보기