π-Bench: 장기 워크플로우에서 능동형 개인 비서 에이전트 평가
π-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows
TL;DR AI
1분핵심 요약
연구진이 능동형 개인 비서 에이전트를 평가하는 벤치마크 π-Bench를 공개했다.
이 벤치마크는 5개 사용자 페르소나의 100개 멀티턴 과제로, 숨은 의도 탐지·작업 간 의존성·세션 간 연속성을 시험한다.
핵심 목표는 비서가 명시적 요청만 처리하는지, 아니면 사용자의 필요를 미리 파악해 대응하는지 측정하는 것이다.
π-Bench는 일상과 업무 환경의 장기적 비서 행동을 더 현실적으로 평가할 수 있는 기준을 제시한다.
