VitaBench 2.0: 장기적인 사용자 상호작용에서 개인화되고 선제적인 에이전트 평가
VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions
TL;DR AI
1분핵심 요약
연구진이 개인화·선제적 AI 에이전트를 평가하는 벤치마크 VitaBench 2.0을 공개했다.
이 벤치마크는 순차적 상호작용 속에서 단편적인 사용자 선호를 추출·갱신·활용할 수 있는지 측정한다.
또한 필요한 정보가 부족할 때 먼저 질문해 정보를 수집한 뒤 의사결정하는지도 평가한다.
이번 연구는 현재 LLM 기반 에이전트와 실제 개인화 요구 사이의 격차를 드러낸다.
메모리, 적응, 장기 사용자 모델링 능력을 더 현실적으로 검증하려는 목적이다.
