A Matter of TASTE: 에이전트 벤치마크의 커버리지와 난이도 향상
A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks
TL;DR AI
1분핵심 요약
연구진은 유효한 도구 사용 시퀀스를 진화시키고 이를 더 어려운 문제로 정제해 에이전트 벤치마크를 자동 생성하는 TASTE를 제안했다.
TASTE를 활용해 더 넓은 도구 사용 범위와 다양한 조합을 포함한 새로운 벤치마크 τ^c-Bench를 만들었다.
τ^2-Bench에서 거의 포화 상태였던 에이전트들도 τ^c-Bench에서는 성능이 크게 떨어져, 기존 벤치마크가 진전을 과대평가할 수 있음을 보여줬다.
이번 연구는 향후 도구 사용 모델을 위한 더 어렵고 현실적인 평가를 확장 가능하게 만드는 방법을 제시한다.
