정책 유발 오류 복구: 강건한 GUI 에이전트를 위한 벤치마킹과 궤적 합성
Recovering Policy-Induced Errors: Benchmarking and Trajectory Synthesis for Robust GUI Agents
TL;DR AI
1분핵심 요약
연구진은 GUI 에이전트의 오류 복구 능력을 평가하는 1,216개 사례의 벤치마크 GUI-RobustEval를 공개했다.
또한 80만 개의 학습 예제를 생성한 트리 기반 궤적 합성 파이프라인 RoTS를 제안했다.
RoTS 데이터로 미세조정한 모델들은 복구 중심 테스트와 일반 GUI 벤치마크 모두에서 성능이 향상됐다.
RoTS-32B는 OSWorld에서 최고 성능을 기록하며, 장기 GUI 작업의 신뢰성을 높일 가능성을 보였다.
