TerminalWorld: 실제 터미널 작업에서 에이전트 벤치마킹
TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks

TL;DR AI
1분핵심 요약
연구진은 실제 터미널 기록을 역공학해 만든 벤치마크 TerminalWorld를 공개하며, 진짜 명령줄 작업을 기준으로 AI 에이전트를 평가했다.
8만 870개의 기록에서 1,530개의 검증된 과제와 200개의 추가 검증 하위 집합을 만들어 현실적인 워크플로를 재현했다.
여러 모델과 에이전트를 테스트한 결과 최고 통과율은 62.5%에 그쳐, 터미널 작업 수행 능력은 아직 제한적이었다.
TerminalWorld 점수는 기존 벤치마크와의 상관관계가 약해, 현재 평가가 실제 성능을 충분히 반영하지 못할 수 있음을 보여줬다.
