149쪽 분량의 장기 지평 에이전트 프런티어 지도화: 다기관 대학 공동 설문, 차세대 AI 에이전트의 두 가지 진화 축으로 하네스 엔지니어링과 모델 최적화 제안
149 Pages Mapping the Long-Horizon Agent Frontier: Multi-University Survey Proposes Harness Engineering and Model Optimization as Two Main Evolution Lines for Next-Generation AI Agents

TL;DR AI
2분핵심 요약
여러 대학 연구진이 149쪽 분량의 서베이 'Towards Long-Horizon Agents: A Survey'를 발표해 장기-수행 AI 에이전트의 정의와 범위를 정리했다.
이 논문은 에이전트 발전을 하니스 엔지니어링과 모델 최적화의 두 축으로 나누고, 3단계 역량 사다리를 제안한다.
공개 데이터를 분석한 결과, GPT-3에서 GPT-4, o3, Claude Opus 4.6으로 갈수록 에이전트의 수행 가능 작업 길이(task span)가 빠르게 늘어난 것으로 나타났다.
핵심 메시지는 장기 에이전트 성능이 모델 자체뿐 아니라 메모리, 컨텍스트 엔지니어링, RAG, 함수 호출 같은 시스템 설계에 크게 좌우된다는 점이다.
