LongMINT: 장기 지평 에이전트 시스템에서 다중 목표 간섭 하의 메모리 평가
LongMINT: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems
TL;DR AI
1분핵심 요약
연구진은 여러 도메인의 장기·간섭이 심한 환경에서 메모리 증강 AI 에이전트를 평가하는 벤치마크 LongMINT를 공개했다.
LongMINT는 매우 길고 자주 갱신되는 문맥에서 만든 1만5,600여 개의 QA 쌍으로 구성되며, 단일 대상 회상과 다중 대상 집계를 함께 평가한다.
평가된 7개 시스템의 성능은 전반적으로 낮았고, 특히 검색(retrieval)과 메모리 구성(memory construction)이 주요 병목으로 드러났다.
이 벤치마크는 현재 에이전트 메모리 시스템의 큰 한계를 보여주며, 변화하는 정보 환경에서 회상과 추론을 더 현실적으로 측정할 수 있게 한다.
