RoMeRL: 축소 차수 유틸리티 상태를 통한 자기 진화형 에이전트 메모리에서 피드백 커버리지와 메모리-보상 함정의 균형
RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States

TL;DR AI
1분핵심 요약
연구진은 자기진화형 LLM 에이전트를 위한 새로운 메모리 학습 방법 RoMeRL을 제안했다.
RoMeRL은 궤적 기반 유틸리티를 결과의 양·음성과 메모리 동학에 따라 고정 크기의 작업 단위 메모리 상태로 압축한다.
ALFWorld와 LifelongAgentBench 실험에서 성능을 높이고, 피드백 밀도를 늘리며, 메모리 크기와 LLM 호출 수를 줄였다.
또한 관련 없는 기억이 잘못 강화되는 메모리-보상 함정을 줄여 메모리 학습의 신뢰성을 높인다.
