언어 바꾸기English
이전 목록

COMAP: LLM 에이전트를 위한 공동 진화 세계 모델과 에이전트 정책

COMAP: Co-Evolving World Models and Agent Policies for LLM Agents

TL;DR AI

핵심 요약

1분
  1. 연구진은 텍스트 기반 월드 모델과 LLM 에이전트가 서로를 함께 개선하는 폐쇄 루프 프레임워크 COMAP를 제안했다.

  2. 월드 모델은 후보 행동에 대한 피드백을 예측하고, 에이전트는 그 피드백으로 선택을 다듬은 뒤, 생성된 궤적으로 모델을 다시 업데이트한다.

  3. COMAP는 여러 벤치마크에서 기존 방법보다 우수한 성능을 보였으며, 계획·웹 탐색·체화형 작업·도구 사용에서 특히 강점을 보였다.

  4. 이 방법은 외부 보상 없이도 에이전트가 내부 세계 모델과 정책을 함께 적응시키며 성능을 높일 수 있음을 보여준다.

원문 보기