언어 바꾸기English
이전 목록

효율적인 에이전틱 강화학습: 온폴리시 내재 지식 경계 강화

Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement

TL;DR AI

핵심 요약

1분
  1. 연구진은 LLM 에이전트가 내부 지식과 외부 도구를 언제 활용할지 학습하도록 돕는 온폴리시 RL 기법 AKBE를 제안했다.

  2. AKBE는 도구를 쓰는 경로와 쓰지 않는 경로를 함께 학습해, 각 모델의 ‘내재적 지식 경계’를 파악한다.

  3. 7개 QA 벤치마크에서 기존 agentic RL보다 정확도는 높이고 불필요한 도구 호출은 줄였다.

  4. 이 방법은 도구 사용형 에이전트의 핵심 과제인 ‘성능은 유지하면서 도구 낭비를 줄이는 것’을 해결한다.

원문 보기