언어 바꾸기English
이전 목록

Skill0.5: 에이전트 강화학습에서 분포 밖 일반화를 위한 기술 내재화와 활용의 결합

Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning

TL;DR AI

핵심 요약

1분
  1. 연구진은 에이전트용 강화학습 프레임워크 Skill0.5를 제안했다.

  2. 난도 인식 라우터를 통해 어려운 과제는 스킬 내재화, 중간 과제는 표준 RL, 쉬운 과제는 진단적 프로빙으로 분배한다.

  3. ALFWorld와 WebShop에서 Skill0.5는 메모리 기반 및 기존 스킬 기반 방법보다 분포 내·외 성능이 모두 뛰어났다.

  4. 이 방법은 범용 스킬 학습과 과제별 스킬 활용을 분리해 문맥 비용을 줄이고 일반화 성능을 높이는 것을 목표로 한다.

원문 보기