Skill0.5: 에이전트 강화학습에서 분포 밖 일반화를 위한 기술 내재화와 활용의 결합
Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning
TL;DR AI
1분핵심 요약
연구진은 에이전트용 강화학습 프레임워크 Skill0.5를 제안했다.
난도 인식 라우터를 통해 어려운 과제는 스킬 내재화, 중간 과제는 표준 RL, 쉬운 과제는 진단적 프로빙으로 분배한다.
ALFWorld와 WebShop에서 Skill0.5는 메모리 기반 및 기존 스킬 기반 방법보다 분포 내·외 성능이 모두 뛰어났다.
이 방법은 범용 스킬 학습과 과제별 스킬 활용을 분리해 문맥 비용을 줄이고 일반화 성능을 높이는 것을 목표로 한다.
