SIRI: LLM 에이전트 학습을 위한 내재적 스킬이 적용된 자기 내면화 강화학습
SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training

TL;DR AI
1분핵심 요약
연구진은 LLM 에이전트가 훈련 중 유용한 기술을 스스로 발견하고 내재화하는 3단계 RL 프레임워크 SIRI를 제안했다.
SIRI는 GiGPO로 사전학습한 뒤, 모델의 성공적인 롤아웃에서 기술을 발굴하고 쌍대 비교로 검증한 다음, 도움이 되는 행동만 기본 정책에 증류한다.
ALFWorld와 WebShop 실험에서 SIRI는 Qwen2.5-7B-Instruct 에이전트를 GiGPO보다 개선했고, 여러 프롬프트 기반·RL·메모리 보강 기준선도 앞섰다.
이 방식은 외부 기술 생성기나 추론 시 메모리 뱅크 없이 장기 과제용 재사용 기술을 학습하게 해 배포 복잡도와 지연을 줄인다.
