스킬 셀프 플레이: 공진화하는 스킬로 LLM 역량의 최전선을 넓히다
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
TL;DR AI
1분핵심 요약
연구진은 제안자, 해결자, 동적 스킬 컨트롤러가 함께 진화하는 LLM용 공진화 RL 프레임워크 ‘Skill Self-Play’를 소개했다.
이 방법은 좁은 환경 기반 학습과 신뢰하기 어려운 개방형 자기 생성 과제 사이에서, 에이전트 스킬을 중간 지점으로 활용한다.
그 결과 Qwen-Applications를 포함한 도구 사용 및 추론 벤치마크에서 성능이 향상됐다.
수작업 데이터나 약한 자기지도에만 의존하지 않고 LLM 역량을 더 확장 가능하고 신뢰성 있게 높일 수 있는 방법을 제시한다.
