오래 살아라, 균형이여: 정보 병목 기반 트리형 정책 최적화
Long Live The Balance: Information Bottleneck Driven Tree-based Policy Optimization
TL;DR AI
1분핵심 요약
연구진은 LLM 강화학습에서 탐색-활용 균형을 측정하기 위한 정보 병목 기반 지표 IB-Score를 제안했다.
또한 IB-guided 샘플링과 몬테카를로 추정을 활용하는 트리 기반 정책 최적화 프레임워크 IB-TPO를 개발했다.
표준 벤치마크에서 샘플링 효율을 높였고, GRPO 및 다른 온라인 RL 방법보다 2.9%~3.6%의 성능 향상을 보였다.
이번 연구는 LLM 강화학습을 더 안정적이고 효과적으로 만드는 새로운 접근법을 제시한다.
