행동 의존적 분해 기준선을 이용한 정책 그래디언트의 분산 감소
Variance Reduction for Policy Gradient with Action-Dependent Factorized Baselines

TL;DR AI
1분핵심 요약
연구진은 추가적인 MDP 가정 없이 정책 구조를 활용해 정책경사 분산을 줄이는 편향 없는 action-dependent baseline을 제안했다.
이 방법은 표준 RL, 고차원 조작 과제, 그리고 2000차원 합성 제어 문제에서 이론적·실험적 향상을 보였다.
또한 부분관측 및 다중 에이전트 환경으로도 확장되어, 더 낮은 분산의 그래디언트로 학습 안정성과 속도를 높일 수 있음을 보여줬다.
전반적으로 이 연구는 긴 시계열 문제와 큰 행동 공간에서 policy gradient의 성능을 강화한다.



