오프라인 강화학습에서 보수적 가치 추정을 위한 Peng의 Q($\lambda$)
Peng's Q($\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning

TL;DR AI
1분핵심 요약
연구진은 Peng의 Q(λ)를 기반으로 한 보수적 다단계 오프라인 강화학습 방법 CPQL을 제안했다.
이 방법은 표준 Bellman 연산자 대신 보수적 가치 추정기를 사용하며, 거의 최적에 가까운 보장을 증명했다.
CPQL은 D4RL 벤치마크에서 기존 오프라인 단일 단계 기준선보다 더 좋은 성능을 보였다.
또한 오프라인 사전학습 후 온라인 파인튜닝을 시작할 때 더 안정적인 초기화도 제공한다.
