표본 효율적인 연속 제어를 위한 편향 보정 모델 기반 표현
Debiased Model-based Representations for Sample-efficient Continuous Control
TL;DR AI
1분핵심 요약
연구진은 샘플 효율적인 연속 제어를 위한 편향 보정형 모델 기반 표현 학습 기법 DR.Q를 제안했다.
DR.Q는 상태-행동 표현과 다음 상태 표현의 상호정보량을 최대화하고, faded prioritized experience replay를 활용한다.
이 방법은 표현 편향과 과적합을 줄여 오프폴리시 Q-learning의 안정성을 높이도록 설계됐다.
연속 제어 벤치마크에서 DR.Q는 강력한 기준 기법들과 비슷하거나 더 높은 성능을 보였다.
