Debiased Model-based Representations for Sample-efficient Continuous Control
TL;DR AI
2 min readKey summary
Researchers introduced DR.Q, a debiased model-based representation method for sample-efficient continuous control.
DR.Q maximizes mutual information between state-action and next-state representations, while using faded prioritized experience replay.
It is designed to reduce representation bias and overfitting, improving stability in off-policy Q-learning.
On continuous control benchmarks, DR.Q matched or exceeded strong baselines.
