라우팅보다 표현: 다중 시간 척도 PPO에서 대리 해킹 극복하기
Representation over Routing: Overcoming Surrogate Hacking in Multi-Timescale PPO
TL;DR AI
1분핵심 요약
연구진은 다중 시간축 actor-critic 학습의 안정성을 높이기 위해 Target Decoupling을 제안했다.
이 방식은 actor에서 routing aggregation을 제거하고, 다중 시계열 적합은 critic이 담당하도록 옮긴다.
이를 통해 surrogate objective hacking과 policy collapse 같은 두 가지 실패 모드를 완화한다.
LunarLander-v2에서 이 decoupled PPO 설계는 지연 보상 과제에서 더 안정적인 성능을 보였다.
