파라미터 노이즈를 활용한 더 나은 탐색
Better exploration with parameter noise

TL;DR AI
1분핵심 요약
연구진은 행동이 아니라 정책 파라미터에 노이즈를 더하는 방식이 강화학습에서 더 나은 탐색을 이끈다는 점을 확인했다.
HalfCheetah 실험에서 파라미터 공간 노이즈는 행동 노이즈보다 학습 속도가 더 빠르고, 20 에피소드 후 성능도 약 2배 높았다.
추가 정책 헤드 없이도 작동해, 기존 탐색 방식보다 더 단순하고 훈련 비용도 낮은 방법으로 제시됐다.



