협력하고, 경쟁하고, 소통하는 법을 배우다
Learning to cooperate, compete, and communicate

TL;DR AI
1분핵심 요약
다중 에이전트 강화학습은 에이전트들이 서로에 적응하며 학습해야 해서, 일반 RL보다 훨씬 더 어렵다.
이 기사에서는 분산형 방법이 경쟁적 환경이나 통신이 중요한 상황에서 다른 에이전트의 행동을 모델링해야 해 자주 한계를 보인다고 설명한다.
MADDPG는 학습 단계에서 중앙집중형 critic을 사용해 다른 에이전트의 관측과 행동을 함께 활용함으로써 학습을 더 안정화한다.
이 중앙집중형 학습 방식은 협력, 경쟁, 그리고 speaker-listener 통신 행동을 더 효과적으로 익히는 데 도움을 준다.

