구글 딥마인드 연구, LLM이 자체 게임 이론 알고리즘을 다시 쓰게 했더니 전문가들보다 뛰어난 성과
Google DeepMind’s research lets an LLM rewrite its own game theory algorithms — and it outperformed the experts

TL;DR AI
2분핵심 요약
Google DeepMind의 AlphaEvolve가 Gemini 2.5 Pro를 이용해 알고리즘 소스 코드를 직접 변이시키는 방식으로 새로운 다중 에이전트 강화학습 알고리즘을 탐색했다.
OpenSpiel의 불완전 정보 게임에서 CFR과 PSRO에 적용해, 정확한 best response와 보상 계산을 바탕으로 포커형 벤치마크를 실험했다.
그 결과 Volatility-Adaptive Discounted CFR 같은 새 변형을 찾아냈고, PSRO의 메타 전략 솔버도 개선했다.
3-player Kuhn Poker, 2-player Leduc Poker, Goofspiel, Liars Dice 등 홀드아웃 게임에서 기존 전문가 설계 방법과 비슷하거나 더 나은 성능을 보였다.
이번 연구는 LLM이 수동 튜닝 대신 게임이론·강화학습 알고리즘 설계를 자동화할 수 있음을 보여준다.



