DVAO: 다중 보상 강화학습을 위한 동적 분산 적응형 어드밴티지 최적화
DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning
TL;DR AI
1분핵심 요약
연구진은 경험적 보상 분산을 바탕으로 목표 가중치를 조정하는 새로운 다중 보상 RL 최적화 기법 DVAO를 제안했다.
DVAO는 advantage 크기를 제한해 다중 목적 학습에서의 불안정성과 경직된 가중치 문제를 줄이도록 설계됐다.
논문은 Qwen3, Qwen2.5 등에서 추론과 도구 사용 벤치마크 기준으로 기존 방법보다 더 강한 성능을 보고했다.
이 방법은 서로 경쟁하는 보상을 가진 언어모델 학습에서 더 나은 파레토 효율을 향한 실용적 개선으로 평가된다.
