Difference Advantage Estimation for Multi-Agent Policy Gradients
Yueheng Li, Guangming Xie, Zongqing Lu
Abstract
Multi-agent policy gradient methods in centralized training with decentralized execution recently witnessed many progresses. During centralized training, multi-agent credit assignment is crucial, which can substantially promote learning performance. However, explicit multi-agent credit assignment in multi-agent policy gradient methods still receives less attention. In this paper, we investigate multi-agent credit assignment induced by reward shaping and provide a theoretical understanding in terms of its credit assignment and policy bias. Based on this, we propose an exponentially weighted advantage estimator, which is analogous to GAE, to enable multi-agent credit assignment while allowing the tradeoff with policy bias. Empirical results show that our approach can successfully perform effective multi-agent credit assignment, and thus substantially outperforms other advantage estimators.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Cited by top-tier papers2
- More Centralized Training, Still Decentralized Execution: Multi-Agent Conditional Policy FactorizationJiangxing Wang, Deheng Ye, Zongqing LuICLR 2023 · 5 citations
- MemBuilder: Reinforcing LLMs for Long-Term Memory Construction via Attributed Dense RewardsZhiyu Shen, Ziming Wu, Fuming Lai, Shaobing Lian et al.ACL 2026 · 3 citations
Builds on5
- QPLEX: Duplex Dueling Multi-Agent Q-LearningJianhao Wang, Zhizhou Ren, Terry Liu, Yang Yu et al.ICLR 2021 · 595 citations
- Error Bounds of Imitating Policies and EnvironmentsTian Xu, Ziniu Li, Yang YuNeurIPS 2020 · 141 citations
- Value-Decomposition Multi-Agent Actor-CriticsJianyu Su, Stephen C. Adams, Peter A. BelingAAAI 2021 · 140 citations
- Hierarchically and Cooperatively Learning Traffic Signal ControlBingyu Xu, Yaowei Wang, Zhaozhi Wang, Huizhu Jia et al.AAAI 2021 · 88 citations
- Divergence-Regularized Multi-Agent Actor-CriticKefan Su, Zongqing LuICML 2022 · 31 citations
Related papers
- STAS: Spatial-Temporal Return Decomposition for Solving Sparse Rewards Problems in Multi-agent Reinforcement LearningSirui Chen, Zhaowei Zhang, Yaodong Yang, Yali DuAAAI 2024 · 11 citations
- Shapley Counterfactual Credits for Multi-Agent Reinforcement LearningJiahui Li, Kun Kuang, Baoxiang Wang, Furui Liu et al.KDD 2021 · 49 citations
- MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent CooperationDawei Wang, Di Zhao, Xinyuan Liu, Marci Chi Ma et al.ACL 2026
- Learning Task-Distribution Reward Shaping with Meta-LearningHaosheng Zou, Tongzheng Ren, Dong Yan, Hang Su et al.AAAI 2021 · 19 citations
- Direct Advantage EstimationHsiao-Ru Pan, Nico Gürtler, Alexander Neitz, Bernhard SchölkopfNeurIPS 2022 · 20 citations
