Attention-Based Recurrence for Multi-Agent Reinforcement Learning under Stochastic Partial Observability
Thomy Phan, Fabian Ritz, Philipp Altmann, Maximilian Zorn, Jonas Nüßlein, Michael Kölle, Thomas Gabor, Claudia Linnhoff-Popien
摘要
Stochastic partial observability poses a major challenge for decentralized coordination in multi-agent reinforcement learning but is largely neglected in state-of-the-art research due to a strong focus on state-based centralized training for decentralized execution (CTDE) and benchmarks that lack sufficient stochasticity like StarCraft Multi-Agent Challenge (SMAC). In this paper, we propose Attention-based Embeddings of Recurrence In multi-Agent Learning (AERIAL) to approximate value functions under stochastic partial observability. AERIAL replaces the true state with a learned representation of multi-agent recurrence, considering more accurate information about decentralized agent decisions than state-based CTDE. We then introduce MessySMAC, a modified version of SMAC with stochastic observations and higher variance in initial states, to provide a more general and configurable benchmark regarding stochastic partial observability. We evaluate AERIAL in Dec-Tiger as well as in a variety of SMAC and MessySMAC maps, and compare the results with state-based CTDE. Furthermore, we evaluate the robustness of AERIAL and state-based CTDE against various stochasticity configurations in MessySMAC.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper4
- Attention-Guided Contrastive Role Representations for Multi-agent Reinforcement LearningZican Hu, Zongzhang Zhang, Huaxiong Li, Chunlin Chen 等ICLR 2024 · 被引用 27 次
- AgentMixer: Multi-Agent Correlated Policy FactorizationZhiyuan Li, Wenshuai Zhao, Lijun Wu, Joni PajarinenAAAI 2025 · 被引用 7 次
- HyPOLE: Hyperproperty-Guided Multi-Agent Reinforcement Learning under Partial ObservationArshia Rafieioskouei, Tzu-Han Hsu, Matthew Lucas, Borzoo BonakdarpourICML 2026
- Spatially Grouped Curriculum Learning for Multi-Agent Path FindingThomy Phan, Sven KoenigAAAI 2026
它引用的顶会 Paper7
- Decision Transformer: Reinforcement Learning via Sequence ModelingLili Chen, Kevin Lu, Aravind Rajeswaran, Kimin Lee 等NeurIPS 2021 · 被引用 2,557 次
- QPLEX: Duplex Dueling Multi-Agent Q-LearningJianhao Wang, Zhizhou Ren, Terry Liu, Yang Yu 等ICLR 2021 · 被引用 595 次
- Multi-Agent Reinforcement Learning is a Sequence Modeling ProblemMuning Wen, Jakub Grudzien Kuba, Runji Lin, Weinan Zhang 等NeurIPS 2022 · 被引用 408 次
- Simplified Action Decoder for Deep Multi-Agent Reinforcement LearningHengyuan Hu, Jakob N. FoersterICLR 2020 · 被引用 88 次
- Randomized Entity-wise Factorization for Multi-Agent Reinforcement LearningShariq Iqbal, Christian A. Schröder de Witt, Bei Peng, Wendelin Boehmer 等ICML 2021 · 被引用 84 次
相关 Paper
- GRDC: A Unified Graph-Driven Framework for Role Discovery and Communication in Multi-Agent Reinforcement LearningZihong Gao, Hongjian Liang, Yuanhui Hao, Lei Hao 等AAAI 2026
- In-Context Fully Decentralized Cooperative Multi-Agent Reinforcement LearningChao Li, Bingkun Bao, Yang GaoNeurIPS 2025 · 被引用 2 次
- Rainbow Delay Compensation: A Multi-Agent Reinforcement Learning Framework for Mitigating Observation DelaysSongchen Fu, Siang Chen, Shaojing Zhao, Letian Bai 等NeurIPS 2025 · 被引用 2 次
- S2RL: Do We Really Need to Perceive All States in Deep Multi-Agent Reinforcement Learning?Shuang Luo, Yinchuan Li, Jiahui Li, Kun Kuang 等KDD 2022 · 被引用 5 次
- SMIX(λ): Enhancing Centralized Value Functions for Cooperative Multi-Agent Reinforcement LearningChao Wen, Xinghu Yao, Yuhui Wang, Xiaoyang TanAAAI 2020 · 被引用 57 次
