Empowering Multi-Robot Cooperation via Sequential World Models
Zijie Zhao, Honglei Guo, Shengqian Chen, Kaixuan Xu, Bo Jiang, Yuanheng Zhu, Dongbin Zhao
摘要
Model-based reinforcement learning (MBRL) has achieved remarkable success in robotics due to its high sample efficiency and planning capability. However, extending MBRL to physical multi-robot cooperation remains challenging due to the complexity of joint dynamics. To address this challenge, we propose the Sequential World Model (SeqWM), a novel framework that integrates the sequential paradigm into multi-robot MBRL. SeqWM employs independent, autoregressive agent-wise world models to represent joint dynamics, where each agent generates its future trajectory and plans its actions based on the predictions of its predecessors. This design lowers modeling complexity and enables the emergence of advanced cooperative behaviors through explicit intention sharing. Experiments on Bi-DexHands and Multi-Quadruped demonstrate that SeqWM outperforms existing state-of-the-art model-based and model-free baselines in both overall performance and sample efficiency, while exhibiting advanced cooperative behaviors such as predictive adaptation, temporal alignment, and role division. Furthermore, SeqWM has been successfully deployed on physical quadruped robots, validating its effectiveness in real-world multi-robot systems. Demos and code are available at: https://github.com/zhaozijie2022/seqwm
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper8
- Revisiting Multi-Agent World Modeling from a Diffusion-Inspired PerspectiveYang Zhang, Xinran Li, Jianing Ye, Shuang Qiu 等NeurIPS 2025 · 被引用 14 次
- Learning and Planning Multi-Agent Tasks via an MoE-based World ModelZijie Zhao, Zhongyue Zhao, Kaixuan Xu, Yuqian Fu 等NeurIPS 2025 · 被引用 12 次
- Videos are Sample-Efficient Supervisions: Behavior Cloning from Videos via Latent RepresentationsXin Liu, Haoran Li, Dongbin ZhaoNeurIPS 2025 · 被引用 5 次
- Equilibrium Policy Generalization: A Reinforcement Learning Framework for Cross-Graph Zero-Shot Generalization in Pursuit-Evasion GamesRunyu Lu, Peng Zhang, Ruochuan Shi, Yuanheng Zhu 等NeurIPS 2025 · 被引用 3 次
- Bi-Level Knowledge Transfer for Multi-Task Multi-Agent Reinforcement LearningJunkai Zhang, Jinmin He, Yifan Zhang, Yifan Zang 等NeurIPS 2025 · 被引用 1 次
它引用的顶会 Paper13
- Multi-Agent Reinforcement Learning is a Sequence Modeling ProblemMuning Wen, Jakub Grudzien Kuba, Runji Lin, Weinan Zhang 等NeurIPS 2022 · 被引用 408 次
- Temporal Difference Learning for Model Predictive ControlNicklas Hansen, Hao Su, Xiaolong WangICML 2022 · 被引用 388 次
- TD-MPC2: Scalable, Robust World Models for Continuous ControlNicklas Hansen, Hao Su, Xiaolong WangICLR 2024 · 被引用 388 次
- Trust Region Policy Optimisation in Multi-Agent Reinforcement LearningJakub Grudzien Kuba, Ruiqing Chen, Muning Wen, Ying Wen 等ICLR 2022 · 被引用 367 次
- Conformal Prediction for Uncertainty-Aware Planning with Diffusion Dynamics ModelJiankai Sun, Yiqi Jiang, Jianing Qiu, Parth Nobel 等NeurIPS 2023 · 被引用 79 次
相关 Paper
- HarmonyDream: Task Harmonization Inside World ModelsHaoyu Ma, Jialong Wu, Ningya Feng, Chenjun Xiao 等ICML 2024 · 被引用 21 次
- R3DM: Enabling Role Discovery and Diversity Through Dynamics Models in Multi-agent Reinforcement LearningHarsh Goel, Mohammad Omama, Behdad Chalaki, Vaishnav Tadiparthi 等ICML 2025
- Parallelizing Model-based Reinforcement Learning Over the Sequence LengthZirui Wang, Yue Deng, Junfeng Long, Yin ZhangNeurIPS 2024 · 被引用 9 次
- From Observations to Events: Event-Aware World Models for Reinforcement LearningZhao-Han Peng, Shaohui Li, Zhi Li, Shulan Ruan 等ICLR 2026
- TaskLoom: Weaving Knowledge Across Tasks in World ModelsQingzhang Zeng, Peixi Peng, hang li, Luntong Li 等ICML 2026
