RDMA over Ethernet for Distributed Training at Meta Scale
Adithya Gangidi, Rui Miao, Shengbao Zheng, Sai Jayesh Bondu, Guilherme Loch Waltrick Goes, Hany Morsy, Rohit Puri, Mohammad Riftadi, Ashmitha Jeevaraj Shetty, Jingyi Yang, Shuqiang Zhang, Mikel Jimenez Fernandez
2024年份
171被引次数
45顶会引用
摘要
The rapid growth in both computational density and scale in AI models in recent years motivates the construction of an efficient and reliable dedicated network infrastructure. This paper presents the design, implementation, and operation of Meta's Remote Direct Memory Access over Converged Ethernet (RoCE) networks for distributed AI training.
问问这篇 Paper
问问你的智能体。
Lune 读过与它相关的顶会 Paper,每个回答都会注明依据哪几篇。
引用它的顶会 Paper45
- White-Boxing RDMA with Packet-Granular Software ControlChenxingyu Zhao, Jaehong Min, Ming Liu, Arvind KrishnamurthyNSDI 2025 · 被引用 28 次
- Holmes: Localizing Irregularities in LLM Training with Mega-scale GPU ClustersZhiyi Yao, Pengbo Hu, Congcong Miao, Xuya Jia 等NSDI 2025 · 被引用 23 次
- Revisiting RDMA Reliability for Lossy FabricsWenxue Li, Xiangzhou Liu, Yunxuan Zhang, Zihao Wang 等SIGCOMM 2025 · 被引用 21 次
- Fire-Flyer AI-HPC: A Cost-Effective Software-Hardware Co-Design for Deep LearningWei An, Xiao Bi, Guanting Chen, Shanhuang Chen 等SC 2024 · 被引用 20 次
- eTran: Extensible Kernel Transport with eBPFZhongjie Chen, Qingkai Meng, ChonLam Lao, Yifan Liu 等NSDI 2025 · 被引用 17 次
相关 Paper
- Enabling AI Network Cross-Layer Design and Operations with Arcadia: A Simulation Platform at ScaleZhaodong Wang, Satyajeet Singh Ahuja, Xu Zhang, Max Noormohammadpour 等NSDI 2026 · 被引用 3 次
- Vela: A Virtualized LLM Training System with GPU Direct RoCEApoorve Mohan, Robert Walkup, Bengi Karacali, Ming-Hung Chen 等ASPLOS 2025 · 被引用 3 次
- STORM: Enabling Traffic Scheduling for RDMAJichun Wu, Ran Shu, Gianni Antichi, Yongqiang Xiong 等SIGCOMM 2026
- Matryoshka: Realizing Hyperscale Data Center Network Design for the AI EraYan Cai, Jialong Li, Kutalmis Akpinar, Tianxiang Li 等NSDI 2026 · 被引用 3 次
- An In-Network Architecture for Accelerating Shared-Memory Multiprocessor CollectivesBenjamin Klenk, Nan Jiang, Greg Thorson, Larry DennisonISCA 2020 · 被引用 67 次
