Understanding and Mitigating Hardware Failures in Deep Learning Training Systems
Yi He, Mike Hutton, Steven Chan, Robert De Gruijl, Rama Govindaraju, Nishant Patil, Yanjing Li
2023年份
52被引次数
7顶会引用
摘要
Deep neural network (DNN) training workloads are increasingly susceptible to hardware failures in datacenters. For example, Google experienced "mysterious, difficult to identify problems" in their TPU training systems due to hardware failures [7]. Although these particular problems were subsequently corrected through significant efforts, they have raised the urgency of addressing the growing challenges emerging from hardware failures impacting many DNN training workloads.
问问这篇 Paper
问问你的智能体。
Lune 读过与它相关的顶会 Paper,每个回答都会注明依据哪几篇。
引用它的顶会 Paper7
- Fire-Flyer AI-HPC: A Cost-Effective Software-Hardware Co-Design for Deep LearningWei An, Xiao Bi, Guanting Chen, Shanhuang Chen 等SC 2024 · 被引用 20 次
- PCcheck: Persistent Concurrent Checkpointing for MLFoteini Strati, Michal Friedman, Ana KlimovicASPLOS 2025 · 被引用 11 次
- ATTNChecker: Highly-Optimized Fault Tolerant Attention for Large Language Model TrainingYuhang Liang, Xinyi Li, Jie Ren, Ang Li 等PPoPP 2025 · 被引用 10 次
- Proactive Runtime Detection of Aging-Related Silent Data Corruptions: A Bottom-Up ApproachJiacheng Ma, Majd Ganaiem, Madeline Burbage, Theo Gregersen 等ASPLOS 2024 · 被引用 7 次
- Robust LLM Training Infrastructure at ByteDanceBorui Wan, Gaohong Liu, Zuquan Song, Jun Wang 等SOSP 2025 · 被引用 1 次
相关 Paper
- Just-In-Time Checkpointing: Low Cost Error Recovery from Deep Learning Training FailuresTanmaey Gupta, Sanjeev Krishnan, Rituraj Kumar, Abhishek Vijeev 等EuroSys 2024 · 被引用 23 次
- Understanding Stragglers in Large Model Training Using What-if AnalysisJinkun Lin, Ziheng Jiang, Zuquan Song, Sida Zhao 等OSDI 2025 · 被引用 23 次
- ATP: In-network Aggregation for Multi-tenant LearningChonLam Lao, Yanfang Le, Kshiteej Mahajan, Yixi Chen 等NSDI 2021 · 被引用 359 次
- Resiliency at Scale: Managing Google's TPUv4 Machine Learning SupercomputerYazhou Zu, Alireza Ghaffarkhah, Hoang-Vu Dang, Brian Towles 等NSDI 2024 · 被引用 46 次
- Fine-grained Automated Failure Management for Extreme-Scale GPU Accelerated SystemsYonatan Levitt, Richard Barella, Sam Zeltner, Thomas Musta 等SC 2025 · 被引用 1 次
