FT2: First-Token-Inspired Online Fault Tolerance on Critical Layers for Generative Large Language Models
Yu Sun, Zhu Zhu, Cherish Mulpuru, Roberto Gioiosa, Zhao Zhang, Bo Fang, Lishan Yang
2025年份
7被引次数
2顶会引用
摘要
Generative Large Language Models (LLMs) are deployed on large-scale computing systems, where such tasks unavoidably suffer from soft errors, leading to quality degradation of content generated by LLMs. Enhancing LLM resilience is particularly challenging because of its complicated model architecture and tremendous size. State-of-the-art protections have limitations such as high overhead and incomplete coverage, and often require offline profiling.
问问这篇 Paper
问问你的智能体。
Lune 读过与它相关的顶会 Paper,每个回答都会注明依据哪几篇。
引用它的顶会 Paper2
- Demystifying the Resilience of Large Language Model Inference: An End-to-End PerspectiveYu Sun, Zachary Coalson, Shiyang Chen, Hang Liu 等SC 2025 · 被引用 9 次
- ResiHP: Taming LLM Training Failures with Dynamic Hybrid ParallelismTenghui Ma, Jihu Guo, Wei Gao, Sitian Lu 等HPDC 2026
相关 Paper
- LMTracer: Fine-Grained and Real-Time Performance Profiling for Production LLM SystemsWei Liu, Yongchao He, Bohan Zhao, Hongyi Wang 等SOSP 2026
- ErrorTrace: A Black-Box Traceability Mechanism Based on Model Family Error SpaceChuanchao Zang, Xiangtao Meng, Wenyu Chen, Tianshuo Cong 等NeurIPS 2025 · 被引用 4 次
- PiLLM: Resource-Efficient LLM Inference Using Workload PredictionYunqian Fan, Shihao Bai, Ruihao Gong, Zaijun Wang 等EuroSys 2026
- SymSan: Mitigating Malware Embedding in Large Language Models via Parameter Space SymmetryMing Tan, Wei Li, Tao Hu, Qian Chen 等CCS 2026
- Bit-Flip Error Resilience in LLMs: A Comprehensive Analysis and Defense FrameworkYuhang Chen, Zhen Tan, Ajay Kumar Jaiswal, Huaizhi Qu 等EMNLP 2025
