DAGC: Data-Aware Adaptive Gradient Compression
Rongwei Lu, Jiajun Song, Bin Chen, Laizhong Cui, Zhi Wang
Abstract
Gradient compression algorithms are widely used to alleviate the communication bottleneck in distributed ML. However, existing gradient compression algorithms suffer from accuracy degradation in Non-IID scenarios, because a uniform compression scheme is used to compress gradients at workers with different data distributions and volumes, since workers with larger volumes of data are forced to adapt to the same aggressive compression ratios as others. Assigning different compression ratios to workers with different data distributions and volumes is thus a promising solution. In this study, we first derive a function from capturing the correlation between the number of training iterations for a model to converge to the same accuracy, and the compression ratios at different workers; This function particularly shows that workers with larger data volumes should be assigned with higher compression ratios 1 to guarantee better accuracy. Then, we formulate the assignment of compression ratios to the workers as an n-variables chisquare nonlinear optimization problem under fixed and limited total communication constrain. We propose an adaptive gradient compression strategy called DAGC, which assigns each worker a different compression ratio according to their data volumes. Our experiments confirm that DAGC can achieve better performance facing highly imbalanced data volume distribution and restricted communication.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 789bbfef-2e93-4765-88c5-57ba53937e96Cited by top-tier papers4
- Accelerating Parallel Diffusion Model Serving with Residual CompressionJiajun Luo, Yicheng Xiao, Jianru Xu, Yangxiu You et al.NeurIPS 2025 · 3 citations
- γ-FedHT: Stepsize-Aware Hard-Threshold Gradient Compression in Federated LearningRongwei Lu, Yutong Jiang, Jinrui Zhang, Chunyang Li et al.INFOCOM 2025 · 2 citations
- DICE: Staleness-Centric Optimizations for Parallel Diffusion MoE InferenceJiajun Luo, Lizhuo Luo, Jianru Xu, Jiajun Song et al.ICCV 2025 · 1 citation
- LEGACY: A Lightweight Dynamic Gradient Compression Strategy for Distributed Deep LearningMostapha Essoullami, El Houcine Bergou, Aritra DuttaICLR 2026
Builds on7
- Tackling the Objective Inconsistency Problem in Heterogeneous Federated OptimizationJianyu Wang, Qinghua Liu, Hao Liang, Gauri Joshi et al.NeurIPS 2020 · 2,231 citations
- Federated Learning with Matched AveragingHongyi Wang, Mikhail Yurochkin, Yuekai Sun, Dimitris S. Papailiopoulos et al.ICLR 2020 · 1,368 citations
- Federated Learning on Non-IID Data Silos: An Experimental StudyQinbin Li, Yiqun Diao, Quan Chen, Bingsheng HeICDE 2022 · 1,110 citations
- The Non-IID Data Quagmire of Decentralized Machine LearningKevin Hsieh, Amar Phanishayee, Onur Mutlu, Phillip B. GibbonsICML 2020 · 672 citations
- Rethinking gradient sparsification as total error minimizationAtal Narayan Sahu, Aritra Dutta, Ahmed M. Abdelmoniem, Trambak Banerjee et al.NeurIPS 2021 · 85 citations
Related papers
- Communication Efficient SGD via Gradient Sampling With Bayes PriorLiuyihan Song, Kang Zhao, Pan Pan, Yu Liu et al.CVPR 2021
- On Distributed Adaptive Optimization with Gradient CompressionXiaoyun Li, Belhal Karimi, Ping LiICLR 2022 · 34 citations
- ScaleCom: Scalable Sparsified Gradient Compression for Communication-Efficient Distributed TrainingChia-Yu Chen, Jiamin Ni, Songtao Lu, Xiaodong Cui et al.NeurIPS 2020 · 81 citations
- Unbiased Compression Saves Communication in Distributed Optimization: When and How Much?Yutong He, Xinmeng Huang, Kun YuanNeurIPS 2023 · 25 citations
- A Flexible Framework for Communication-Efficient Machine LearningSarit Khirirat, Sindri Magnússon, Arda Aytekin, Mikael JohanssonAAAI 2021 · 16 citations
