MosaicDiff: Training-free Structural Pruning for Diffusion Model Acceleration Reflecting Pretraining Dynamics
Bowei Guo, Shengkun Tang, Cong Zeng, Zhiqiang Shen
Abstract
Diffusion models are renowned for their generative capabilities, yet their pretraining processes exhibit distinct phases of learning speed that have been entirely overlooked in prior post-training acceleration efforts in the community. In this study, we introduce a novel framework called MosaicDiff that aligns diffusion pretraining dynamics with post-training sampling acceleration via trajectory-aware structural pruning. Our approach leverages the observation that the middle, fast-learning stage of diffusion pretraining requires more conservative pruning to preserve critical model features, while the early and later, slow-learning stages benefit from a more aggressive pruning strategy. This adaptive pruning mechanism is the first to explicitly mirror the inherent learning speed variations of diffusion pretraining, thereby harmonizing the model's inner training dynamics with its accelerated sampling process. Extensive experiments on DiT and SDXL demonstrate that our method achieves significant speed-ups in sampling without compromising output quality, outperforming previous state-of-theart methods by large margins, also providing a new viewpoint for more efficient and robust training-free diffusion acceleration. Our implementation is available at https://github.com/bwguo105/MosaicDiff.git.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext e31b393c-e32d-458b-aa28-605d864c046dCited by top-tier papers5
- Pluggable Pruning with Contiguous Layer Distillation for Diffusion TransformersJian Ma, Qirong Peng, Xujie Zhu, Peixing Xie et al.CVPR 2026 · 7 citations
- CacheEdit: Efficient Multi-round Image Editing via Adaptive Token-wise Reuse.Jinxin Yu, Xueqing Chen, Yudong Pan, Lian Liu et al.ICML 2026
- BiGain: Unified Token Compression for Joint Generation and ClassificationJiacheng Liu, Shengkun Tang, Jiacheng Cui, Dongkuan Xu et al.CVPR 2026
- NanoFLUX: Distillation-Driven Compression of Large Text-to-Image Generation Models for Mobile DevicesRuchika Chavhan, Malcolm Chadwick, Alberto Gil Couto Pimentel Ramos, Luca Morreale et al.ICML 2026
- Otil: Accelerating Diffusion Model Inference via Communication-Efficient Multi-GPU ParallelismXin Li, Shujun Tian, Tao Lu, Han Bao et al.CVPR 2026
Builds on23
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh et al.ICML 2021 · 47,906 citations
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 35,902 citations
- Diffusion Models Beat GANs on Image SynthesisPrafulla Dhariwal, Alexander Quinn NicholNeurIPS 2021 · 13,211 citations
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser et al.CVPR 2022 · 13,123 citations
- Directly Denoising Diffusion ModelsDan Zhang, Jingjing Wang, Feng LuoICML 2024 · 11,724 citations
Related papers
- T-Stitch: Accelerating Sampling in Pre-Trained Diffusion Models with Trajectory StitchingZizheng Pan, Bohan Zhuang, De-An Huang, Weili Nie et al.ICLR 2025
- SODA: Sensitivity-Oriented Dynamic Acceleration for Diffusion TransformerTong Shao, Yusen Fu, Guoying Sun, Jingde Kong et al.CVPR 2026 · 1 citation
- Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCacheBowen Cui, Yuanbin Wang, Huajiang Xu, Biaolong Chen et al.CVPR 2026 · 6 citations
- A-FloPS: Accelerating Diffusion Models via Adaptive Flow Path SamplerCheng Jin, Zhenyu Xiao, Yuantao GuAAAI 2026
- DiP-GO: A Diffusion Pruner via Few-step Gradient OptimizationHaowei Zhu, Dehua Tang, Ji Liu, Mingjie Lu et al.NeurIPS 2024 · 51 citations
