Decouple-Then-Merge: Finetune Diffusion Models as Multi-Task Learning
Qianli Ma, Xuefei Ning, Dongrui Liu, Li Niu, Linfeng Zhang
摘要
Diffusion models are trained by learning a sequence of models that reverse each step of noise corruption. Typically, the model parameters are fully shared across multiple timesteps to enhance training efficiency. However, since the denoising tasks differ at each timestep, the gradients computed at different timesteps may conflict, potentially degrading the overall performance of image generation. To solve this issue, this work proposes a Decouple-then-Merge (DeMe) framework, which begins with a pretrained model and finetunes separate models tailored to specific timesteps. We introduce several improved techniques during the finetuning stage to promote effective knowledge sharing while minimizing training interference across timesteps. Finally, after finetuning, these separate models can be merged into a single model in the parameter space, ensuring efficient and practical inference. Experimental results show significant generation quality improvements upon 6 benchmarks including Stable Diffusion on COCO30K, ImageNet1K, PartiPrompts, and DDPM on LSUN Church, LSUN Bedroom, and CIFAR10. Code is included in the supplementary material and will be released on Github.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper4
- Group Editing: Edit Multiple Images in One GoYue Ma, Xinyu Wang, Qianli Ma, Qinghe Wang 等CVPR 2026 · 被引用 15 次
- Paper2Rebuttal: A Multi-Agent Framework for Transparent Author Response AssistanceQianli Ma, Chang Guo, Zhiheng Tian, Siyu Wang 等ACL 2026 · 被引用 6 次
- A Unified Density Operator View of Flow Control and MergingRiccardo De Santi, Malte Franke, Ya-Ping Hsieh, Andreas KrauseICML 2026 · 被引用 2 次
- NaRA: Noise-Aware LoRA for Parameter-Efficient Fine-Tuning of Diffusion LLMsShuaidi Wang, Zhan Zhuang, HUANG Ruping, Yu ZhangICML 2026 · 被引用 1 次
它引用的顶会 Paper30
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 被引用 35,902 次
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- Directly Denoising Diffusion ModelsDan Zhang, Jingjing Wang, Feng LuoICML 2024 · 被引用 11,724 次
- Photorealistic Text-to-Image Diffusion Models with Deep Language UnderstandingChitwan Saharia, William Chan, Saurabh Saxena, Lala Li 等NeurIPS 2022 · 被引用 8,965 次
相关 Paper
- Divide-and-Denoise: A Game-Theoretic Method for Fairly Composing Diffusion ModelsAbhi Gupta, Polina Barabanshchikova, Vikas Garg, Samuel Kaski 等ICML 2026
- Improving Training Efficiency of Diffusion Models via Multi-Stage Framework and Tailored Multi-Decoder ArchitectureHuijie Zhang, Yifu Lu, Ismail Alkhouri, Saiprasad Ravishankar 等CVPR 2024 · 被引用 10 次
- DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image ModelsKomal Kumar, Rao Muhammad Anwer, Fahad Shahbaz Khan, Salman H. Khan 等NeurIPS 2025 · 被引用 2 次
- DDT: Decoupled Diffusion TransformerShuai Wang, Zhi Tian, Weilin Huang, Limin WangCVPR 2026 · 被引用 102 次
- Resolving Multi-Condition Confusion for Finetuning-Free Personalized Image GenerationQihan Huang, Siming Fu, Jinlong Liu, Hao Jiang 等AAAI 2025 · 被引用 43 次
