Ambient Diffusion: Learning Clean Distributions from Corrupted Data
Giannis Daras, Kulin Shah, Yuval Dagan, Aravind Gollakota, Alex Dimakis, Adam R. Klivans
Abstract
We present the first diffusion-based framework that can learn an unknown distribution using only highly-corrupted samples. This problem arises in scientific applications where access to uncorrupted samples is impossible or expensive to acquire. Another benefit of our approach is the ability to train generative models that are less likely to memorize individual training samples since they never observe clean training data. Our main idea is to introduce additional measurement distortion during the diffusion process and require the model to predict the original corrupted image from the further corrupted image. We prove that our method leads to models that learn the conditional expectation of the full uncorrupted image given this additional measurement corruption. This holds for any corruption process that satisfies some technical conditions (and in particular includes inpainting and compressed sensing). We train models on standard benchmarks (CelebA, CIFAR-10 and AFHQ) and show that we can learn the distribution even when all the training samples have of their pixels missing. We also show that we can finetune foundation models on small corrupted datasets (e.g. MRI scans with block corruptions) and learn the clean distribution without memorizing the training set.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Cited by top-tier papers43
- Detecting, Explaining, and Mitigating Memorization in Diffusion ModelsYuxin Wen, Yuchen Liu, Chen Chen, Lingjuan LyuICLR 2024 · 103 citations
- Learning Diffusion Priors from Observations by Expectation MaximizationFrançois Rozet, Gérôme Andry, François Lanusse, Gilles LouppeNeurIPS 2024 · 79 citations
- Be like a Goldfish, Don't Memorize! Mitigating Memorization in Generative LLMsAbhimanyu Hans, John Kirchenbauer, Yuxin Wen, Neel Jain et al.NeurIPS 2024 · 65 citations
- Schrodinger Bridge Flow for Unpaired Data TranslationValentin De Bortoli, Iryna Korshunova, Andriy Mnih, Arnaud DoucetNeurIPS 2024 · 55 citations
- Consistent Diffusion Meets Tweedie: Training Exact Ambient Diffusion Models with Noisy DataGiannis Daras, Alex Dimakis, Constantinos DaskalakisICML 2024 · 45 citations
Builds on26
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 35,902 citations
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser et al.CVPR 2022 · 13,123 citations
- Denoising Diffusion Implicit ModelsJiaming Song, Chenlin Meng, Stefano ErmonICLR 2021 · 11,743 citations
- Photorealistic Text-to-Image Diffusion Models with Deep Language UnderstandingChitwan Saharia, William Chan, Saurabh Saxena, Lala Li et al.NeurIPS 2022 · 8,965 citations
- Emerging Properties in Self-Supervised Vision TransformersMathilde Caron, Hugo Touvron, Ishan Misra, Hervé Jégou et al.ICCV 2021 · 8,921 citations
Related papers
- A Diffusion Model with State Estimation for Degradation-Blind Inverse ImagingLiya Ji, Zhefan Rao, Sinno Jialin Pan, Chenyang Lei et al.AAAI 2024 · 5 citations
- An Expectation-Maximization Algorithm for Training Clean Diffusion Models from Corrupted ObservationsWeimin Bai, Yifei Wang, Wenzheng Chen, He SunNeurIPS 2024 · 21 citations
- Score Distillation Beyond Acceleration: Generative Modeling from Corrupted DataYasi Zhang, Tianyu Chen, Zhendong Wang, Ying Nian Wu et al.ICLR 2026 · 2 citations
- Normalization-equivariant Diffusion Models: Learning Posterior Samplers From Noisy And Partial MeasurementsBrett Levac, Jon Tamir, Marcelo Pereyra, Julián TachellaICML 2026 · 2 citations
- Ambient Diffusion Posterior Sampling: Solving Inverse Problems with Diffusion Models Trained on Corrupted DataAsad Aali, Giannis Daras, Brett Levac, Sidharth Kumar et al.ICLR 2025
