DOSE: Diffusion Dropout with Adaptive Prior for Speech Enhancement
Wenxin Tai, Yue Lei, Fan Zhou, Goce Trajcevski, Ting Zhong
摘要
Speech enhancement (SE) aims to improve the intelligibility and quality of speech in the presence of non-stationary additive noise. Deterministic deep learning models have traditionally been used for SE, but recent studies have shown that generative approaches, such as denoising diffusion probabilistic models (DDPMs), can also be effective. However, incorporating condition information into DDPMs for SE remains a challenge. We propose a model-agnostic method called DOSE that employs two efficient condition-augmentation techniques to address this challenge, based on two key insights: (1) We force the model to prioritize the condition factor when generating samples by training it with dropout operation; (2) We inject the condition information into the sampling process by providing an informative adaptive prior. Experiments demonstrate that our approach yields substantial improvements in high-quality and stable speech generation, consistency with the condition factor, and inference efficiency. Codes are publicly available at https://github.com/ICDM-UESTC/DOSE .
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- Rethinking Flow and Diffusion Bridge Models for Speech EnhancementDahan Wang, Jun Gao, Tong Lei, Yuxiang Hu 等AAAI 2026 · 被引用 1 次
- GenSE: Generative Speech Enhancement via Language Models using Hierarchical ModelingJixun Yao, Hexin Liu, Chen Chen, Yuchen Hu 等ICLR 2025
- Dual-View Predictive Diffusion: Lightweight Speech Enhancement via Spectrogram-Image SynergyKe Xue, Rongfei Fan, Kai Li, Shanping Yu 等ICML 2026
- Robust Signal Enhancement via Fractional Detail Views and Knowledge Guided Multi-view FusionZikun Jin, Yuhua Qian, Xinyan Liang, Jiaqian Zhang 等ICML 2026
- RestoreGrad: Signal Restoration Using Conditional Denoising Diffusion Models with Jointly Learned PriorChing Hua Lee, Chouchang Yang, Jaejin Cho, Yashas Malur Saidutta 等ICML 2025
它引用的顶会 Paper5
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 被引用 35,902 次
- Improved Denoising Diffusion Probabilistic ModelsAlexander Quinn Nichol, Prafulla DhariwalICML 2021 · 被引用 5,234 次
- DiffWave: A Versatile Diffusion Model for Audio SynthesisZhifeng Kong, Wei Ping, Jiaji Huang, Kexin Zhao 等ICLR 2021 · 被引用 1,902 次
- ProDiff: Progressive Fast Diffusion Model for High-Quality Text-to-SpeechRongjie Huang, Zhou Zhao, Huadai Liu, Jinglin Liu 等ACM MM 2022 · 被引用 182 次
- Revisiting Denoising Diffusion Probabilistic Models for Speech Enhancement: Condition Collapse, Efficiency and RefinementWenxin Tai, Fan Zhou, Goce Trajcevski, Ting ZhongAAAI 2023 · 被引用 38 次
相关 Paper
- PriorGrad: Improving Conditional Denoising Diffusion Models with Data-Dependent Adaptive PriorSang-gil Lee, Heeseung Kim, Chaehun Shin, Xu Tan 等ICLR 2022 · 被引用 117 次
- Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion ModelXiangyu Zhang, Daijiao Liu, Hexin Liu, Qiquan Zhang 等EMNLP 2024 · 被引用 3 次
- WaveGrad: Estimating Gradients for Waveform GenerationNanxin Chen, Yu Zhang, Heiga Zen, Ron J. Weiss 等ICLR 2021 · 被引用 44 次
- Joint Enhancement and Classification using Coupled Diffusion Models of Signals and LogitsGilad Nurko, Roi Benita, Yehoshua Dissen, Tomohiro Nakatani 等ICML 2026
- On Inference Stability for Diffusion ModelsViet Nguyen, Giang Vu, Tung Nguyen Thanh, Khoat Than 等AAAI 2024 · 被引用 3 次
