DMMD4SR: Diffusion Model-based Multi-level Multimodal Denoising for Sequential Recommendation
Weihai Lu, Li Yin
Abstract
Multimodal Sequential Recommendation (MMSR) leverages rich item features but often suffers from noisy representations derived from pre-trained models (PTMs). Existing methods neglect critical challenges: (1) domain shift between PTM training data and recommendation scenarios, (2) interest-agnostic noise within modalities (e.g., irrelevant background details), and (3) interaction uncertainty complicating modality fusion. To address these intertwined challenges, we propose DMMD4SR, a novel Diffusion Model-based Multi-level Multimodal Denoising framework for Sequential Recommendation. Inspired by the denoising power of diffusion models, DMMD4SR employs a progressive, multi-level strategy. It includes layers specifically designed to mitigate domain shift noise and context-aware interest-agnostic noise within modalities. Furthermore, an Uncertainty-Guided Modality Denoising Fusion Layer adaptively integrates the purified representations while accounting for interaction uncertainty. Extensive experiments on benchmark datasets demonstrate that DMMD4SR significantly outperforms state-of-the-art baselines, validating the effectiveness of our multi-level denoising approach. The code is available at https://github.com/luweihai/DMMD4SR.
Ask about this paper
Ask your agent about it.
Lune has read the top-tier papers around this one, so every answer names the papers it rests on.
Cited by top-tier papers11
- From IDs to Semantics: A Generative Framework for Cross-Domain Recommendation with Adaptive Semantic TokenizationPeiyu Hu, Wayne Lu, Jia WangAAAI 2026 · 5 citations
- Retrieval-Augmented Multimodal Model for Fake News DetectionYiheng Li, Weihai Lu, Hanyi Yu, Yue WangSIGIR 2026 · 4 citations
- FedAU2: Attribute Unlearning for User-Level Federated Recommender Systems with Adaptive and Robust Adversarial TrainingYuyuan Li, Junjie Fang, Fengyuan Yu, Xichun Sheng et al.AAAI 2026 · 1 citation
- TOFA: Training-Free One-Shot Federated Adaptation for Vision-Language ModelsLi Zhang, Zhongxuan Han, Xiaohua Feng, Jiaming Zhang et al.AAAI 2026 · 1 citation
- Breaking Down Market Barriers: Distilled Prompt-Tuning Approach for Cross-Market RecommendationLeqi Zhang, Wayne Lu, Haiyang Zhang, Elliott Wen et al.AAAI 2026
Related papers
- MISSRec: Pre-training and Transferring Multi-modal Interest-aware Sequence Representation for RecommendationJinpeng Wang, Ziyun Zeng, Yunxiao Wang, Yuting Wang et al.ACM MM 2023 · 62 citations
- Boosting Guided Diffusion with Large Language Models for Multimodal Sequential RecommendationTe Song, Lianyong Qi, Weiming Liu, Fan Wang et al.ACM MM 2025 · 1 citation
- Multi-Modal Multi-Behavior Sequential Recommendation with Conditional Diffusion-Based Feature DenoisingXiaoxi Cui, Weihai Lu, Yu Tong, Yiheng Li et al.SIGIR 2025 · 21 citations
- SGP4SR: Separated-Modality Guided User Preference Learning for Multimodal Sequential RecommendationChanghong Li, Zhiqiang Guo, Guohui Li, Zhong Yang et al.AAAI 2026
- Beyond Static Diffusion: Explicitly Modeling Temporal Patterns in Sequential RecommendationYao Wu, Chengyi Liu, Wenqi Fan, Rui ZhangSIGIR 2026
