DiffMM: Multi-Modal Diffusion Model for Recommendation
Yangqin Jiang, Lianghao Xia, Wei Wei, Da Luo, Kangyi Lin, Chao Huang
摘要
The rise of online multi-modal sharing platforms like TikTok and YouTube has enabled personalized recommender systems to incorporate multiple modalities (such as visual, textual, and acoustic) into user representations. However, addressing the challenge of data sparsity in these systems remains a key issue. To address this limitation, recent research has introduced self-supervised learning techniques to enhance recommender systems. However, these methods often rely on simplistic random augmentation or intuitive cross-view information, which can introduce irrelevant noise and fail to accurately align the multi-modal context with useritem interaction modeling. To fill this research gap, we propose a novel multi-modal graph diffusion model for recommendation called DiffMM. Our framework integrates a modality-aware graph diffusion model with a cross-modal contrastive learning paradigm to improve modality-aware user representation learning. This integration facilitates better alignment between multi-modal feature information and collaborative relation modeling. Our approach leverages diffusion models' generative capabilities to automatically generate a user-item graph that is aware of different modalities, facilitating the incorporation of useful multi-modal knowledge in modeling user-item interactions. We conduct extensive experiments on three public datasets, consistently demonstrating the superiority of our DiffMM over various competitive baselines. For open-sourced model implementation details, you can access the source codes of our proposed framework at: https://github.com/HKUDS/DiffMM.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper23
- Generating with Fairness: A Modality-Diffused Counterfactual Framework for Incomplete Multimodal RecommendationsJin Li, Shoujin Wang, Qi Zhang, Shui Yu 等WWW 2025 · 被引用 26 次
- COHESION: Composite Graph Convolutional Network with Dual-Stage Fusion for Multimodal RecommendationJinfeng Xu, Zheyu Chen, Wei Wang, Xiping Hu 等SIGIR 2025 · 被引用 20 次
- Structured Spectral Reasoning for Frequency-Adaptive Multimodal RecommendationWei Yang, Rui Zhong, Yiqun Chen, Chi Lu 等NeurIPS 2025 · 被引用 10 次
- The Best is Yet to Come: Graph Convolution in the Testing Phase for Multimodal RecommendationJinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li 等ACM MM 2025 · 被引用 8 次
- FITMM: Adaptive Frequency-Aware Multimodal Recommendation via Information-Theoretic Representation LearningWei Yang, Rui Zhong, Yiqun Chen, Shixuan Li 等ACM MM 2025 · 被引用 6 次
它引用的顶会 Paper20
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 被引用 35,902 次
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- LightGCN: Simplifying and Powering Graph Convolution Network for RecommendationXiangnan He, Kuan Deng, Xiang Wang, Yan Li 等SIGIR 2020 · 被引用 4,448 次
- Self-supervised Graph Learning for RecommendationJiancan Wu, Xiang Wang, Fuli Feng, Xiangnan He 等SIGIR 2021 · 被引用 1,476 次
- Contrastive Learning for Sequential RecommendationXu Xie, Fei Sun, Zhaoyang Liu, Shiwen Wu 等ICDE 2022 · 被引用 674 次
相关 Paper
- Multi-Modal Self-Supervised Learning for RecommendationWei Wei, Chao Huang, Lianghao Xia, Chuxu ZhangWWW 2023 · 被引用 256 次
- Refining Contrastive Learning and Homography Relations for Multi-Modal RecommendationShouxing Ma, Yawen Zeng, Shiqing Wu, Guandong XuACM MM 2025 · 被引用 3 次
- MENTOR: Multi-level Self-supervised Learning for Multimodal RecommendationJinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li 等AAAI 2025 · 被引用 21 次
- Contrastive Intra- and Inter-Modality Generation for Enhancing Incomplete Multimedia RecommendationZhenghong Lin, Yanchao Tan, Yunfei Zhan, Weiming Liu 等ACM MM 2023 · 被引用 27 次
- Curriculum Conditioned Diffusion for Multimodal RecommendationYimeng Yang, Haokai Ma, Lei Meng, Shuo Xu 等AAAI 2025 · 被引用 12 次
