Multi-Modal Self-Supervised Learning for Recommendation
Wei Wei, Chao Huang, Lianghao Xia, Chuxu Zhang
摘要
The online emergence of multi-modal sharing platforms (e.g., Tik-Tok, Youtube) is powering personalized recommender systems to incorporate various modalities (e.g., visual, textual and acoustic) into the latent user representations. While existing works on multimodal recommendation exploit multimedia content features in enhancing item embeddings, their model representation capability is limited by heavy label reliance and weak robustness on sparse user behavior data. Inspired by the recent progress of self-supervised learning in alleviating label scarcity issue, we explore deriving selfsupervision signals with effectively learning of modality-aware user preference and cross-modal dependencies. To this end, we propose a new Multi-Modal Self-Supervised Learning (MMSSL) method which tackles two key challenges. Specifically, to characterize the inter-dependency between the user-item collaborative view and item multi-modal semantic view, we design a modality-aware interactive structure learning paradigm via adversarial perturbations for data augmentation. In addition, to capture the effects that user's modality-aware interaction pattern would interweave with each other, a cross-modal contrastive learning approach is introduced to jointly preserve the inter-modal semantic commonality and user preference diversity. Experiments on real-world datasets verify the superiority of our method in offering great potential for multimedia recommendation over various state-of-the-art baselines. The implementation is released at: https://github.com/HKUDS/MMSSL . CCS CONCEPTS • Information systems → Recommender systems.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper53
- UniTime: A Language-Empowered Unified Model for Cross-Domain Time Series ForecastingXu Liu, Junfeng Hu, Yuan Li, Shizhe Diao 等WWW 2024 · 被引用 198 次
- Multi-View Graph Convolutional Network for Multimedia RecommendationPenghang Yu, Zhiyi Tan, Guanming Lu, Bing-Kun BaoACM MM 2023 · 被引用 181 次
- LGMRec: Local and Global Graph Learning for Multimodal RecommendationZhiqiang Guo, Jianjun Li, Guohui Li, Chaoyang Wang 等AAAI 2024 · 被引用 164 次
- Knowledge Graph Self-Supervised Rationalization for RecommendationYuhao Yang, Chao Huang, Lianghao Xia, Chunzhen HuangKDD 2023 · 被引用 151 次
- DiffMM: Multi-Modal Diffusion Model for RecommendationYangqin Jiang, Lianghao Xia, Wei Wei, Da Luo 等ACM MM 2024 · 被引用 92 次
它引用的顶会 Paper15
- Supervised Contrastive LearningPrannay Khosla, Piotr Teterwak, Chen Wang, Aaron Sarna 等NeurIPS 2020 · 被引用 7,049 次
- LightGCN: Simplifying and Powering Graph Convolution Network for RecommendationXiangnan He, Kuan Deng, Xiang Wang, Yan Li 等SIGIR 2020 · 被引用 4,448 次
- Self-supervised Graph Learning for RecommendationJiancan Wu, Xiang Wang, Fuli Feng, Xiangnan He 等SIGIR 2021 · 被引用 1,476 次
- Graph Contrastive Learning with Adaptive AugmentationYanqiao Zhu, Yichen Xu, Feng Yu, Qiang Liu 等WWW 2021 · 被引用 1,415 次
- Revisiting Graph Based Collaborative Filtering: A Linear Residual Graph Convolutional Network ApproachLei Chen, Le Wu, Richang Hong, Kun Zhang 等AAAI 2020 · 被引用 634 次
相关 Paper
- Multimodal-aware Multi-intention Learning for RecommendationWei Yang, Qingchen YangACM MM 2024 · 被引用 4 次
- MENTOR: Multi-level Self-supervised Learning for Multimodal RecommendationJinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li 等AAAI 2025 · 被引用 21 次
- Multi-view Semantic Contrastive Alignment for Multimodal RecommendationJiuqiang Li, Hongjun WangWWW 2026
- Hierarchical Time-Aware Mixture of Experts for Multi-Modal Sequential RecommendationShengzhe Zhang, Liyi Chen, Dazhong Shen, Chao Wang 等WWW 2025 · 被引用 29 次
- Contrastive Intra- and Inter-Modality Generation for Enhancing Incomplete Multimedia RecommendationZhenghong Lin, Yanchao Tan, Yunfei Zhan, Weiming Liu 等ACM MM 2023 · 被引用 27 次
