Pre-training Graph Transformer with Multimodal Side Information for Recommendation
Yong Liu, Susen Yang, Chenyi Lei, Guoxin Wang, Haihong Tang, Juyong Zhang, Aixin Sun, Chunyan Miao
Abstract
Side information of items, e.g., images and text description, has shown to be effective in contributing to accurate recommendations. Inspired by the recent success of pre-training models on natural language and images, we propose a pre-training strategy to learn item representations by considering both item side information and their relationships. We relate items by common user activities e.g., co-purchase, and construct a homogeneous item graph. This graph provides a unified view of item relations and their associated side information in multimodality. We develop a novel sampling algorithm named MCNSampling to select contextual neighbors for each item. The proposed Pre-trained Multimodal Graph Transformer (PMGT) learns item representations with two objectives: 1) graph structure reconstruction, and 2) masked node feature reconstruction. Experimental results on real datasets demonstrate that the proposed PMGT model effectively exploits the multimodality side information to achieve better accuracies in downstream tasks including item recommendation, item classification, and click-through ratio prediction. We also report a case study of testing the proposed PMGT model in an online setting with 600 thousand users.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Cited by top-tier papers5
- MISSRec: Pre-training and Transferring Multi-modal Interest-aware Sequence Representation for RecommendationJinpeng Wang, Ziyun Zeng, Yunxiao Wang, Yuting Wang et al.ACM MM 2023 · 62 citations
- MAP: A Model-agnostic Pretraining Framework for Click-through Rate PredictionJianghao Lin, Yanru Qu, Wei Guo, Xinyi Dai et al.KDD 2023 · 28 citations
- Rankformer: A Graph Transformer for Recommendation based on Ranking ObjectiveSirui Chen, Shen Han, Jiawei Chen, Binbin Hu et al.WWW 2025 · 7 citations
- Consistency and Discrepancy-Based Contrastive Tripartite Graph Learning for RecommendationsLinxin Guo, Yaochen Zhu, Min Gao, Yinghui Tao et al.KDD 2024 · 5 citations
- HGOE: Hybrid External and Internal Graph Outlier Exposure for Graph Out-of-Distribution DetectionJunwei He, Qianqian Xu, Yangbangyan Jiang, Zitai Wang et al.ACM MM 2024 · 4 citations
Builds on5
- Strategies for Pre-training Graph Neural NetworksWeihua Hu, Bowen Liu, Joseph Gomes, Marinka Zitnik et al.ICLR 2020 · 1,744 citations
- Rethinking ImageNet Pre-TrainingKaiming He, Ross B. Girshick, Piotr DollárICCV 2019 · 1,188 citations
- GCC: Graph Contrastive Coding for Graph Neural Network Pre-TrainingJiezhong Qiu, Qibin Chen, Yuxiao Dong, Jing Zhang et al.KDD 2020 · 755 citations
- GPT-GNN: Generative Pre-Training of Graph Neural NetworksZiniu Hu, Yuxiao Dong, Kuansan Wang, Kai-Wei Chang et al.KDD 2020 · 438 citations
- Scaling and Benchmarking Self-Supervised Visual Representation LearningPriya Goyal, Dhruv Mahajan, Abhinav Gupta, Ishan MisraICCV 2019 · 429 citations
Related papers
- Modality-Independent Graph Neural Networks with Global Transformers for Multimodal RecommendationJun Hu, Bryan Hooi, Bingsheng He, Yinwei WeiAAAI 2025 · 31 citations
- Simple Yet Effective: Structure Guided Pre-trained Transformer for Multi-modal Knowledge Graph ReasoningKe Liang, Lingyuan Meng, Yue Liu, Meng Liu et al.ACM MM 2024 · 29 citations
- Universal Item Tokenization for Transferable Generative RecommendationBowen Zheng, Hongyu Lu, Yu Chen, Wayne Xin Zhao et al.SIGIR 2026
- MLLMRec: A Preference Reasoning Paradigm with Graph Refinement for Multimodal RecommendationYuzhuo Dang, Xin Zhang, Zhiqiang Pan, Yuxiao Duan et al.SIGIR 2026 · 1 citation
- LGMRec: Local and Global Graph Learning for Multimodal RecommendationZhiqiang Guo, Jianjun Li, Guohui Li, Chaoyang Wang et al.AAAI 2024 · 164 citations
