Retrieval over Classification: Integrating Relation Semantics for Multimodal Relation Extraction
Lei Hei, Tingjing Liao, Peiyingxin, Yiyang Qi, Jiaqi Wang, Ruiting Li, Feiliang Ren
Abstract
Relation extraction (RE) aims to identify semantic relations between entities in unstructured text. Although recent work extends traditional RE to multimodal scenarios, most approaches still adopt classification-based paradigms with fused multimodal features, representing relations as discrete labels. This paradigm has two significant limitations: (1) it overlooks structural constraints like entity types and positional cues, and (2) it lacks semantic expressiveness for fine-grained relation understanding. We propose Retrieval Over Classification (ROC), a novel framework that reformulates multimodal RE as a retrieval task driven by relation semantics. ROC integrates entity type and positional information through a multimodal encoder, expands relation labels into natural language descriptions using a large language model, and aligns entity-relation pairs via semantic similarity-based contrastive learning. Experiments show that our method achieves state-of-the-art performance on the benchmark datasets MNRE and MORE and exhibits stronger robustness and interpretability.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 198a353e-ed61-461f-8e7d-4f2dcf07fb49Builds on13
- InstructBLIP: Towards General-purpose Vision-Language Models with Instruction TuningWenliang Dai, Junnan Li, Dongxu Li, Anthony Meng Huat Tiong et al.NeurIPS 2023 · 4,013 citations
- Improving Multimodal Named Entity Recognition via Entity Span Detection with Unified Multimodal TransformerJianfei Yu, Jing Jiang, Li Yang, Rui XiaACL 2020 · 260 citations
- Joint Multimodal Entity-Relation Extraction Based on Edge-Enhanced Graph Alignment Network and Word-Pair Relation TaggingLi Yuan, Yi Cai, Jin Wang, Qing LiAAAI 2023 · 89 citations
- A Novel Global Feature-Oriented Relational Triple Extraction Model based on Table FillingFeiliang Ren, Longhui Zhang, Shujuan Yin, Xiaofeng Zhao et al.EMNLP 2021 · 71 citations
- Information Screening whilst Exploiting! Multimodal Relation Extraction with Feature Denoising and Multimodal Topic ModelingShengqiong Wu, Hao Fei, Yixin Cao, Lidong Bing et al.ACL 2023 · 60 citations
Related papers
- On the Role of Discriminative Models in Generative Relation ExtractionGuozheng Li, Peng Wang, Zijie Xu, Jing Zhou et al.ACL 2026
- Caption-Aware Multimodal Relation Extraction with Mutual Information MaximizationZefan Zhang, Weiqi Zhang, Yanhui Li, Tian BaiACM MM 2024 · 9 citations
- Query-based Instance Discrimination Network for Relational Triple ExtractionZeqi Tan, Yongliang Shen, Xuming Hu, Wenqi Zhang et al.EMNLP 2022 · 10 citations
- Learning from Context or Names? An Empirical Study on Neural Relation ExtractionHao Peng, Tianyu Gao, Xu Han, Yankai Lin et al.EMNLP 2020 · 185 citations
- Prototype-Guided Multimodal Relation Extraction based on Entity AttributesZefan Zhang, Weiqi Zhang, Yanhui Li, Tian BaiAAAI 2025 · 8 citations
