Mutual-Enhanced Incongruity Learning Network for Multi-Modal Sarcasm Detection
Yang Qiao, Liqiang Jing, Xuemeng Song, Xiaolin Chen, Lei Zhu, Liqiang Nie
Abstract
Sarcasm is a sophisticated linguistic phenomenon that is prevalent on today's social media platforms. Multi-modal sarcasm detection aims to identify whether a given sample with multi-modal information (i.e., text and image) is sarcastic. This task's key lies in capturing both inter- and intra-modal incongruities within the same context. Although existing methods have achieved compelling success, they are disturbed by irrelevant information extracted from the whole image and text, or overlooking some important information due to the incomplete input. To address these limitations, we propose a Mutual-enhanced Incongruity Learning Network for multi-modal sarcasm detection, named MILNet. In particular, we design a local semantic-guided incongruity learning module and a global incongruity learning module. Moreover, we introduce a mutual enhancement module to take advantage of the underlying consistency between the two modules to boost the performance. Extensive experiments on a widely-used dataset demonstrate the superiority of our model over cutting-edge methods.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Cited by top-tier papers6
- Debiasing Multimodal Sarcasm Detection with Contrastive LearningMengzhao Jia, Can Xie, Liqiang JingAAAI 2024 · 51 citations
- G^2SAM: Graph-Based Global Semantic Awareness Method for Multimodal Sarcasm DetectionYiwei Wei, Shaozu Yuan, Hengyang Zhou, Longbiao Wang et al.AAAI 2024 · 30 citations
- Multi-source Semantic Graph-based Multimodal Sarcasm Explanation GenerationLiqiang Jing, Xuemeng Song, Kun Ouyang, Mengzhao Jia et al.ACL 2023 · 17 citations
- Defeasible Visual Entailment: Benchmark, Evaluator, and Reward-Driven OptimizationYue Zhang, Liqiang Jing, Vibhav GogateAAAI 2025 · 13 citations
- MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm DetectionHaochen Zhao, Yuyao Kong, Yongxiu Xu, Gaopeng Gou et al.CVPR 2026 · 4 citations
Builds on8
- Reasoning with Multimodal Sarcastic Tweets via Modeling Cross-Modality Contrast and Semantic AssociationNan Xu, Zhixiong Zeng, Wenji MaoACL 2020 · 153 citations
- Multi-Modal Sarcasm Detection via Cross-Modal Graph Convolutional NetworkBin Liang, Chenwei Lou, Xiang Li, Min Yang et al.ACL 2022 · 151 citations
- Multi-Modal Sarcasm Detection with Interactive In-Modal and Cross-Modal GraphsBin Liang, Chenwei Lou, Xiang Li, Lin Gui et al.ACM MM 2021 · 128 citations
- Block Modeling-Guided Graph Convolutional Neural NetworksDongxiao He, Chundong Liang, Huixin Liu, Mingxiang Wen et al.AAAI 2022 · 85 citations
- Comprehensive Linguistic-Visual Composition Network for Image RetrievalHaokun Wen, Xuemeng Song, Xin Yang, Yibing Zhan et al.SIGIR 2021 · 72 citations
Related papers
- Towards Multi-Modal Sarcasm Detection via Hierarchical Congruity Modeling with Knowledge EnhancementHui Liu, Wenya Wang, Haoliang LiEMNLP 2022 · 91 citations
- Incongruity-aware Tension Field Network for Multi-modal Sarcasm DetectionJiecheng Zhang, C. L. Philip Chen, Shuzhen Li, Tong ZhangACL 2025 · 2 citations
- DIP: Dual Incongruity Perceiving Network for Sarcasm DetectionChangsong Wen, Guoli Jia, Jufeng YangCVPR 2023
- Sentiment-oriented Sarcasm Integration for Video Sentiment Analysis Enhancement with Sarcasm AssistanceJunlin Fang, Wenya Wang, Guosheng Lin, Fengmao LvACM MM 2024 · 4 citations
- Multimodal Sarcasm Target Identification in TweetsJiquan Wang, Lin Sun, Yi Liu, Meizhi Shao et al.ACL 2022 · 28 citations
