ECERC: Evidence-Cause Attention Network for Multi-Modal Emotion Recognition in Conversation
Tao Zhang, Zhenhua Tan
Abstract
Multi-modal Emotion Recognition in Conversation (MMERC) aims to identify speakers' emotional states using multi-modal conversational data, significant for various domains. MMERC requires addressing emotional causes: contextual factors that influence emotions, alongside emotional evidence directly expressed in the target utterance. Existing methods primarily model general conversational dependencies, such as sequential utterance relationships or inter-speaker dynamics, but fall short in capturing diverse and detailed emotional causes, including emotional contagion, influences from others, and self-referenced or externally introduced events. To address these limitations, we propose the Evidence-Cause Attention Network for Multi-Modal Emotion Recognition in Conversation (ECERC). ECERC integrates emotional evidence with contextual causes through five stages: Evidence Gating extracts and refines emotional evidence across modalities; Cause Encoding captures causes from conversational context; Evidence-Cause Interaction uses attention to integrate evidence with diverse causes, generating rich candidate features for emotion inference; Feature Gating adaptively weights contributions of candidate features; and Emotion Classification classifies emotions. We evaluate ECERC on two widely used benchmark datasets, IEMOCAP and MELD. Experimental results show that ECERC achieves competitive performance in weighted F1-score and accuracy, demonstrating its effectiveness in MMERC 1 .
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Cited by top-tier papers3
- Enhance-then-Balance Modality Collaboration for Robust Multimodal Sentiment AnalysisKang He, Yuzhe Ding, Xinrong Wang, Fei Li et al.CVPR 2026 · 1 citation
- Emotion-Wheel-Guided Audio-Referred Text Representation for Multimodal Emotion Recognition in ConversationEunseon Seong, Harim Lee, Dahye Kim, Changhyun Kim et al.ACL 2026
- ERCThinker: Fast-Slow Thinking for Emotion Recognition in ConversationYumeng Fu, Weitao Huang, Junjie Wu, Hao Teng et al.ACL 2026
Builds on9
- UniMSE: Towards Unified Multimodal Sentiment Analysis and Emotion RecognitionGuimin Hu, Ting-En Lin, Yi Zhao, Guangming Lu et al.EMNLP 2022 · 206 citations
- MISC: A Mixed Strategy-Aware Model integrating COMET for Emotional Support ConversationQuan Tu, Yanran Li, Jianwei Cui, Bin Wang et al.ACL 2022 · 141 citations
- MultiEMO: An Attention-Based Correlation-Aware Multimodal Fusion Framework for Emotion Recognition in ConversationsTao Shi, Shao-Lun HuangACL 2023 · 76 citations
- Multimodal Fusion via Hypergraph Autoencoder and Contrastive Learning for Emotion Recognition in ConversationZijian Yi, Ziming Zhao, Zhishu Shen, Tiehua ZhangACM MM 2024 · 32 citations
- What If Bots Feel Moods?Lisong Qiu, Yingwai Shiu, Pingping Lin, Ruihua Song et al.SIGIR 2020 · 17 citations
Related papers
- MMGCN: Multimodal Fusion via Deep Graph Convolution Network for Emotion Recognition in ConversationJingwen Hu, Yuchen Liu, Jinming Zhao, Qin JinACL 2021
- Causal-ERC: A Multimodal Framework with Causal Prompting for Emotion Recognition in Conversations with Large Language ModelsRan Jing, Geng Tu, Yice Zhang, Ruifeng XuAAAI 2026
- A Cross-Modality Context Fusion and Semantic Refinement Network for Emotion Recognition in ConversationXiaoheng Zhang, Yang LiACL 2023 · 47 citations
- Observe before Generate: Emotion-Cause aware Video Caption for Multimodal Emotion Cause Generation in ConversationsFanfan Wang, Heqing Ma, Xiangqing Shen, Jianfei Yu et al.ACM MM 2024 · 6 citations
- Beyond Missing Modalities: Hypergraph Conditioned Diffusion for Uncertainty-Aware Multimodal Emotion RecognitionXihang Qiu, Yuhao Fang, Qing Zhou, Bin Zhai et al.CVPR 2026
