DHCM-CACL: Dynamic Hierarchical Cross-modal Mamba with Confidence-Adaptive Contrastive Learning for Multimodal Emotion Recognition
Baiqiang Wu, Yang Li
摘要
Multimodal emotion recognition plays a crucial role in enhancing the intelligence of human-computer interaction and emotional understanding. However, conventional approaches face challenges such as scarcity of annotated data, significant modality heterogeneity, and temporal misalignment. To address these issues, we propose DHCM-CACL, a novel self-supervised emotion recognition framework integrating EEG and facial expressions. During the pre-training phase, we propose a Dynamic Hierarchical Cross-modal Mamba module (DHCM), which models long-term dependencies through dynamic state matrices, incorporates forgetting gates for noise suppression, and constructs a hierarchical cross-modal interaction structure, effectively achieving cross-modal temporal alignment and mitigating modality heterogeneity. Subsequently, we propose a Confidence-Adaptive Contrastive Learning module (CACL) that dynamically adjusts sample weights using gated confidence signals derived from DHCM to compute loss, prioritizing reliable samples while suppressing noisy instances through adaptive weighting, thereby enhancing representation reliability and generalization in data-scarce scenarios. During the fine-tuning phase, we integrate a cross-modal attention gating mechanism to reinforce temporal associations and adopt an evidence-aware joint optimization objective, providing probabilistic credibility outputs for emotion prediction. Experimental results on the DEAP and MAHNOB-HCI datasets demonstrate that our approach achieves state-of-the-art performance in emotion classification under both subject-dependent and subject-independent settings.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper11
- A Simple Framework for Contrastive Learning of Visual RepresentationsTing Chen, Simon Kornblith, Mohammad Norouzi, Geoffrey E. HintonICML 2020 · 被引用 24,064 次
- Efficiently Modeling Long Sequences with Structured State SpacesAlbert Gu, Karan Goel, Christopher RéICLR 2022 · 被引用 3,482 次
- Contrast Everything: A Hierarchical Contrastive Framework for Medical Time-SeriesYihe Wang, Yu Han, Haishuai Wang, Xiang ZhangNeurIPS 2023 · 被引用 106 次
- HetEmotionNet: Two-Stream Heterogeneous Graph Recurrent Neural Network for Multi-modal Emotion RecognitionZiyu Jia, Youfang Lin, Jing Wang, Zhiyang Feng 等ACM MM 2021 · 被引用 106 次
- Learning Modality-Specific and -Agnostic Representations for Asynchronous Multimodal Language SequencesDingkang Yang, Haopeng Kuang, Shuai Huang, Lihua ZhangACM MM 2022 · 被引用 64 次
相关 Paper
- EEG-SCMM: Soft Contrastive Masked Modeling for Cross-Corpus EEG-Based Emotion RecognitionQile Liu, Weishan Ye, Lingli Zhang, Zhen LiangACM MM 2025 · 被引用 1 次
- A Multimodal BiMamba Network with Test-Time Adaptation for Emotion Recognition Based on Physiological SignalsZiyu Jia, Tingyu Du, Zhengyu Tian, Hongkai Li 等NeurIPS 2025 · 被引用 5 次
- Toward Reliable Emotion Recognition: Alleviating Label Noise and Reducing Uncertain PredictionChengzhe Wang, Wenqing Ji, Chenyang Li, Tongjie Pan 等ACM MM 2025
- Multi-dataset Joint Pre-training of Emotional EEG Enables Generalizable Affective ComputingQingzhu Zhang, Jiani Zhong, Zongsheng Li, Xinke Shen 等NeurIPS 2025 · 被引用 4 次
- VBH-GNN: Variational Bayesian Heterogeneous Graph Neural Networks for Cross-subject Emotion RecognitionChenyu Liu, Xinliang Zhou, Zhengri Zhu, Liming Zhai 等ICLR 2024 · 被引用 25 次
