Asymmetric Reinforcing Against Multi-Modal Representation Bias
Xiyuan Gao, Bing Cao, Pengfei Zhu, Nannan Wang, Qinghua Hu
摘要
The strength of multimodal learning lies in its ability to integrate information from various sources, providing rich and comprehensive insights. However, in real-world scenarios, multi-modal systems often face the challenge of dynamic modality contributions, the dominance of different modalities may change with the environments, leading to suboptimal performance in multimodal learning. Current methods mainly enhance weak modalities to balance multimodal representation bias, which inevitably optimizes from a partialmodality perspective, easily leading to performance descending for dominant modalities. To address this problem, we propose an Asymmetric Reinforcing method against Multimodal representation bias (ARM). Our ARM dynamically reinforces the weak modalities while maintaining the ability to represent dominant modalities through conditional mutual information. Moreover, we provide an in-depth analysis that optimizing certain modalities could cause information loss and prevent leveraging the full advantages of multimodal data. By exploring the dominance and narrowing the contribution gaps between modalities, we have significantly improved the performance of multimodal learning, making notable progress in mitigating imbalanced multimodal learning. Our code is available at https://github.com/Gao-xiyuan/ARM .
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- Multimodal Negative LearningBaoquan Gong, Xiyuan Gao, Pengfei Zhu, Qinghua Hu 等NeurIPS 2025 · 被引用 4 次
- From Dialogue to Destination: Geography-Aware Large Language Models with Multimodal Fusion for Conversational RecommendationYeming Li, Chenxi Liu, Jie Zou, Cheng Long 等AAAI 2026 · 被引用 3 次
- DPDV: Dual-Pathway and Dual-View Representation Learning for Bridging Information Asymmetry in Text-Video RetrievalZequn Xie, Xin Liu, Fangming Feng, Boyun Zhang 等ACL 2026
- Reconcile Gradient Modulation for Harmony Multimodal LearningXiyuan Gao, Bing Cao, Baoquan Gong, Pengfei ZhuAAAI 2026
- Anchor-Guided Gradient Alignment for Incomplete Multimodal LearningZhi-Hao Guan, Longfei Huang, Yang YangCVPR 2026
它引用的顶会 Paper19
- MM-Vet: Evaluating Large Multimodal Models for Integrated CapabilitiesWeihao Yu, Zhengyuan Yang, Linjie Li, Jianfeng Wang 等ICML 2024 · 被引用 1,191 次
- Learning Relationships between Text, Audio, and Video via Deep Canonical Correlation for Multimodal Language AnalysisZhongkai Sun, Prathusha Kameswara Sarma, William A. Sethares, Yingyu LiangAAAI 2020 · 被引用 419 次
- Balanced Multimodal Learning via On-the-fly Gradient ModulationXiaokang Peng, Yake Wei, Andong Deng, Dong Wang 等CVPR 2022 · 被引用 264 次
- Modality Competition: What Makes Joint Training of Multi-modal Network Fail in Deep Learning? (Provably)Yu Huang, Junyang Lin, Chang Zhou, Hongxia Yang 等ICML 2022 · 被引用 168 次
- Provable Dynamic Fusion for Low-Quality Multimodal DataQingyang Zhang, Haitao Wu, Changqing Zhang, Qinghua Hu 等ICML 2023 · 被引用 143 次
相关 Paper
- Improving Multimodal Learning via Imbalanced LearningShicai Wei, Chunbo Luo, Yang LuoICCV 2025 · 被引用 7 次
- Rethinking Multimodal Learning from the Perspective of Mitigating Classification Ability DisproportionQing-Yuan Jiang, Longfei Huang, Yang YangNeurIPS 2025 · 被引用 15 次
- Adaptive Re-calibration Learning for Balanced Multimodal Intention RecognitionQu Yang, Xiyang Li, Fu Lin, Mang YeNeurIPS 2025 · 被引用 2 次
- ERL-MR: Harnessing the Power of Euler Feature Representations for Balanced Multi-modal LearningWeixiang Han, Chengjun Cai, Yu Guo, Jialiang PengACM MM 2024
- Multimodal Representation Learning by Alternating Unimodal AdaptationXiaohui Zhang, Jaehong Yoon, Mohit Bansal, Huaxiu YaoCVPR 2024
