Scalable Medical Multimodal Fusion via Symmetric Consistency Modeling
Xiaowen Sun, Hui Liu, Gongguan Chen, Ning Mao
Abstract
Medical diagnosis tasks often rely on heterogeneous information from multiple sources, such as medical images and clinical text. Multimodal fusion is therefore essential for improving classification performance and robustness. However, most existing methods assume a fixed and known modality set, making them less effective when the number or composition of modalities changes. To address this limitation, we propose a modality-agnostic medical multimodal fusion framework that can naturally accommodate an arbitrary number of input modalities. At the coarse-grained modality level, we represent each modality’s estimation of latent semantics as an uncertainty-aware probability distribution, and impose symmetric consistency constraints to achieve global cross-modal semantic alignment. At the fine-grained token level, we further design a token-level consistency constraint based on linear reconstruction. This constraint enables structured mutual verification of local semantics across modalities. Finally, for multimodal fusion, we adopt a multi-view consistency strategy to obtain a unified representation for diagnosis prediction. In particular, each modality is sequentially treated as a conditional view to suppress noise in the remaining modalities and extract shared semantics. Extensive experiments on five public and self-constructed multimodal medical datasets demonstrate the effectiveness and scalability of the proposed approach. Code is available at https://github.com/gjhgjbkg/SMMF.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Builds on9
- Multi-Granularity Cross-modal Alignment for Generalized Medical Visual Representation LearningFuying Wang, Yuyin Zhou, Shujun Wang, Varut Vardhanabhuti et al.NeurIPS 2022 · 302 citations
- Heterogeneous Graph Learning for Multi-Modal Medical Data AnalysisSein Kim, Namkyeong Lee, Junseok Lee, Dongmin Hyun et al.AAAI 2023 · 54 citations
- Towards Unifying Medical Vision-and-Language Pre-training via Soft PromptsZhihong Chen, Shizhe Diao, Benyou Wang, Guanbin Li et al.ICCV 2023 · 50 citations
- DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation LearningChengxuan Qian, Shuo Xing, Li Li, Yue Zhao et al.ICLR 2026 · 42 citations
- Decomposing Disease Descriptions for Enhanced Pathology Detection: A Multi-Aspect Vision-Language Pre-Training FrameworkVu Minh Hieu Phan, Yutong Xie, Yuankai Qi, Lingqiao Liu et al.CVPR 2024 · 17 citations
Related papers
- MedM2G: Unifying Medical Multi-Modal Generation via Cross-Guided Diffusion with Visual InvariantChenlu Zhan, Yu Lin, Gaoang Wang, Hongwei Wang et al.CVPR 2024 · 20 citations
- Multimodal Lego: Model Merging and Fine-Tuning Across Topologies and Modalities in BiomedicineKonstantin Hemker, Nikola Simidjievski, Mateja JamnikICLR 2025
- DrFuse: Learning Disentangled Representation for Clinical Multi-Modal Fusion with Missing Modality and Modal InconsistencyWenfang Yao, Kejing Yin, William K. Cheung, Jia Liu et al.AAAI 2024 · 80 citations
- RAD: Towards Trustworthy Retrieval-Augmented Multi-modal Clinical DiagnosisHaolin Li, Tianjie Dai, Zhe Chen, Siyuan Du et al.NeurIPS 2025 · 3 citations
- OmniFM: Toward Modality-Robust and Task-Agnostic Federated Learning for Heterogeneous Medical ImagingMeilin Liu, Jiaying Wang, Jing ShanCVPR 2026 · 1 citation
