Scalable Medical Multimodal Fusion via Symmetric Consistency Modeling
Xiaowen Sun, Hui Liu, Gongguan Chen, Ning Mao
摘要
Medical diagnosis tasks often rely on heterogeneous information from multiple sources, such as medical images and clinical text. Multimodal fusion is therefore essential for improving classification performance and robustness. However, most existing methods assume a fixed and known modality set, making them less effective when the number or composition of modalities changes. To address this limitation, we propose a modality-agnostic medical multimodal fusion framework that can naturally accommodate an arbitrary number of input modalities. At the coarse-grained modality level, we represent each modality’s estimation of latent semantics as an uncertainty-aware probability distribution, and impose symmetric consistency constraints to achieve global cross-modal semantic alignment. At the fine-grained token level, we further design a token-level consistency constraint based on linear reconstruction. This constraint enables structured mutual verification of local semantics across modalities. Finally, for multimodal fusion, we adopt a multi-view consistency strategy to obtain a unified representation for diagnosis prediction. In particular, each modality is sequentially treated as a conditional view to suppress noise in the remaining modalities and extract shared semantics. Extensive experiments on five public and self-constructed multimodal medical datasets demonstrate the effectiveness and scalability of the proposed approach. Code is available at https://github.com/gjhgjbkg/SMMF.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper9
- Multi-Granularity Cross-modal Alignment for Generalized Medical Visual Representation LearningFuying Wang, Yuyin Zhou, Shujun Wang, Varut Vardhanabhuti 等NeurIPS 2022 · 被引用 302 次
- Heterogeneous Graph Learning for Multi-Modal Medical Data AnalysisSein Kim, Namkyeong Lee, Junseok Lee, Dongmin Hyun 等AAAI 2023 · 被引用 54 次
- Towards Unifying Medical Vision-and-Language Pre-training via Soft PromptsZhihong Chen, Shizhe Diao, Benyou Wang, Guanbin Li 等ICCV 2023 · 被引用 50 次
- DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation LearningChengxuan Qian, Shuo Xing, Li Li, Yue Zhao 等ICLR 2026 · 被引用 42 次
- Decomposing Disease Descriptions for Enhanced Pathology Detection: A Multi-Aspect Vision-Language Pre-Training FrameworkVu Minh Hieu Phan, Yutong Xie, Yuankai Qi, Lingqiao Liu 等CVPR 2024 · 被引用 17 次
相关 Paper
- MedM2G: Unifying Medical Multi-Modal Generation via Cross-Guided Diffusion with Visual InvariantChenlu Zhan, Yu Lin, Gaoang Wang, Hongwei Wang 等CVPR 2024 · 被引用 20 次
- Multimodal Lego: Model Merging and Fine-Tuning Across Topologies and Modalities in BiomedicineKonstantin Hemker, Nikola Simidjievski, Mateja JamnikICLR 2025
- DrFuse: Learning Disentangled Representation for Clinical Multi-Modal Fusion with Missing Modality and Modal InconsistencyWenfang Yao, Kejing Yin, William K. Cheung, Jia Liu 等AAAI 2024 · 被引用 80 次
- RAD: Towards Trustworthy Retrieval-Augmented Multi-modal Clinical DiagnosisHaolin Li, Tianjie Dai, Zhe Chen, Siyuan Du 等NeurIPS 2025 · 被引用 3 次
- OmniFM: Toward Modality-Robust and Task-Agnostic Federated Learning for Heterogeneous Medical ImagingMeilin Liu, Jiaying Wang, Jing ShanCVPR 2026 · 被引用 1 次
