Unbiased Missing-Modality Multimodal Learning
Ruiting Dai, Chenxi Li, Yandong Yan, Lisi Mo, Ke Qin, Tao He
摘要
Recovering missing modalities in multimodal learning has recently been approached using diffusion models to synthesize absent data conditioned on available modalities. However, existing methods often suffer from modality generation bias: while certain modalities are generated with high fidelity, others-such as video-remain challenging due to intrinsic modality gaps, leading to imbalanced training. To address this issue, we propose MD 2 N (Multi-stage Duplex Diffusion Network), a novel framework for unbiased missing-modality recovery. MD 2 N introduces a modality transfer module within a duplex diffusion architecture, enabling bidirectional generation between available and missing modalities through three stages: (1) global structure generation, (2) modality transfer, and (3) local crossmodal refinement. By training with duplex diffusion, both available and missing modalities generate each other in an intersecting manner, effectively achieving a balanced generation state. Extensive experiments demonstrate that MD 2 N significantly outperforms existing state-of-the-art methods, achieving up to 4% improvement over IMDer on the CMU-MOSEI dataset. Project page: here.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- PriorDrive: Enhancing Online HD Mapping with Unified Vector PriorsShuang Zeng, Xinyuan Chang, Xinran Liu, Yujian Yuan 等AAAI 2026 · 被引用 12 次
- TiCAL: Typicality-Based Consistency-Aware Learning for Multimodal Emotion RecognitionWen Yin, Siyu Zhan, Cencen Liu, Xin Hu 等AAAI 2026 · 被引用 4 次
- SepPrune: Structured Pruning for Efficient Deep Speech SeparationYuqi Li, Kai Li, Xin Yin, Zhifei Yang 等AAAI 2026 · 被引用 4 次
- AnyMod-LLVE: Low-Light Video Enhancement with Modality-Agnostic InferenceHangfeng Liang, Yutao Hu, Yanhan Hu, Xiaohan Wu 等ICML 2026
- SPR: A Structured Prompt Refinement Network for Modality MissingHao Chen, Diwei Su, Zhuo Wang, Zuwang He 等ICML 2026
它引用的顶会 Paper18
- SDEdit: Guided Image Synthesis and Editing with Stochastic Differential EquationsChenlin Meng, Yutong He, Yang Song, Jiaming Song 等ICLR 2022 · 被引用 2,128 次
- Score-Based Generative Modeling through Stochastic Differential EquationsYang Song, Jascha Sohl-Dickstein, Diederik P. Kingma, Abhishek Kumar 等ICLR 2021 · 被引用 1,270 次
- SMIL: Multimodal Learning with Severely Missing ModalityMengmeng Ma, Jian Ren, Long Zhao, Sergey Tulyakov 等AAAI 2021 · 被引用 393 次
- A Diffusion-Based Framework for Multi-Class Anomaly DetectionHaoyang He, Jiangning Zhang, Hongxu Chen, Xuhai Chen 等AAAI 2024 · 被引用 231 次
- Incomplete Multimodality-Diffused Emotion RecognitionYuanzhi Wang, Yong Li, Zhen CuiNeurIPS 2023 · 被引用 155 次
相关 Paper
- Rethinking Diffusion Bridge Model with Dual Alignments for Medical Image SynthesisJinbao Wei, Yuhang Chen, Zhijie Wang, Gang Yang 等ACM MM 2025 · 被引用 3 次
- Distribution-Consistent Modal Recovering for Incomplete Multimodal LearningYuanzhi Wang, Zhen Cui, Yong LiICCV 2023 · 被引用 101 次
- MM-Align: Learning Optimal Transport-based Alignment Dynamics for Fast and Accurate Inference on Missing Modality SequencesWei Han, Hui Chen, Min-Yen Kan, Soujanya PoriaEMNLP 2022 · 被引用 13 次
- Incomplete Cross-modal Retrieval with Dual-Aligned Variational AutoencodersMengmeng Jing, Jingjing Li, Lei Zhu, Ke Lu 等ACM MM 2020 · 被引用 63 次
- MaskMentor: Unlocking the Potential of Masked Self-Teaching for Missing Modality RGB-D Semantic SegmentationZhida Zhao, Jia Li, Lijun Wang, Yifan Wang 等ACM MM 2024 · 被引用 1 次
