Efficient Modality Translation via Arbitrary Conditioning and Wasserstein Regularization
Tomás Tokár, Scott Sanner
摘要
The central challenge in multimodal generative modeling lies in accurately approximating the joint data distribution, even when some modalities are missing. Existing multimodal VAEs solve this by designing increasingly complex encoding architectures, relying on modality-specific encoders, factorized posteriors, and custom inference procedures. This restricts their ability to capture relations among modalities by amortizing the encoding parameters. We challenge this paradigm by introducing a model trained for arbitrary conditioning, i.e., generating any modality given a subset of observed modalities and a logical index indicating which modalities are present or missing. This enables a single unified encoder to handle any subset of modalities while capturing inter-modal relationships via a compact, shared posterior. We find that to work efficiently in the multimodal setup, arbitrary conditioning requires replacing the KL divergence with Wasserstein regularization, which allows more dispersed latent embeddings to support learning over diverse data and modality subsets. This key insight exposes a critical deficiency in existing methods, which rely on KL regularization that tends to concentrate individual embeddings near the standard Gaussian prior, despite coming from very diverse subsets of multimodal inputs. We prove that Wasserstein regularization ensures that the aggregate latent distribution -spanning all conditioning subsets -aligns with the prior without requiring mixture models or auxiliary inference tricks. Empirically, the proposed model improves cross-modal generation and yields better reconstructions than state-of-the-art multimodal VAEs.
- of multimodal data to facilitate downstream supervised tasks (Guo, Wang, and Wang 2019), while simultaneously to accurately approximate the data distribution to support generative tasks (Suzuki and Matsuo 2022).
To meet this dual goal, considerable attention has been paid to multimodal adaptations of variational autoencoders (VAEs) (Kingma and Welling 2014). Current multimodal VAEs use architectural designs that allow them to encode any subset of modalities into a shared posterior distribution,
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper8
- Generalized Multimodal ELBOThomas M. Sutter, Imant Daunhawer, Julia E. VogtICLR 2021 · 被引用 130 次
- VAEM: a Deep Generative Model for Heterogeneous Mixed Type DataChao Ma, Sebastian Tschiatschek, Richard E. Turner, José Miguel Hernández-Lobato 等NeurIPS 2020 · 被引用 105 次
- Multi-View Representation Learning via Total Correlation ObjectiveHyeongJoo Hwang, Geon-Hyeong Kim, Seunghoon Hong, Kee-Eung KimNeurIPS 2021 · 被引用 63 次
- Mitigating Modality Collapse in Multimodal VAEs via Impartial OptimizationAdrián Javaloy, Maryam Meghdadi, Isabel ValeraICML 2022 · 被引用 49 次
- Arbitrary Conditional Distributions with EnergyRyan R. Strauss, Junier B. OlivaNeurIPS 2021 · 被引用 28 次
相关 Paper
- Unity by Diversity: Improved Representation Learning for Multimodal VAEsThomas M. Sutter, Yang Meng, Andrea Agostini, Daphné Chopard 等NeurIPS 2024 · 被引用 21 次
- Multimodal Variational Autoencoder: A Barycentric ViewPeijie Qiu, Wenhui Zhu, Sayantan Kumar, Xiwen Chen 等AAAI 2025 · 被引用 2 次
- Multimodal Gaussian Mixture Variational Autoencoder with Consistency RegularizationsYarui Chen, Lehan Hong, Jianlin Shao, Jianning Yang 等AAAI 2026
- Posterior Matching for Arbitrary ConditioningRyan R. Strauss, Junier B. OlivaNeurIPS 2022 · 被引用 7 次
- On the Limitations of Multimodal VAEsImant Daunhawer, Thomas M. Sutter, Kieran Chin-Cheong, Emanuele Palumbo 等ICLR 2022 · 被引用 50 次
