UrbanExpert: Task-Conditioned Multi-Modal Fusion via Semantic Expert Routing for Urban Socioeconomic Prediction
Zechen Li, Hongwei Jia, Weiming Huang, Kai Zhao, Meng Chen
摘要
Predicting urban indicators from multi-modal sensing data requires fusing heterogeneous modalities, yet different prediction tasks rely on different feature combinations while semantically related tasks share common cues. Existing approaches either train task-specific models that cannot share knowledge across tasks, or learn a single task-agnostic representation that ignores inter-task semantic correlations. Both paradigms also assume complete modality observations, which rarely holds in practice. We propose UrbanExpert, a multi-task framework that explicitly conditions multi-modal fusion on task semantics while accommodating incomplete modality observations. UrbanExpert first encodes each available modality into a shared token sequence via pretrained encoders, and recovers missing modality representations through a cross-modal reconstruction module to handle incomplete observations. A task-conditioned Mixture-of-Experts module then routes each task to a relevant subset of experts based on the semantic affinity between the task description and learnable expert prototypes, producing task-conditioned region embeddings. Task-specific prediction heads map the embeddings to target indicators, and the model is jointly optimized with prediction, reconstruction, and routing regularization objectives. Experiments on two real-world urban datasets show that UrbanExpert consistently outperforms both single-task and multi-task baselines, and that the learned routing structure generalizes effectively to unseen tasks and cities.
问问这篇 Paper
问问你的智能体。
Lune 读过与它相关的顶会 Paper,每个回答都会注明依据哪几篇。
相关 Paper
- Taming Cascaded Mixture-of-Experts for Modality-missing Multi-modal Salient Object DetectionKunpeng Wang, Feifan Sun, Keke ChenAAAI 2026
- UrbanMoE: A Sparse Multi-Modal Mixture-of-Experts Framework for Multi-Task Urban Region ProfilingPingping Liu, Jiamiao Liu, Zijian Zhang, Hao Miao 等WWW 2026
- Multimodal Emotion Recognition with Missing Modality via a Unified Multi-task Pre-training FrameworkZiyi Li, Wei-Long Zheng, Bao-Liang LuACM MM 2025 · 被引用 2 次
- UrbanFusion: Stochastic Multimodal Fusion for Contrastive Learning of Robust Spatial RepresentationsDominik J. Mühlematter, Lin Che, Ye Hong, Martin Raubal 等ICML 2026
- MCMoE: Completing Missing Modalities with Mixture of Experts for Incomplete Multimodal Action Quality AssessmentHuangbiao Xu, Huanqi Wu, Xiao Ke, Junyi Wu 等AAAI 2026 · 被引用 2 次
