UrbanExpert: Task-Conditioned Multi-Modal Fusion via Semantic Expert Routing for Urban Socioeconomic Prediction
Zechen Li, Hongwei Jia, Weiming Huang, Kai Zhao, Meng Chen
Abstract
Predicting urban indicators from multi-modal sensing data requires fusing heterogeneous modalities, yet different prediction tasks rely on different feature combinations while semantically related tasks share common cues. Existing approaches either train task-specific models that cannot share knowledge across tasks, or learn a single task-agnostic representation that ignores inter-task semantic correlations. Both paradigms also assume complete modality observations, which rarely holds in practice. We propose UrbanExpert, a multi-task framework that explicitly conditions multi-modal fusion on task semantics while accommodating incomplete modality observations. UrbanExpert first encodes each available modality into a shared token sequence via pretrained encoders, and recovers missing modality representations through a cross-modal reconstruction module to handle incomplete observations. A task-conditioned Mixture-of-Experts module then routes each task to a relevant subset of experts based on the semantic affinity between the task description and learnable expert prototypes, producing task-conditioned region embeddings. Task-specific prediction heads map the embeddings to target indicators, and the model is jointly optimized with prediction, reconstruction, and routing regularization objectives. Experiments on two real-world urban datasets show that UrbanExpert consistently outperforms both single-task and multi-task baselines, and that the learned routing structure generalizes effectively to unseen tasks and cities.
Ask about this paper
Ask your agent about it.
Lune has read the top-tier papers around this one, so every answer names the papers it rests on.
Your agent calls
Lunesearch_papers
Free to start. No credit card required.
Terminal
Install the CLIlune papers get c868d6ec-324a-409d-9865-18b31ca32fa7Related papers
- Taming Cascaded Mixture-of-Experts for Modality-missing Multi-modal Salient Object DetectionKunpeng Wang, Feifan Sun, Keke ChenAAAI 2026
- UrbanMoE: A Sparse Multi-Modal Mixture-of-Experts Framework for Multi-Task Urban Region ProfilingPingping Liu, Jiamiao Liu, Zijian Zhang, Hao Miao et al.WWW 2026
- Multimodal Emotion Recognition with Missing Modality via a Unified Multi-task Pre-training FrameworkZiyi Li, Wei-Long Zheng, Bao-Liang LuACM MM 2025 · 2 citations
- UrbanFusion: Stochastic Multimodal Fusion for Contrastive Learning of Robust Spatial RepresentationsDominik J. Mühlematter, Lin Che, Ye Hong, Martin Raubal et al.ICML 2026
- MCMoE: Completing Missing Modalities with Mixture of Experts for Incomplete Multimodal Action Quality AssessmentHuangbiao Xu, Huanqi Wu, Xiao Ke, Junyi Wu et al.AAAI 2026 · 2 citations
