VisionST: Coordinating Cross-modal Traffic Prediction with Interactive Geo-image Encoding
Jinwen Chen, Hao Miao, Chenxi Liu, Yan Zhao, Kai Zheng
Abstract
Traffic prediction plays a pivotal role in contemporary web technologies, motivating various intelligent web services such as route planning and remote traffic management. Many recent proposals that target deep learning for traffic prediction solely leverage historical traffic observations to predict future ones. However, traffic prediction is always susceptible to different factors such as road networks and social events, exhibiting different modalities. Most existing methods focus on a single modality, failing to capture the comprehensive traffic patterns among various factors, resulting in sub-optimal performance. Web-sourced geo-images, e.g., satellite imagery, encompass comprehensive contextual information and offer an effective way to represent diverse modalities. To unleash the power of such geo-images, we propose VisionST, a Vision-augmented Spatial-Temporal Neural Network, which coordinates cross-modal traffic prediction with interactive geo-image encoding. To bolster resilience against highly intricate and overlapping traffic patterns, VisionST features a visual semantic extraction mechanism and a pattern-guided aggregation mechanism. The former extracts node-level visual tokens and node-to-node visual relation patterns from geo-referenced images. The latter generates relation patterns that encompass visual, spatial, and temporal aspects, constraining nodes to interact with these relation patterns for contextual information interaction. Extensive experiments on real large-scale datasets offer insight into the effectiveness of the proposed solutions, showing that VisionST consistently outperforms state-of-the-art baselines.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext bd9205d6-2e25-43c4-a225-bb95063be7a8Cited by top-tier papers1
Ask how each one uses itBuilds on24
- GMAN: A Graph Multi-Attention Network for Traffic PredictionChuanpan Zheng, Xiaoliang Fan, Cheng Wang, Jianzhong QiAAAI 2020 · 1,858 citations
- Spatial-Temporal Graph ODE Networks for Traffic Flow ForecastingZheng Fang, Qingqing Long, Guojie Song, Kunqing XieKDD 2021 · 555 citations
- Scaling Open-Vocabulary Object DetectionMatthias Minderer, Alexey A. Gritsenko, Neil HoulsbyNeurIPS 2023 · 482 citations
- Decoupled Dynamic Spatial-Temporal Graph Neural Network for Traffic ForecastingZezhi Shao, Zhao Zhang, Wei Wei, Fei Wang et al.VLDB 2022 · 353 citations
- When Spatio-Temporal Meet Wavelets: Disentangled Traffic Forecasting via Efficient Spectral Graph Attention NetworksYuchen Fang, Yanjun Qin, Haiyong Luo, Fang Zhao et al.ICDE 2023 · 134 citations
Related papers
- Traffic Flow Prediction via Spatial Temporal Graph Neural NetworkXiaoyang Wang, Yao Ma, Yiqi Wang, Wei Jin et al.WWW 2020 · 644 citations
- Unified Spatio-Temporal Tokens are Bases for Generalizable Traffic ForecastingYujun Chen, Shihao Tu, Wenyue Ding, Yicheng Lu et al.KDD 2026
- Spatial Transition Learning on Road Networks with Deep Probabilistic ModelsXiucheng Li, Gao Cong, Yun ChengICDE 2020 · 36 citations
- MoST: A Foundation Model for Multi-modality Spatio-temporal Traffic PredictionRonghui Xu, Jihao Chen, Jindong Tian, Chenjuan Guo et al.KDD 2026
- Multi-Source Information Driven Spatio-Temporal Hypergraph Learning for Traffic ForecastingPing Zhang, Jiayu Leng, Liang Yang, Anchen Li et al.WWW 2026
