T-APT: Text-Guided Modality-Aware Prompt Tuning for Arbitrary Multimodal Remote Sensing Data Joint Classification
Qinghao Gao, Jiahui Qu, Wenqian Dong
摘要
Multimodal remote sensing image joint classification has achieved significant progress. However, existing methods primarily focus on designing modality-specific networks, lacking adaptive generalization capabilities in diverse and dynamic modality combinations encountered in real-world scenarios. Leveraging vision foundation models pretrained on large-scale natural image datasets with proven effectiveness in heterogeneous downstream tasks, we propose a unified Text-guided Arbitrary Modality Prompt Tuning (T-APT) framework, which leverages complementary fused features to drive the foundation model and employs text-guided modality-specific prior knowledge as cross-modal prompts to fine-tune a pretrained Vision Transformer (ViT) model. Specifically, a Mamba-Based Arbitrary Modal-Focused Feature Capture (MAMF-FC) module is designed to extract complementary joint features and modality-specific prior knowledge from arbitrary modalities through a shared-specific scanning encoder-decoder architecture. Subsequently, a Text-Guided Modality-Aware Prompt Tuning (TMPT) module is proposed to support the adaptation of fused features to the foundation model, enabling our arbitrary remote sensing image classification task. Extensive experiments on public datasets spanning multispectral (MS), hyperspectral (HS), light detection and ranging (LiDAR), and synthetic aperture radar (SAR) modalities demonstrate that our T-APT achieves classification performance comparable to specialized networks across arbitrary modal combinations. The code is available at https://github.com/Jiahuiqu/TAPT.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper5
- VMamba: Visual State Space ModelYue Liu, Yunjie Tian, Yuzhong Zhao, Hongtian Yu 等NeurIPS 2024 · 被引用 3,199 次
- P2P: Tuning Pre-trained Image Models for Point Cloud Analysis with Point-to-Pixel PromptingZiyi Wang, Xumin Yu, Yongming Rao, Jie Zhou 等NeurIPS 2022 · 被引用 121 次
- Instance-aware Dynamic Prompt Tuning for Pre-trained Point Cloud ModelsYaohua Zha, Jinpeng Wang, Tao Dai, Bin Chen 等ICCV 2023 · 被引用 84 次
- One-Prompt to Segment All Medical ImagesJunde Wu, Min XuCVPR 2024 · 被引用 32 次
- Bridging Remote Sensors with Multisensor Geospatial Foundation ModelsBoran Han, Shuai Zhang, Xingjian Shi, Markus ReichsteinCVPR 2024
相关 Paper
- CF-IPT: Cross-Modal Fusion Interactive Prompt Tuning of Vision-Language Pre-Trained Model for Multisource Remote Sensing Data ClassificationJinheng Ji, Jiahui Qu, Wenqian Dong, Yunsong LiCVPR 2026
- SkySense-VITA: Towards Universal In-context Segmentation of Multi-modal Remote Sensing ImageryKang Wu, Lei Yu, Junwei Luo, Bo Dang 等CVPR 2026 · 被引用 1 次
- Language-Guided Visual Prompt Compensation for Multi-Modal Remote Sensing Image Classification with Modality AbsenceLing Huang, Wenqian Dong, Song Xiao, Jiahui Qu 等ACM MM 2024 · 被引用 1 次
- Distribution-Aware Prompt Tuning for Vision-Language ModelsEulrang Cho, Jooyeon Kim, Hyunwoo J. KimICCV 2023 · 被引用 54 次
- SkySense V2: A Unified Foundation Model for Multi-Modal Remote SensingYingying Zhang, Lixiang Ru, Kang Wu, Lei Yu 等ICCV 2025 · 被引用 12 次
