Pi-CCA: Prompt-Invariant CCA Certificates for Replay-Free Continual Multimodal Learning
Jiayu Zhang, Chuangxin Zhao, Canran Xiao, Ruibo Duan, Wenyi Mo, Haoyu Gao, Wenshuo Wang
Abstract
When deployed on non-stationary data streams, foundation vision-language models require continual updates without access to past data. However, naive finetuning undermines their zero-shot recognition capabilities and prompt robustness. We seek a replay-free principle that preserves pre-trained cross-modal generalization under domain and prompt shifts. We introduce Prompt-Invariant CCA Certificates(PI-CCA), a geometry-first approach that summarizes image-text alignment with a compact certificate capturing the top-k canonical spectrum and subspace. During adaptation, we match this summary using only mini-batch statistics and induce prompt robustness via averaging over perturbations. Across MTIL, X-TAIL, VLCL, and ConStruct-VL, PI-CCA achieves state-of-the-art performance among replay-free methods. By optimizing alignment invariants rather than proxy signals, PI-CCA provides a simple, generator-free, constant-memory path to continual adaptation with strong zero-shot retention and resilience to prompt/style shifts.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 299909a5-90fd-4a21-8414-e0536eb3105aBuilds on33
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh et al.ICML 2021 · 47,906 citations
- LoRA: Low-Rank Adaptation of Large Language ModelsEdward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu et al.ICLR 2022 · 18,833 citations
- NDC-Scene: Boost Monocular 3D Semantic Scene Completion in Normalized Device Coordinates SpaceJiawei Yao, Chuming Li, Keqiang Sun, Yingjie Cai et al.ICCV 2023 · 150 citations
- Preventing Zero-Shot Transfer Degradation in Continual Learning of Vision-Language ModelsZangwei Zheng, Mingyuan Ma, Kai Wang, Ziheng Qin et al.ICCV 2023 · 133 citations
- Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts AdaptersJiazuo Yu, Yunzhi Zhuge, Lu Zhang, Ping Hu et al.CVPR 2024 · 80 citations
Related papers
- Subspace Alignment for CLIP-based Continual Learning via Canonical Correlation AnalysisHuan Zhang, Shuyu Dong, Yujin Zheng, Dingwen Wang et al.CVPR 2026
- CASPA: Graph-Structured Concept Anchors for Modality-Agnostic Adaptation in Vision-Language ModelsAbhiroop Chatterjee, Susmita Ghosh, Ashish Ghosh, Emmett J. IentilucciCVPR 2026
- Prompt-Anchored Vision-Text Distillation for Lifelong Person Re-identificationWen Wen, Hao Cheng, Shiliang ZhangCVPR 2026
- ECA: Efficient Continual Alignment for Open-Ended Image-to-Text GenerationJiangtao Kong, Peijun Zhao, Chun-Fu (Richard) Chen, Youngwook Do et al.ICML 2026
- Reversible Primitive-Composition Alignment for Continual Vision-Language LearningCanran Xiao, Tianxiang Xu, SiYuan Ma, Yiyang Jiang et al.ICLR 2026
