Convolution Meets LoRA: Parameter Efficient Finetuning for Segment Anything Model
Zihan Zhong, Zhiqiang Tang, Tong He, Haoyang Fang, Chun Yuan
摘要
The Segment Anything Model (SAM) stands as a foundational framework for image segmentation. While it exhibits remarkable zero-shot generalization in typical scenarios, its advantage diminishes when applied to specialized domains like medical imagery and remote sensing. To address this limitation, this paper introduces Conv-LoRA, a simple yet effective parameter-efficient fine-tuning approach. By integrating ultra-lightweight convolutional parameters into Low-Rank Adaptation (LoRA), Conv-LoRA can inject image-related inductive biases into the plain ViT encoder, further reinforcing SAM's local prior assumption. Notably, Conv-LoRA not only preserves SAM's extensive segmentation knowledge but also revives its capacity of learning high-level image semantics, which is constrained by SAM's foreground-background segmentation pretraining. Comprehensive experimentation across diverse benchmarks spanning multiple domains underscores Conv-LoRA's superiority in adapting SAM to real-world semantic segmentation tasks. 1
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper35
- DICEPTION: A Generalist Diffusion Model for Visual Perceptual TasksCanyu Zhao, Yanlong Sun, Mingyu Liu, Huanyi Zheng 等NeurIPS 2025 · 被引用 45 次
- AuroRA: Breaking Low-Rank Bottleneck of LoRA with Nonlinear MappingHaonan Dong, Wenhao Zhu, Guojie Song, Liang WangNeurIPS 2025 · 被引用 31 次
- MLZero: A Multi-Agent System for End-to-end Machine Learning AutomationHaoyang Fang, Boran Han, Nick Erickson, Xiyuan Zhang 等NeurIPS 2025 · 被引用 29 次
- FlexEvent: Towards Flexible Event-Frame Object Detection at Varying Operational FrequenciesDongyue Lu, Lingdong Kong, Gim Hee Lee, Camille Simon Chane 等NeurIPS 2025 · 被引用 13 次
- Bilevel Layer-Positioning LoRA for Real Image DehazingYan Zhang, Long Ma, Yuxin Feng, Zhe Huang 等CVPR 2026 · 被引用 13 次
它引用的顶会 Paper31
- Learning Transferable Visual Models From Natural Language SupervisionAlec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh 等ICML 2021 · 被引用 47,906 次
- Swin Transformer: Hierarchical Vision Transformer using Shifted WindowsZe Liu, Yutong Lin, Yue Cao, Han Hu 等ICCV 2021 · 被引用 31,683 次
- An Image is Worth 16x16 Words: Transformers for Image Recognition at ScaleAlexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn 等ICLR 2021 · 被引用 21,477 次
- SegFormer: Simple and Efficient Design for Semantic Segmentation with TransformersEnze Xie, Wenhai Wang, Zhiding Yu, Anima Anandkumar 等NeurIPS 2021 · 被引用 9,661 次
- Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction without ConvolutionsWenhai Wang, Enze Xie, Xiang Li, Deng-Ping Fan 等ICCV 2021 · 被引用 4,909 次
相关 Paper
- Improving the Generalization of Segmentation Foundation Model under Distribution Shift via Weakly Supervised AdaptationHaojie Zhang, Yongyi Su, Xun Xu, Kui JiaCVPR 2024 · 被引用 26 次
- SAMora: Enhancing SAM through Hierarchical Self-Supervised Pre-Training for Medical ImagesShuhang Chen, Hangjie Yuan, Pengwei Liu, Hanxue Gu 等ICCV 2025 · 被引用 1 次
- Correlated Low-Rank Adaptation for ConvNetsWu Ran, Weijia Zhang, Shuyang Pang, Qi Zhu 等NeurIPS 2025 · 被引用 5 次
- Parameter-Free Fine-tuning via Redundancy Elimination for Vision Foundation ModelsJiahuan Long, Tingsong Jiang, Wen Yao, Yizhe Xiong 等AAAI 2026
- ConsNoTrainLoRA: Data-driven Weight Initialization of Low-Rank Adapters Using ConstraintsDebasmit Das, Hyoungwoo Park, Munawar Hayat, Seokeon Choi 等ICCV 2025 · 被引用 1 次
