FDPT: Federated Discrete Prompt Tuning for Black-Box Visual-Language Models
Jiaqi Wu, Simin Chen, Jing Tang, Yuzhe Yang, Yiming Chen, Lixu Wang, Song Lin, Zehua Wang, Wei Chen, Zijian Tian
Abstract
Vision-Language Models (VLMs) have driven significant advancements in multimodal AI. Fine-tuning these models with user data enhances adaptability but poses privacy risks. While federated learning (FL) mitigates user data privacy concerns, it fails to protect model properties. Existing methods relying on black-box VLM APIs often require access to prediction logits, making them vulnerable to inversion attacks. Additionally, optimizing tuning complexity and data transmission efficiency in federated VLM scenarios remains a challenge. To address these challenges, we propose FDPT-the first federated discrete prompt tuning method utilizing black-box VLMs. During client optimization stage, FDPT employs an agent-driven framework leveraging large language models (LLMs) with enhanced reasoning capacities to systematically optimize discrete prompt representations, and also utilizes feedback mechanisms and chain of thought to enhance prediction accuracy. Importantly, it performs optimization by relying not on the predicted logic vectors output by LLMs but on textual results, avoiding reverse attack risks. During global aggregation stage, We mimic human electoral activities by employing evolutionary computation methods underpinned by semantic similarity computation to implement enhanced zero-order optimization for acquiring representative global tokens, thereby achieving knowledge aggregation. FDPT significantly outperforms nine state-of-the-art methods in image classification and visual question-answering, reducing communication overhead while generating highly transferable optimized prompts. Additionally, it exhibits im- † Equal contribution * Corresponding author proved robustness to data heterogeneity.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext ebd9d629-01b9-4e60-bb99-9d4a78ebda73Builds on24
- Flamingo: a Visual Language Model for Few-Shot LearningJean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech et al.NeurIPS 2022 · 6,707 citations
- Federated Learning on Non-IID Data Silos: An Experimental StudyQinbin Li, Yiqun Diao, Quan Chen, Bingsheng HeICDE 2022 · 1,110 citations
- Addressing Class Imbalance in Federated LearningLixu Wang, Shichao Xu, Xiao Wang, Qi ZhuAAAI 2021 · 314 citations
- MMMU: A Massive Multi-Discipline Multimodal Understanding and Reasoning Benchmark for Expert AGIXiang Yue, Yuansheng Ni, Tianyu Zheng, Kai Zhang et al.CVPR 2024 · 213 citations
- Robust Federated Learning with Noisy and Heterogeneous ClientsXiuwen Fang, Mang YeCVPR 2022 · 169 citations
Related papers
- FedBPT: Efficient Federated Black-box Prompt Tuning for Large Language ModelsJingwei Sun, Ziyue Xu, Hongxu Yin, Dong Yang et al.ICML 2024 · 38 citations
- FedAPT: Federated Adversarial Prompt Tuning for Vision-Language ModelsKun Zhai, Siheng Chen, Xingjun Ma, Yu-Gang JiangACM MM 2025
- FedOne: Query-Efficient Federated Learning for Black-box Discrete Prompt LearningGanyu Wang, Jinjie Fang, Maxwell J. Yin, Bin Gu et al.ICML 2025
- FedDEAP: Adaptive Dual-Prompt Tuning for Multi-Domain Federated LearningYubin Zheng, Pak-Hei Yeung, Jing Xia, Tianjie Ju et al.ACM MM 2025
- Language Models as Black-Box Optimizers for Vision-Language ModelsShihong Liu, Samuel Yu, Zhiqiu Lin, Deepak Pathak et al.CVPR 2024 · 18 citations
