FDPT: Federated Discrete Prompt Tuning for Black-Box Visual-Language Models
Jiaqi Wu, Simin Chen, Jing Tang, Yuzhe Yang, Yiming Chen, Lixu Wang, Song Lin, Zehua Wang, Wei Chen, Zijian Tian
摘要
Vision-Language Models (VLMs) have driven significant advancements in multimodal AI. Fine-tuning these models with user data enhances adaptability but poses privacy risks. While federated learning (FL) mitigates user data privacy concerns, it fails to protect model properties. Existing methods relying on black-box VLM APIs often require access to prediction logits, making them vulnerable to inversion attacks. Additionally, optimizing tuning complexity and data transmission efficiency in federated VLM scenarios remains a challenge. To address these challenges, we propose FDPT-the first federated discrete prompt tuning method utilizing black-box VLMs. During client optimization stage, FDPT employs an agent-driven framework leveraging large language models (LLMs) with enhanced reasoning capacities to systematically optimize discrete prompt representations, and also utilizes feedback mechanisms and chain of thought to enhance prediction accuracy. Importantly, it performs optimization by relying not on the predicted logic vectors output by LLMs but on textual results, avoiding reverse attack risks. During global aggregation stage, We mimic human electoral activities by employing evolutionary computation methods underpinned by semantic similarity computation to implement enhanced zero-order optimization for acquiring representative global tokens, thereby achieving knowledge aggregation. FDPT significantly outperforms nine state-of-the-art methods in image classification and visual question-answering, reducing communication overhead while generating highly transferable optimized prompts. Additionally, it exhibits im- † Equal contribution * Corresponding author proved robustness to data heterogeneity.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper24
- Flamingo: a Visual Language Model for Few-Shot LearningJean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech 等NeurIPS 2022 · 被引用 6,707 次
- Federated Learning on Non-IID Data Silos: An Experimental StudyQinbin Li, Yiqun Diao, Quan Chen, Bingsheng HeICDE 2022 · 被引用 1,110 次
- Addressing Class Imbalance in Federated LearningLixu Wang, Shichao Xu, Xiao Wang, Qi ZhuAAAI 2021 · 被引用 314 次
- MMMU: A Massive Multi-Discipline Multimodal Understanding and Reasoning Benchmark for Expert AGIXiang Yue, Yuansheng Ni, Tianyu Zheng, Kai Zhang 等CVPR 2024 · 被引用 213 次
- Robust Federated Learning with Noisy and Heterogeneous ClientsXiuwen Fang, Mang YeCVPR 2022 · 被引用 169 次
相关 Paper
- FedBPT: Efficient Federated Black-box Prompt Tuning for Large Language ModelsJingwei Sun, Ziyue Xu, Hongxu Yin, Dong Yang 等ICML 2024 · 被引用 38 次
- FedAPT: Federated Adversarial Prompt Tuning for Vision-Language ModelsKun Zhai, Siheng Chen, Xingjun Ma, Yu-Gang JiangACM MM 2025
- FedOne: Query-Efficient Federated Learning for Black-box Discrete Prompt LearningGanyu Wang, Jinjie Fang, Maxwell J. Yin, Bin Gu 等ICML 2025
- FedDEAP: Adaptive Dual-Prompt Tuning for Multi-Domain Federated LearningYubin Zheng, Pak-Hei Yeung, Jing Xia, Tianjie Ju 等ACM MM 2025
- Language Models as Black-Box Optimizers for Vision-Language ModelsShihong Liu, Samuel Yu, Zhiqiu Lin, Deepak Pathak 等CVPR 2024 · 被引用 18 次
