FLAIM: AIM-based Synthetic Data Generation in the Federated Setting
Samuel Maddock, Graham Cormode, Carsten Maple
摘要
Preserving individual privacy while enabling collaborative data sharing is crucial for organizations. Synthetic data generation is one solution, producing artificial data that mirrors the statistical properties of private data. While numerous techniques have been devised under differential privacy, they predominantly assume data is centralized. However, data is often distributed across multiple clients in a federated manner. In this work, we initiate the study of federated synthetic tabular data generation. Building upon a SOTA central method known as AIM, we present DistAIM and FLAIM. We first show that it is straightforward to distribute AIM, extending a recent approach based on secure multi-party computation which necessitates additional overhead, making it less suited to federated scenarios. We then demonstrate that naively federating AIM can lead to substantial degradation in utility under the presence of heterogeneity. To mitigate both issues, we propose an augmented FLAIM approach that maintains a private proxy of heterogeneity. We simulate our methods across a range of benchmark datasets under different degrees of heterogeneity and show we can improve utility while reducing overhead.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper4
- CaPS: Collaborative and Private Synthetic Data Generation from Distributed SourcesSikha Pentyala, Mayana Pereira, Martine De CockICML 2024 · 被引用 6 次
- : Fully Homomorphic AIM for Private Tabular Synthetic Data GenerationMayank Kumar, Qian Lou, Paulo Barreto, Martine De Cock 等ICML 2026 · 被引用 1 次
- Differentially Private Synthetic Data via APIs 4: Tabular DataToan Tran, Arturs Backurs, Zinan Lin, Victor Reis 等ICML 2026 · 被引用 1 次
- Distributed Synthesis of Differentially Private Tabular DatasetsYucheng Fu, Tianyao Gu, Elaine Shi, Tianhao WangUSENIX Security 2026
它引用的顶会 Paper14
- Denoising Diffusion Probabilistic ModelsJonathan Ho, Ajay Jain, Pieter AbbeelNeurIPS 2020 · 被引用 35,902 次
- Federated Learning on Non-IID Data Silos: An Experimental StudyQinbin Li, Yiqun Diao, Quan Chen, Bingsheng HeICDE 2022 · 被引用 1,110 次
- High-Throughput Semi-Honest Secure Three-Party Computation with an Honest MajorityToshinori Araki, Jun Furukawa, Yehuda Lindell, Ariel Nof 等CCS 2016 · 被引用 463 次
- The Discrete Gaussian for Differential PrivacyClément L. Canonne, Gautam Kamath, Thomas SteinkeNeurIPS 2020 · 被引用 355 次
- AIM: An Adaptive and Iterative Mechanism for Differentially Private Synthetic DataRyan McKenna, Brett Mullins, Daniel Sheldon, Gerome MiklauVLDB 2022 · 被引用 136 次
相关 Paper
- HeteroFedSyn: Differentially Private Tabular Data Synthesis for Heterogeneous Federated SettingsXiaochen Li, Fengyu Gao, Xizixiang Wei, Tianhao Wang 等SIGMOD 2026
- PrivSyn: Differentially Private Data SynthesisZhikun Zhang, Tianhao Wang, Ninghui Li, Jean Honorio 等USENIX Security 2021
- Personalized Federated Training of Diffusion Models with Privacy GuaranteesKumar Kshitij Patel, Bingqing Jiang, A. F. M. Mahfuzul Kabir, Weitong Zhang 等CVPR 2026
- FedPDG: Prediction Discrepancy–Guided Data Generation for Heterogeneous Federated LearningYuqi Wang, Jianwei Niu, Xinghao Wu, Xuefeng Liu 等ICML 2026
- FedDM: Iterative Distribution Matching for Communication-Efficient Federated LearningYuanhao Xiong, Ruochen Wang, Minhao Cheng, Felix X. Yu 等CVPR 2023
