Aegis: A Correlation-Based Data Masking Advisor for Data Sharing Ecosystems
Omar Islam Laskar, Fatemeh Ramezani Khozestani, Ishika Nankani, Sohrab Namazi Nia, Senjuti Basu Roy, Kaustubh Beedkar
摘要
Data-sharing ecosystems connect providers, consumers, and intermediaries to facilitate the exchange and use of data for a wide range of downstream tasks. In sensitive domains such as healthcare, privacy is enforced as a hard constraint--any shared data must satisfy a minimum privacy threshold. However, among all masking configurations that meet this requirement, the utility of the masked data can vary significantly, posing a key challenge: how to efficiently select the optimal configuration that preserves maximum utility. This paper presents A egis , a middleware framework that selects optimal masking configurations for machine learning datasets with features and class labels. A egis incorporates a utility optimizer that minimizes predictive utility deviation --quantifying shifts in feature-label correlations due to masking. Our framework leverages limited data summaries (such as 1D histograms) or none to estimate the feature-label joint distribution, making it suitable for scenarios where raw data is inaccessible due to privacy restrictions. To achieve this, we propose a joint distribution estimator based on iterative proportional fitting, which allows supporting various feature-label correlation quantification methods such as mutual information, chi-square, or g3. Our experimental evaluation of real-world datasets shows that Aegis identifies optimal masking configurations over an order of magnitude faster, while the resulting masked datasets achieve predictive performance on downstream ML tasks on par with baseline approaches and complements privacy anonymization data masking techniques.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper5
- Federated Learning on Non-IID Data Silos: An Experimental StudyQinbin Li, Yiqun Diao, Quan Chen, Bingsheng HeICDE 2022 · 被引用 1,110 次
- Efficient Approximate Algorithms for Empirical Entropy and Mutual InformationXingguang Chen, Sibo WangSIGMOD 2021 · 被引用 9 次
- Fainder: A Fast and Accurate Index for Distribution-Aware Dataset SearchLennart Behme, Sainyam Galhotra, Kaustubh Beedkar, Volker MarklVLDB 2024 · 被引用 9 次
- Disclosure-Compliant Query AnsweringRudi Poepsel Lemaitre, Kaustubh Beedkar, Volker MarklSIGMOD 2025 · 被引用 1 次
- Synthetic Data - Anonymisation Groundhog DayTheresa Stadler, Bristena Oprisanu, Carmela TroncosoUSENIX Security 2022
相关 Paper
- Not All Features Are Equal: Discovering Essential Features for Preserving Prediction PrivacyFatemehsadat Mireshghallah, Mohammadkazem Taram, Ali Jalali, Ahmed Taha Elthakeb 等WWW 2021 · 被引用 59 次
- Operationalizing Data Minimization for Privacy-Preserving LLM PromptingJijie Zhou, Niloofar Mireshghallah, Tianshi LiICLR 2026 · 被引用 13 次
- Shielding PII to Prevent Re-identification and Preserve UtilityShuhao Liu, Wenfei Fan, Yijia XuSIGMOD 2026
- Understanding Fairness and Prediction Error through Subspace Decomposition and Influence AnalysisEnze Shi, Pankaj Bhagwat, Zhixian Yang, Linglong Kong 等NeurIPS 2025
- Learning from Aggregate responses: Instance Level versus Bag Level Loss FunctionsAdel Javanmard, Lin Chen, Vahab Mirrokni, Ashwinkumar Badanidiyuru 等ICLR 2024 · 被引用 3 次
