Aleatoric and Epistemic Discrimination: Fundamental Limits of Fairness Interventions
Hao Wang, Luxi He, Rui Gao, Flávio P. Calmon
Abstract
Machine learning (ML) models can underperform on certain population groups due to choices made during model development and bias inherent in the data. We categorize sources of discrimination in the ML pipeline into two classes: aleatoric discrimination, which is inherent in the data distribution, and epistemic discrimination, which is due to decisions made during model development. We quantify aleatoric discrimination by determining the performance limits of a model under fairness constraints, assuming perfect knowledge of the data distribution. We demonstrate how to characterize aleatoric discrimination by applying Blackwell's results on comparing statistical experiments. We then quantify epistemic discrimination as the gap between a model's accuracy when fairness constraints are applied and the limit posed by aleatoric discrimination. We apply this approach to benchmark existing fairness interventions and investigate fairness risks in data with missing values. Our results indicate that state-of-the-art fairness interventions are effective at removing epistemic discrimination on standard (overused) tabular datasets. However, when data has missing values, there is still significant room for improvement in handling aleatoric discrimination.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 2f3f8d86-dfc4-4c5d-b26e-aa5513d8436bCited by top-tier papers6
- Demystifying Local & Global Fairness Trade-offs in Federated Learning Using Partial Information DecompositionFaisal Hamman, Sanghamitra DuttaICLR 2024 · 9 citations
- Debiasing Attention Mechanism in Transformer without DemographicsShenyu Lu, Yipei Wang, Xiaoqian WangICLR 2024 · 7 citations
- Achievable Fairness on Your Data With Utility GuaranteesMuhammad Faaiz Taufiq, Jean-Francois Ton, Yang LiuNeurIPS 2024 · 3 citations
- Efficient Fairness-Performance Pareto Front ComputationMark Kozdoba, Binyamin Perets, Shie MannorNeurIPS 2025 · 2 citations
- Disparate Conditional Prediction in Multiclass ClassifiersSivan Sabato, Eran Treister, Elad Yom-TovICML 2025
Builds on13
- Retiring Adult: New Datasets for Fair Machine LearningFrances Ding, Moritz Hardt, John Miller, Ludwig SchmidtNeurIPS 2021 · 671 citations
- Minimax Pareto Fairness: A Multi Objective PerspectiveNatalia Martínez, Martín Bertrán, Guillermo SapiroICML 2020 · 232 citations
- Is There a Trade-Off Between Fairness and Accuracy? A Perspective Using Mismatched Hypothesis TestingSanghamitra Dutta, Dennis Wei, Hazar Yueksel, Pin-Yu Chen et al.ICML 2020 · 171 citations
- Robust Optimization for Fairness with Noisy Protected GroupsSerena Lutong Wang, Wenshuo Guo, Harikrishna Narasimhan, Andrew Cotter et al.NeurIPS 2020 · 134 citations
- Fairness with Overlapping Groups; a Probabilistic PerspectiveForest Yang, Mouhamadou Cisse, Oluwasanmi KoyejoNeurIPS 2020 · 71 citations
Related papers
- Fairness without Imputation: A Decision Tree Approach for Fair Prediction with Missing ValuesHaewon Jeong, Hao Wang, Flávio P. CalmonAAAI 2022 · 48 citations
- Rethinking Aleatoric and Epistemic UncertaintyFreddie Bickford Smith, Jannik Kossen, Eleanor Trollope, Mark van der Wilk et al.ICML 2025
- From Risk to Uncertainty: Generating Predictive Uncertainty Measures via Bayesian EstimationNikita Kotelevskii, Vladimir Kondratyev, Martin Takác, Eric Moulines et al.ICLR 2025
- Assessing Fairness in the Presence of Missing DataYiliang Zhang, Qi LongNeurIPS 2021 · 51 citations
- Adapting Fairness Interventions to Missing ValuesRaymond Feng, Flávio P. Calmon, Hao WangNeurIPS 2023 · 20 citations
