Improving Subgroup Robustness via Data Selection
Saachi Jain, Kimia Hamidieh, Kristian Georgiev, Andrew Ilyas, Marzyeh Ghassemi, Aleksander Madry
Abstract
Machine learning models can often fail on subgroups that are underrepresented during training. While dataset balancing can improve performance on underper-forming groups, it requires access to training group annotations and can end up removing large portions of the dataset. In this paper, we introduce Data Debiasing with Datamodels (D3M), a debiasing approach which isolates and removes specific training examples that drive the model’s failures on minority groups. Our approach enables us to efficiently train debiased classifiers while removing only a small number of examples, and does not require training group annotations or additional hyperparameter tuning
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 8bd92c4b-88a4-47e5-8a43-120f94a9c9fdCited by top-tier papers7
- DataMIL: Selecting Data for Robot Imitation Learning with DatamodelsShivin Dass, Alaa Khaddaj, Logan Engstrom, Aleksander Madry et al.ICLR 2026 · 34 citations
- Better Training Data Attribution via Better Inverse Hessian-Vector ProductsAndrew Wang, Elisa Nguyen, Runshi Yang, Juhan Bae et al.NeurIPS 2025 · 12 citations
- Mitigating Spurious Correlation via Distributionally Robust Learning with Hierarchical Ambiguity SetsSung Ho Jo, Seonghwi Kim, Minwoo ChaeICLR 2026 · 6 citations
- FairNet: Dynamic Fairness Correction without Performance Loss via Contrastive Conditional LoRASongqi Zhou, Zeyuan Liu, Benben JiangNeurIPS 2025 · 2 citations
- Data Selection Matters: Towards Robust Instruction Tuning of Large Multimodal ModelsXu Yang, Chen Liu, Ying WeiNeurIPS 2025 · 2 citations
Builds on22
- Decoupling Representation and Classifier for Long-Tailed RecognitionBingyi Kang, Saining Xie, Marcus Rohrbach, Zhicheng Yan et al.ICLR 2020 · 1,496 citations
- Estimating Training Data Influence by Tracing Gradient DescentGarima Pruthi, Frederick Liu, Satyen Kale, Mukund SundararajanNeurIPS 2020 · 784 citations
- Just Train Twice: Improving Group Robustness without Training Group InformationEvan Zheran Liu, Behzad Haghgoo, Annie S. Chen, Aditi Raghunathan et al.ICML 2021 · 683 citations
- What Neural Networks Memorize and Why: Discovering the Long Tail via Influence EstimationVitaly Feldman, Chiyuan ZhangNeurIPS 2020 · 674 citations
- The Pitfalls of Simplicity Bias in Neural NetworksHarshay Shah, Kaustav Tamuly, Aditi Raghunathan, Prateek Jain et al.NeurIPS 2020 · 503 citations
Related papers
- Denoising after Entropy-Based Debiasing a Robust Training Method for Dataset Bias with Noisy LabelsSumyeong Ahn, Se-Young YunAAAI 2023 · 2 citations
- Mitigating Spurious Correlations via Disagreement ProbabilityHyeonggeun Han, Sehwan Kim, Hyungjun Joo, Sangwoo Hong et al.NeurIPS 2024 · 8 citations
- Explanatory Debiasing: Involving Domain Experts in the Data Generation Process to Mitigate Representation Bias in AI SystemsAditya Bhattacharya, Simone Stumpf, Robin De Croon, Katrien VerbertCHI 2025 · 6 citations
- Can You Rely on Your Model Evaluation? Improving Model Evaluation with Synthetic Test DataBoris van Breugel, Nabeel Seedat, Fergus Imrie, Mihaela van der SchaarNeurIPS 2023 · 51 citations
- Let Samples Speak: Mitigating Spurious Correlation by Exploiting the Clusterness of SamplesWeiwei Li, Junzhuo Liu, Yuanyuan Ren, Yuchen Zheng et al.CVPR 2025
