DISCERN: Decoding Systematic Errors in Natural Language for Text Classifiers
Rakesh R. Menon, Shashank Srivastava
摘要
Despite their high predictive accuracies, current machine learning systems often exhibit systematic biases stemming from annotation artifacts or insufficient support for certain classes in the dataset. Recent work proposes automatic methods for identifying and explaining systematic biases using keywords. We introduce DIS-CERN, a framework for interpreting systematic biases in text classifiers using language explanations. DISCERN iteratively generates precise natural language descriptions of systematic errors by employing an interactive loop between two large language models. Finally, we use the descriptions to improve classifiers by augmenting classifier training sets with synthetically generated instances or annotated examples via active learning. On three text-classification datasets, we demonstrate that language explanations from our framework induce consistent performance improvements that go beyond what is achievable with exemplars of systematic bias. Finally, in human evaluations, we show that users can interpret systematic biases more effectively (by over 25% relative) and efficiently when described through language explanations as opposed to cluster exemplars. 1
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper4
- TRoVe: Discovering Error-Inducing Static Feature Biases in Temporal Vision-Language ModelsMaya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari 等NeurIPS 2025 · 被引用 3 次
- Learning from Reasoning Failures via Synthetic Data GenerationGabriela Ben Melech Stan, Estelle Aflalo, Avinash Madasu, Vasudev Lal 等AAAI 2026 · 被引用 2 次
- Explaining Differences Between Model Pairs in Natural Language through Sample LearningAdvaith Malladi, Rakesh R. Menon, Yuvraj Jain, Shashank SrivastavaEMNLP 2025
- Symbal: Detecting Systematic Misalignments in Model-Generated CaptionsMaya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari 等ICML 2026
它引用的顶会 Paper18
- Direct Preference Optimization: Your Language Model is Secretly a Reward ModelRafael Rafailov, Archit Sharma, Eric Mitchell, Christopher D. Manning 等NeurIPS 2023 · 被引用 10,924 次
- BERTScore: Evaluating Text Generation with BERTTianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger 等ICLR 2020 · 被引用 8,443 次
- Self-Refine: Iterative Refinement with Self-FeedbackAman Madaan, Niket Tandon, Prakhar Gupta, Skyler Hallinan 等NeurIPS 2023 · 被引用 4,972 次
- Distributionally Robust Neural NetworksShiori Sagawa, Pang Wei Koh, Tatsunori B. Hashimoto, Percy LiangICLR 2020 · 被引用 1,578 次
- Teaching Large Language Models to Self-DebugXinyun Chen, Maxwell Lin, Nathanael Schärli, Denny ZhouICLR 2024 · 被引用 1,085 次
相关 Paper
- DEXTER: Diffusion-Guided EXplanations with TExtual Reasoning for Vision ModelsSimone Carnemolla, Matteo Pennisi, Sarinda Samarasinghe, Giovanni Bellitto 等NeurIPS 2025 · 被引用 4 次
- Label-Descriptive Patterns and Their Application to Characterizing Classification ErrorsMichael A. Hedderich, Jonas Fischer, Dietrich Klakow, Jilles VreekenICML 2022 · 被引用 14 次
- FIND: Human-in-the-Loop Debugging Deep Text ClassifiersPiyawat Lertvittayakumjorn, Lucia Specia, Francesca ToniEMNLP 2020 · 被引用 33 次
- Classifier-to-Bias: Toward Unsupervised Automatic Bias Detection for Visual ClassifiersQuentin Guimard, Moreno D'Incà, Massimiliano Mancini, Elisa RicciCVPR 2025
- Discovering and Mitigating Visual Biases Through Keyword ExplanationYounghyun Kim, Sangwoo Mo, Minkyu Kim, Kyungmin Lee 等CVPR 2024
