Counterfactual Inference for Text Classification Debiasing
Chen Qian, Fuli Feng, Lijie Wen, Chunping Ma, Pengjun Xie
Abstract
Today's text classifiers inevitably suffer from unintended dataset biases, especially the document-level label bias and word-level keyword bias, which may hurt models' generalization. Many previous studies employed datalevel manipulations or model-level balancing mechanisms to recover unbiased distributions and thus prevent models from capturing the two types of biases. Unfortunately, they either suffer from the extra cost of data collection/selection/annotation or need an elaborate design of balancing strategies. Different from traditional factual inference in which debiasing occurs before or during training, counterfactual inference mitigates the influence brought by unintended confounders after training, which can make unbiased decisions with biased observations. Inspired by this, we propose a model-agnostic text classification debiasing framework -CORSAIR, which can effectively avoid employing data manipulations or designing balancing mechanisms. Concretely, CORSAIR first trains a base model on a training set directly, allowing the dataset biases "poison" the trained model. In inference, given a factual input document, COR-SAIR imagines its two counterfactual counterparts to distill and mitigate the two biases captured by the poisonous model. Extensive experiments demonstrate CORSAIR's effectiveness, generalizability and fairness. 1 * This work was partly done during Chen Qian's internship at Alibaba DAMO academy. Fuli Feng and Lijie Wen are the co-corresponding authors. 1 The code is available at https://github.com/ qianc62/Corsair .
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 979d9378-d1a8-4f57-8792-e61922c8e17fCited by top-tier papers22
- Model-Agnostic Counterfactual Reasoning for Eliminating Popularity Bias in Recommender SystemTianxin Wei, Fuli Feng, Jiawei Chen, Ziwei Wu et al.KDD 2021 · 246 citations
- Counterfactual Reasoning for Out-of-distribution Multimodal Sentiment AnalysisTeng Sun, Wenjie Wang, Liqiang Jing, Yiran Cui et al.ACM MM 2022 · 65 citations
- A Rationale-Centric Framework for Human-in-the-loop Machine LearningJinghui Lu, Linyi Yang, Brian MacNamee, Yue ZhangACL 2022 · 46 citations
- Debiasing NLU Models via Causal Intervention and Counterfactual ReasoningBing Tian, Yixin Cao, Yong Zhang, Chunxiao XingAAAI 2022 · 45 citations
- Debiasing Recommendation with Personal PopularityWentao Ning, Reynold Cheng, Xiao Yan, Ben Kao et al.WWW 2024 · 26 citations
Builds on10
- Decoupling Representation and Classifier for Long-Tailed RecognitionBingyi Kang, Saining Xie, Marcus Rohrbach, Zhicheng Yan et al.ICLR 2020 · 1,496 citations
- Controlling Fairness and Bias in Dynamic Learning-to-RankMarco Morik, Ashudeep Singh, Jessica Hong, Thorsten JoachimsSIGIR 2020 · 205 citations
- Don't Stop Pretraining: Adapt Language Models to Domains and TasksSuchin Gururangan, Ana Marasovic, Swabha Swayamdipta, Kyle Lo et al.ACL 2020 · 93 citations
- Language (Technology) is Power: A Critical Survey of "Bias" in NLPSu Lin Blodgett, Solon Barocas, Hal Daumé III, Hanna M. WallachACL 2020 · 68 citations
- Conceptualized and Contextualized Gaussian EmbeddingChen Qian, Fuli Feng, Lijie Wen, Tat-Seng ChuaAAAI 2021 · 26 citations
Related papers
- A Training-Free Debiasing Framework with Counterfactual Reasoning for Conversational Emotion DetectionGeng Tu, Ran Jing, Bin Liang, Min Yang et al.EMNLP 2023 · 9 citations
- Demographics Should Not Be the Reason of Toxicity: Mitigating Discrimination in Text Classifications with Instance WeightingGuanhua Zhang, Bing Bai, Junqi Zhang, Kun Bai et al.ACL 2020 · 56 citations
- CoBA: Counterbias Text Augmentation for Mitigating Various Spurious Correlations via Semantic TriplesKyohoon Jin, Juhwan Choi, Jungmin Yun, Junho Lee et al.EMNLP 2025
- Unbiased Classification through Bias-Contrastive and Bias-Balanced LearningYoungkyu Hong, Eunho YangNeurIPS 2021 · 94 citations
- Counterfactual VQA: A Cause-Effect Look at Language BiasYulei Niu, Kaihua Tang, Hanwang Zhang, Zhiwu Lu et al.CVPR 2021
