Mitigating Stereotypes in Text-to-Image Generation: A Novel Perspective of Selective Neural Suppression
Junlei Zhou, Jiashi Gao, Xinwei Guo, Haiyan Wu, Quanying Liu, Xiangyu Zhao, Hongxin Wei, Xin Yao, Xuetao Wei
摘要
Text-to-Image (T2I) diffusion models exhibit concerning tendencies to generate harmful imagery that perpetuates social biases and stereotypes, posing significant ethical risks in real-world applications. While existing mitigation approaches predominantly employ black-box methodologies through dataset augmentation or constrained fine-tuning, they face critical limitations, including high data acquisition costs and potential exacerbation of stereotypes during model retraining. Inspired by neuroscience principles where neurological dysfunction often stems from aberrant neural activation patterns, we propose a novel framework, StereoClinic, targeting the root cause of stereotype generation through direct neural intervention. Our solution introduces two synergistic components: Diffusion Deep Taylor Decomposition (DDTD) for precisely localizing stereotype-related neurons via Layer-wise Relevance Propagation (LRP) attribution analysis, and Stereotype Neuron Suppression (SNS) implementing targeted activation damping to neutralize bias propagation. Through extensive empirical evaluations across multiple bias dimensions, we demonstrate that our method achieves significant stereotype mitigation without compromising image quality or requiring additional training data. This neuro-inspired approach establishes a new paradigm for model interpretability and ethical alignment in generative AI systems.
问问这篇 Paper
问问你的智能体。
Lune 读过与它相关的顶会 Paper,每个回答都会注明依据哪几篇。
相关 Paper
- Association of Objects May Engender Stereotypes: Mitigating Association-Engendered Stereotypes in Text-to-Image GenerationJunlei Zhou, Jiashi Gao, Xiangyu Zhao, Xin Yao 等NeurIPS 2024 · 被引用 5 次
- Fine-tuning Bias Neurons for Fair Text-to-Image GenerationFan Qi, Zhan Wang, Changsheng Xu, Huaiwen ZhangACM MM 2025
- Image-Perfect Imperfections: Safety, Bias, and Authenticity in the Shadow of Text-To-Image Model EvolutionYixin Wu, Yun Shen, Michael Backes, Yang ZhangCCS 2024 · 被引用 3 次
- Fair Generation without Unfair Distortions: Debiasing Text-To-Image Generation with Entanglement-Free AttentionJeonghoon Park, Juyoung Lee, Chaeyeon Chung, Jaeseong Lee 等ICCV 2025 · 被引用 1 次
- AutoDebias: An Automated Framework for Detecting and Mitigating Backdoor Biases in Text-to-Image ModelsHongyi Cai, Mohammad Mahdinur Rahman, MingKang Dong, Muxin Pu 等CVPR 2026
