Combating Visual Question Answering Hallucinations via Robust Multi-Space Co-Debias Learning
Jiawei Zhu, Yishu Liu, Huanjia Zhu, Hui Lin, Yuncheng Jiang, Zheng Zhang, Bingzhi Chen
Abstract
The challenge of bias in visual question answering (VQA) has gained considerable attention in contemporary research. Various intricate bias dependencies, such as modalities and data imbalances, can cause semantic ambiguities to generate shifts in the feature space of VQA instances. This phenomenon is referred to as ''VQA Hallucinations''. Such distortions can cause hallucination distributions that deviate significantly from the true data, resulting in the model producing factually incorrect predictions. To address this challenge, we propose a robust Multi-Space Co-debias Learning (MSCD) approach for combating VQA hallucinations, which effectively mitigates bias-induced instance and distribution shifts in multi-space under a unified paradigm. Specifically, we design bias-aware and prior-aware debias constraints by utilizing the angle and angle margin of the spherical space to construct bias-prior-instance constraints, thereby refining the manifold representation of instance de-bias and distribution de-dependence. Moreover, we leverage the inherent overfitting characteristics of Euclidean space to introduce bias components from biased examples and modal counterexample injection, further assisting in multi-space robust learning. By integrating homeomorphic instances in different spaces, MSCD could enhance the comprehension of structural relationships between semantics and answer classes, yielding robust representations that are not solely reliant on training priors. In this way, our co-debias paradigm generates more robust representations that effectively mitigate biases to combat hallucinations. Extensive experiments on multiple benchmark datasets consistently demonstrate that the proposed MSCD method outperforms state-of-the-art baselines.
Ask about this paper
Ask your agent about it.
Lune has read the top-tier papers around this one, so every answer names the papers it rests on.
Your agent calls
Lunesearch_papers
Free to start. No credit card required.
Terminal
Install the CLIlune papers get 2bb72cea-cbca-4a62-84c8-2bfdfc2109b3Cited by top-tier papers3
- Language-Bias-Resilient Visual Question Answering via Adaptive Multi-Margin Collaborative DebiasingHuanjia Zhu, Shuyuan Zheng, Yishu Liu, Sudong Cai et al.NeurIPS 2025 · 2 citations
- DAMO: Decoding by Accumulating Activations Momentum for Mitigating Hallucinations in Vision-Language ModelsKaishen Wang, Hengrui Gu, Meijun Gao, Kaixiong ZhouICLR 2025
- BayesVQA: Energy-Guided Bayesian Debiasing for Language-Bias-Robust Visual Question AnsweringZhiqi Huang, Huanjia Zhu, Xiangwen Deng, Qinghao Zhong et al.AAAI 2026
Related papers
- Greedy Gradient Ensemble for Robust Visual Question AnsweringXinzhe Han, Shuhui Wang, Chi Su, Qingming Huang et al.ICCV 2021 · 94 citations
- RMLVQA: A Margin Loss Approach For Visual Question Answering with Language BiasesAbhipsa Basu, Sravanti Addepalli, R. Venkatesh BabuCVPR 2023
- Look, Listen, and Answer: Overcoming Biases for Audio-Visual Question AnsweringJie Ma, Min Hu, Pinghui Wang, Wangchun Sun et al.NeurIPS 2024 · 31 citations
- Towards Robust Visual Question Answering via Prompt-Driven Geometric HarmonizationYishu Liu, Jiawei Zhu, Congcong Wen, Guangming Lu et al.AAAI 2025 · 3 citations
- Generative Bias for Robust Visual Question AnsweringJae-Won Cho, Dong-Jin Kim, Hyeonggon Ryu, In So KweonCVPR 2023
