Combating Visual Question Answering Hallucinations via Robust Multi-Space Co-Debias Learning
Jiawei Zhu, Yishu Liu, Huanjia Zhu, Hui Lin, Yuncheng Jiang, Zheng Zhang, Bingzhi Chen
摘要
The challenge of bias in visual question answering (VQA) has gained considerable attention in contemporary research. Various intricate bias dependencies, such as modalities and data imbalances, can cause semantic ambiguities to generate shifts in the feature space of VQA instances. This phenomenon is referred to as ''VQA Hallucinations''. Such distortions can cause hallucination distributions that deviate significantly from the true data, resulting in the model producing factually incorrect predictions. To address this challenge, we propose a robust Multi-Space Co-debias Learning (MSCD) approach for combating VQA hallucinations, which effectively mitigates bias-induced instance and distribution shifts in multi-space under a unified paradigm. Specifically, we design bias-aware and prior-aware debias constraints by utilizing the angle and angle margin of the spherical space to construct bias-prior-instance constraints, thereby refining the manifold representation of instance de-bias and distribution de-dependence. Moreover, we leverage the inherent overfitting characteristics of Euclidean space to introduce bias components from biased examples and modal counterexample injection, further assisting in multi-space robust learning. By integrating homeomorphic instances in different spaces, MSCD could enhance the comprehension of structural relationships between semantics and answer classes, yielding robust representations that are not solely reliant on training priors. In this way, our co-debias paradigm generates more robust representations that effectively mitigate biases to combat hallucinations. Extensive experiments on multiple benchmark datasets consistently demonstrate that the proposed MSCD method outperforms state-of-the-art baselines.
问问这篇 Paper
问问你的智能体。
Lune 读过与它相关的顶会 Paper,每个回答都会注明依据哪几篇。
引用它的顶会 Paper3
- Language-Bias-Resilient Visual Question Answering via Adaptive Multi-Margin Collaborative DebiasingHuanjia Zhu, Shuyuan Zheng, Yishu Liu, Sudong Cai 等NeurIPS 2025 · 被引用 2 次
- DAMO: Decoding by Accumulating Activations Momentum for Mitigating Hallucinations in Vision-Language ModelsKaishen Wang, Hengrui Gu, Meijun Gao, Kaixiong ZhouICLR 2025
- BayesVQA: Energy-Guided Bayesian Debiasing for Language-Bias-Robust Visual Question AnsweringZhiqi Huang, Huanjia Zhu, Xiangwen Deng, Qinghao Zhong 等AAAI 2026
相关 Paper
- Greedy Gradient Ensemble for Robust Visual Question AnsweringXinzhe Han, Shuhui Wang, Chi Su, Qingming Huang 等ICCV 2021 · 被引用 94 次
- RMLVQA: A Margin Loss Approach For Visual Question Answering with Language BiasesAbhipsa Basu, Sravanti Addepalli, R. Venkatesh BabuCVPR 2023
- Look, Listen, and Answer: Overcoming Biases for Audio-Visual Question AnsweringJie Ma, Min Hu, Pinghui Wang, Wangchun Sun 等NeurIPS 2024 · 被引用 31 次
- Towards Robust Visual Question Answering via Prompt-Driven Geometric HarmonizationYishu Liu, Jiawei Zhu, Congcong Wen, Guangming Lu 等AAAI 2025 · 被引用 3 次
- Generative Bias for Robust Visual Question AnsweringJae-Won Cho, Dong-Jin Kim, Hyeonggon Ryu, In So KweonCVPR 2023
