CEBC: Conformal Evidence-Bounded Control for Low-Hallucination Vision-Language Generation
Ashish Mishra, Tarun Kumar, Arpit Shah, Suparna Bhattacharya, Martin Foltin
摘要
Hallucinated object mentions remain a persistent failure mode of vision-language models (VLMs) across generation tasks such as image captioning and visual question answering: outputs may be fluent, yet include entities not supported by visual evidence. Existing mitigation approaches often reduce hallucinations at the cost of degraded generation quality or require expensive retraining and taskspecific supervision. We introduce CEBC, a lightweight, training-free framework for lowhallucination vision-language generation based on conformal evidence-bounded minimal editing. CEBC first produces a strong base output (via greedy decoding or best-of-K sampling), then applies an evidence-bounded editing step that minimally revises or suppresses unsupported object mentions using constraints derived from an external visual detector. Crucially, the evidence threshold is conformally calibrated on a small held-out set via quantiles of detector confidence scores, enabling explicit and controllable hallucination risk at test time. To balance factuality and informativeness, we further introduce a risk-first, qualityaware selection rule that prioritizes evidenceconsistent generations while regularizing unnecessary length or lexical drift. Extensive experiments on MS-COCO and GQA for image captioning, and POPE for VQA evaluation across multiple VLMs demonstrate that CEBC consistently reduces hallucination rates (CHAIR S , CHAIR I , POPE) while maintaining or improving standard generation quality metrics (CIDEr, BLEU, CLIPScore). CEBC establishes a stronger factuality-quality Pareto frontier without any additional model training or access to paired supervision beyond an offthe-shelf detector.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper13
- InstructBLIP: Towards General-purpose Vision-Language Models with Instruction TuningWenliang Dai, Junnan Li, Dongxu Li, Anthony Meng Huat Tiong 等NeurIPS 2023 · 被引用 4,013 次
- Analyzing and Mitigating Object Hallucination in Large Vision-Language ModelsYiyang Zhou, Chenhang Cui, Jaehong Yoon, Linjun Zhang 等ICLR 2024 · 被引用 316 次
- Transferable Decoding with Visual Entities for Zero-Shot Image CaptioningJunjie Fei, Teng Wang, Jinrui Zhang, Zhenyu He 等ICCV 2023 · 被引用 80 次
- ConVis: Contrastive Decoding with Hallucination Visualization for Mitigating Hallucinations in Multimodal Large Language ModelsYeji Park, Deokyeong Lee, Junsuk Choe, Buru ChangAAAI 2025 · 被引用 19 次
- Mitigating Open-Vocabulary Caption HallucinationsAssaf Ben-Kish, Moran Yanuka, Morris Alper, Raja Giryes 等EMNLP 2024 · 被引用 3 次
相关 Paper
- VES-RFT: Rewarding Visual Evidence Sensitivity to Mitigate Hallucinations in Large Vision–Language ModelsXUEGE HOU, Wenshuo Li, Yali Li, Han Shu 等CVPR 2026
- Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language ModelsNanxing Hu, Xiaoyue Duan, Jinchao Zhang, Guoliang KangACM MM 2025 · 被引用 1 次
- Towards Statistical Factuality Guarantee for Large Vision-Language ModelsZhuohang Li, Chao Yan, Nicholas J. Jackson, Wendi Cui 等EMNLP 2025 · 被引用 2 次
- Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive DecodingSicong Leng, Hang Zhang, Guanzheng Chen, Xin Li 等CVPR 2024
- Do You Keep an Eye on What I Ask? Mitigating Multimodal Hallucination via Attention-Guided Ensemble DecodingYeongjae Cho, Keonwoo Kim, Taebaek Hwang, Sungzoon ChoICLR 2025
