LLM-Driven Completeness and Consistency Evaluation for Cultural Heritage Data Augmentation in Cross-Modal Retrieval
Jian Zhang, Junyi Guo, Junyi Yuan, Huanda Lu, Yanlin Zhou, Fangyu Wu, Qiufeng Wang, Dongming Lu
Abstract
Cross-modal retrieval is essential for interpreting cultural heritage data, but its effectiveness is often limited by incomplete or inconsistent textual descriptions, caused by historical data loss and the high cost of expert annotation. While large language models (LLMs) offer a promising solution by enriching textual descriptions, their outputs frequently suffer from hallucinations or miss visually grounded details. To address these challenges, we propose C 3 , a data augmentation framework that enhances cross-modal retrieval performance by improving the completeness and consistency of LLM-generated descriptions. C 3 introduces a completeness evaluation module to assess semantic coverage using both visual cues and language-model outputs. Furthermore, to mitigate factual inconsistencies, we formulate a Markov Decision Process to supervise Chain-of-Thought reasoning, guiding consistency evaluation through adaptive query control. Experiments on the cultural heritage datasets CulTi and TimeTravel, as well as on general benchmarks MSCOCO and Flickr30K, demonstrate that C 3 achieves state-of-the-art performance in both fine-tuned and zero-shot settings. The code of this paper is available at https://github.com/JianZhang24/C-3 . LLM as extractor F Fvis Fenc
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 68c8ac43-2ce1-4684-b040-2cfb17aaa49bCited by top-tier papers1
Ask how each one uses itBuilds on14
- An Image is Worth 16x16 Words: Transformers for Image Recognition at ScaleAlexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn et al.ICLR 2021 · 21,477 citations
- Scaling Up Visual and Vision-Language Representation Learning With Noisy Text SupervisionChao Jia, Yinfei Yang, Ye Xia, Yi-Ting Chen et al.ICML 2021 · 5,401 citations
- Improving CLIP Training with Language RewritesLijie Fan, Dilip Krishnan, Phillip Isola, Dina Katabi et al.NeurIPS 2023 · 308 citations
- COTS: Collaborative Two-Stream Vision-Language Pre-Training Model for Cross-Modal RetrievalHaoyu Lu, Nanyi Fei, Yuqi Huo, Yizhao Gao et al.CVPR 2022 · 68 citations
- LLM vs Small Model? Large Language Model Based Text Augmentation Enhanced Personality Detection ModelLinmei Hu, Hongyu He, Duokang Wang, Ziwang Zhao et al.AAAI 2024 · 49 citations
Related papers
- VCGD: Visual Clue Guided Decoding with Caption Model for Mitigating Hallucination in Multimodal Large Language ModelsGuoqing Chen, Fu Zhang, Bingqian Liu, Chenglong Lu et al.AAAI 2026
- MISSRAG: Addressing the Missing Modality Challenge in Multimodal Large Language ModelsVittorio Pipoli, Alessia Saporita, Federico Bolelli, Marcella Cornia et al.ICCV 2025 · 4 citations
- Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language ModelsEun Woo Im, Muhammad Kashif Ali, Vivek GuptaICLR 2026 · 1 citation
- Cross-modal Identity Mapping: Minimizing Information Loss in Modality Conversion via Reinforcement LearningHaonan Jia, Shichao Dong, Xin Dong, Zenghui Sun et al.CVPR 2026
- CoRe-MMRAG: Cross-Source Knowledge Reconciliation for Multimodal RAGYang Tian, Fan Liu, Jingyuan Zhang, Victoria W. et al.ACL 2025 · 15 citations
