DuReader-Retrieval: A Large-scale Chinese Benchmark for Passage Retrieval from Web Search Engine
Yifu Qiu, Hongyu Li, Yingqi Qu, Ying Chen, Qiaoqiao She, Jing Liu, Hua Wu, Haifeng Wang
摘要
In this paper, we present DuReader retrieval , a large-scale Chinese dataset for passage retrieval. DuReader retrieval contains more than 90K queries and over 8M unique passages from a commercial search engine. To alleviate the shortcomings of other datasets and ensure the quality of our benchmark, we (1) reduce the false negatives in development and test sets by manually annotating results pooled from multiple retrievers, and (2) remove the training queries that are semantically similar to the development and testing queries. Additionally, we provide two outof-domain testing sets for cross-domain evaluation, as well as a set of human translated queries for for cross-lingual retrieval evaluation. The experiments demonstrate that DuReader retrieval is challenging and a number of problems remain unsolved, such as the salient phrase mismatch and the syntactic mismatch between queries and paragraphs. These experiments also show that dense retrievers do not generalize well across domains, and cross-lingual retrieval is essentially challenging. DuReader retrieval is publicly available at https://github.com/baidu/DuReader/ tree/master/DuReader-Retrieval .
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper8
- Negative Matters: Multi-Granularity Hard-Negative Synthesis and Anchor-Token-Aware Pooling for Enhanced Text EmbeddingsTengyu Pan, Zhichao Duan, Zhenyu Li, Bowen Dong 等ACL 2025 · 被引用 3 次
- LightRetriever: A LLM-based Text Retrieval Architecture with Extremely Faster Query InferenceGuangyuan Ma, Yongliang Ma, Xuanrui Gou, Zhenpeng Su 等ICLR 2026 · 被引用 3 次
- Enhancing Legal Case Retrieval via Scaling High-quality Synthetic Query-Candidate PairsCheng Gao, Chaojun Xiao, Zhenghao Liu, Huimin Chen 等EMNLP 2024 · 被引用 1 次
- Generative Representational Instruction TuningNiklas Muennighoff, Hongjin Su, Liang Wang, Nan Yang 等ICLR 2025
- Making Text Embedders Few-Shot LearnersChaofan Li, Minghao Qin, Shitao Xiao, Jianlyu Chen 等ICLR 2025
它引用的顶会 Paper11
- Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text RetrievalLee Xiong, Chenyan Xiong, Ye Li, Kwok-Fung Tang 等ICLR 2021 · 被引用 1,547 次
- ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERTOmar Khattab, Matei ZahariaSIGIR 2020 · 被引用 1,246 次
- Pre-training Tasks for Embedding-based Large-scale RetrievalWei-Cheng Chang, Felix X. Yu, Yin-Wen Chang, Yiming Yang 等ICLR 2020 · 被引用 325 次
- Optimizing Dense Retrieval Model Training with Hard NegativesJingtao Zhan, Jiaxin Mao, Yiqun Liu, Jiafeng Guo 等SIGIR 2021 · 被引用 242 次
- Dense Passage Retrieval for Open-Domain Question AnsweringVladimir Karpukhin, Barlas Oguz, Sewon Min, Patrick Lewis 等EMNLP 2020 · 被引用 142 次
相关 Paper
- DAPR: A Benchmark on Document-Aware Passage RetrievalKexin Wang, Nils Reimers, Iryna GurevychACL 2024
- Recovering Gold from Black Sand: Multilingual Dense Passage Retrieval with Hard and False Negative SamplesTianhao Shen, Mingtong Liu, Ming Zhou, Deyi XiongEMNLP 2022 · 被引用 3 次
- DuSQL: A Large-Scale and Pragmatic Chinese Text-to-SQL DatasetLijie Wang, Ao Zhang, Kun Wu, Ke Sun 等EMNLP 2020 · 被引用 40 次
- Boosting Data Utilization for Multilingual Dense RetrievalChao Huang, Fengran Mo, Yufeng Chen, Changhao Guan 等EMNLP 2025 · 被引用 2 次
- Query-as-context Pre-training for Dense Passage RetrievalXing Wu, Guangyuan Ma, Wanhui Qian, Zijia Lin 等EMNLP 2023 · 被引用 2 次
