MLEC-QA: A Chinese Multi-Choice Biomedical Question Answering Dataset
Jing Li, Shangping Zhong, Kaizhi Chen
摘要
Question Answering (QA) has been successfully applied in scenarios of human-computer interaction such as chatbots and search engines. However, for the specific biomedical domain, QA systems are still immature due to expert-annotated datasets being limited by category and scale. In this paper, we present MLEC-QA, the largest-scale Chinese multi-choice biomedical QA dataset, collected from the National Medical Licensing Examination in China. The dataset is composed of five subsets with 136,236 biomedical multi-choice questions with extra materials (images or tables) annotated by human experts, and first covers the following biomedical sub-fields: Clinic, Stomatology, Public Health, Traditional Chinese Medicine, and Traditional Chinese Medicine Combined with Western Medicine. We implement eight representative control methods and open-domain QA methods as baselines. Experimental results demonstrate that even the current best model can only achieve accuracies between 40% to 55% on five subsets, especially performing poorly on questions that require sophisticated reasoning ability. We hope the release of the MLEC-QA dataset can serve as a valuable resource for research and evaluation in open-domain QA, and also make advances for biomedical QA systems. 1
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- Document Understanding Dataset and Evaluation (DUDE)Jordy Van Landeghem, Rafal Powalski, Rubèn Tito, Dawid Jurkiewicz 等ICCV 2023 · 被引用 130 次
- MedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language ModelsYan Cai, Linlin Wang, Ye Wang, Gerard de Melo 等AAAI 2024 · 被引用 42 次
- CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical ScenariosZetian Ouyang, Yishuai Qiu, Linlin Wang, Gerard de Melo 等EMNLP 2024 · 被引用 6 次
- BLADE: Enhancing Black-Box Large Language Models with Small Domain-Specific ModelsHaitao Li, Qingyao Ai, Jia Chen, Qian Dong 等AAAI 2025 · 被引用 6 次
- OncoCoT: A Temporal-causal Chain-of-Thought Dataset for Oncologic Decision-MakingPeiru Yang, Yudong Li, Shiting Wang, Xinyi Liu 等AAAI 2026
它引用的顶会 Paper3
- JEC-QA: A Legal-Domain Question Answering DatasetHaoxi Zhong, Chaojun Xiao, Cunchao Tu, Tianyang Zhang 等AAAI 2020 · 被引用 212 次
- Infusing Disease Knowledge into BERT for Health Question Answering, Medical Inference and Disease Name RecognitionYun He, Ziwei Zhu, Yin Zhang, Qin Chen 等EMNLP 2020 · 被引用 103 次
- Towards Medical Machine Reading Comprehension with Structural Knowledge and Plain TextDongfang Li, Baotian Hu, Qingcai Chen, Weihua Peng 等EMNLP 2020 · 被引用 39 次
相关 Paper
- OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLMYutao Hu, Tianbin Li, Quanfeng Lu, Wenqi Shao 等CVPR 2024
- AfriMed-QA: A Pan-African, Multi-Specialty, Medical Question-Answering Benchmark DatasetCharles Nimo, Tobi Olatunji, Abraham Toluwase Owodunni, Tassallah Abdullahi 等ACL 2025 · 被引用 26 次
- MedDialog: Large-scale Medical Dialogue DatasetsGuangtao Zeng, Wenmian Yang, Zeqian Ju, Yue Yang 等EMNLP 2020 · 被引用 163 次
- MedLesionVQA: A Multimodal Benchmark Emulating Clinical Visual Diagnosis for Body Surface HealthDeli Yu, Shengzhi Wang, Kai WU, Xiaozhong Ji 等ICLR 2026
- Towards a Multimodal Large Language Model with Pixel-Level Insight for BiomedicineXiaoshuang Huang, Lingdong Shen, Jia Liu, Fangxin Shang 等AAAI 2025 · 被引用 32 次
