CBLUE: A Chinese Biomedical Language Understanding Evaluation Benchmark
Ningyu Zhang, Mosha Chen, Zhen Bi, Xiaozhuan Liang, Lei Li, Xin Shang, Kangping Yin, Chuanqi Tan, Jian Xu, Fei Huang, Luo Si, Yuan Ni
摘要
Artificial Intelligence (AI), along with the recent progress in biomedical language understanding, is gradually offering great promise for medical practice. With the development of biomedical language understanding benchmarks, AI applications are widely used in the medical field. However, most benchmarks are limited to English, which makes it challenging to replicate many of the successes in English for other languages. To facilitate research in this direction, we collect real-world biomedical data and present the first Chinese Biomedical Language Understanding Evaluation (CBLUE) benchmark: a collection of natural language understanding tasks including named entity recognition, information extraction, clinical diagnosis normalization, single-sentence/sentence-pair classification, and an associated online platform for model evaluation, comparison, and analysis. To establish evaluation on these tasks, we report empirical results with the current 11 pre-trained Chinese models, and experimental results show that state-of-the-art neural models perform by far worse than the human ceiling.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper12
- D4: a Chinese Dialogue Dataset for Depression-Diagnosis-Oriented ChatBinwei Yao, Chao Shi, Likai Zou, Lingfeng Dai 等EMNLP 2022 · 被引用 23 次
- Multitask Pre-training of Modular Prompt for Chinese Few-Shot LearningTianxiang Sun, Zhengfu He, Qin Zhu, Xipeng Qiu 等ACL 2023 · 被引用 15 次
- MANNER: A Variational Memory-Augmented Model for Cross Domain Few-Shot Named Entity RecognitionJinyuan Fang, Xiaobin Wang, Zaiqiao Meng, Pengjun Xie 等ACL 2023 · 被引用 13 次
- Manifold-Based Verbalizer Space Re-embedding for Tuning-Free Prompt-Based ClassificationHaochun Wang, Sendong Zhao, Chi Liu, Nuwa Xi 等AAAI 2024 · 被引用 4 次
- Generative Models for Automatic Medical Decision Rule Extraction from TextYuxin He, Buzhou Tang, Xiaoling WangEMNLP 2024 · 被引用 2 次
它引用的顶会 Paper3
- ALBERT: A Lite BERT for Self-supervised Learning of Language RepresentationsZhenzhong Lan, Mingda Chen, Sebastian Goodman, Kevin Gimpel 等ICLR 2020 · 被引用 7,418 次
- Graph-Evolving Meta-Learning for Low-Resource Medical Dialogue GenerationShuai Lin, Pan Zhou, Xiaodan Liang, Jianheng Tang 等AAAI 2021 · 被引用 66 次
- RussianSuperGLUE: A Russian Language Understanding Evaluation BenchmarkTatiana Shavrina, Alena Fenogenova, Anton A. Emelyanov, Denis Shevelev 等EMNLP 2020 · 被引用 11 次
相关 Paper
- MedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language ModelsYan Cai, Linlin Wang, Ye Wang, Gerard de Melo 等AAAI 2024 · 被引用 42 次
- CMedCalc-Bench: A Fine-Grained Benchmark for Chinese Medical Calculations in LLMYunyan Zhang, Zhihong Zhu, Xian WuEMNLP 2025 · 被引用 1 次
- CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical ScenariosZetian Ouyang, Yishuai Qiu, Linlin Wang, Gerard de Melo 等EMNLP 2024 · 被引用 6 次
- CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding EvaluationYuxuan Wang, Yijun Liu, Fei Yu, Chen Huang 等AAAI 2025 · 被引用 7 次
- A Knowledge-driven Generative Model for Multi-implication Chinese Medical Procedure Entity NormalizationJinghui Yan, Yining Wang, Lu Xiang, Yu Zhou 等EMNLP 2020 · 被引用 17 次
