JurisBench: A Deep Benchmark for Assessing Large Language Models in Professional Legal Practice
Ziang Chen, Guannan Li, Fanlin Ji, Yipeng Kang, Jiaqi Li, Muhan Zhang, Yangtao Zhang, Li Tianjiao, Jiannan Wang, Xin Guo, Song-Chun Zhu, Bin Ling
摘要
Large Language Models (LLMs) have demonstrated strong cross-domain capabilities, yet their competence in specialized professional tasks remains underexamined. Existing legal benchmarks evaluate isolated tasks or examstyle questions, failing to capture the procedural interdependencies and adjudicative rigor inherent in professional practice. To bridge this gap, we construct JurisBench, a vertical, depth-oriented, domain-specific benchmark designed to evaluate LLMs across key stages of Chinese civil litigation. JurisBench introduces a Linear Depth Simulation track that mirrors the cognitive workflow of professional judges through four sequential, dependencyaware phases: Cause of Action prediction, Focus of Disputes identification, Rationale of the Judgment generation, and Result of the Judgment determination. Results reveal an "illusion of competence": state-of-the-art models exhibit marked performance degradation in end-to-end pipelines due to cascading error propagation. We identify precise statutory grounding as a persistent bottleneck, highlighting a critical gap between fluent linguistic output and judicial reliability. JurisBench shifts evaluation from isolated legal knowledge to workflow-level task execution, providing a diagnostic framework for legal AI and a template for benchmark design in specialized domains.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper6
- Measuring Massive Multitask Language UnderstandingDan Hendrycks, Collin Burns, Steven Basart, Andy Zou 等ICLR 2021 · 被引用 7,905 次
- LawBench: Benchmarking Legal Knowledge of Large Language ModelsZhiwei Fei, Xiaoyu Shen, Dawei Zhu, Fengzhe Zhou 等EMNLP 2024 · 被引用 59 次
- LeXFiles and LegalLAMA: Facilitating English Multinational Legal Language Model DevelopmentIlias Chalkidis, Nicolas Garneau, Catalina Goanta, Daniel Martin Katz 等ACL 2023 · 被引用 29 次
- Syllogistic Reasoning for Legal Judgment AnalysisWentao Deng, Jiahuan Pei, Keyi Kong, Zhe Chen 等EMNLP 2023 · 被引用 17 次
- LexGLUE: A Benchmark Dataset for Legal Language Understanding in EnglishIlias Chalkidis, Abhik Jana, Dirk Hartung, Michael J. Bommarito II 等ACL 2022
相关 Paper
- PLAWBENCH: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal PracticeYuzhen Shi, Huanghai Liu, Yiran Hu, Gaojie Song 等ACL 2026 · 被引用 7 次
- LegalAgentBench: Evaluating LLM Agents in Legal DomainHaitao Li, Junjie Chen, Jingli Yang, Qingyao Ai 等ACL 2025
- LexRel: Benchmarking Legal Relation Extraction for Chinese Civil CasesYida Cai, Ranjuexiao Hu, Huiyuan Xie, Chenyang Li 等ACL 2026
- LexChain: Modeling Legal Reasoning Chains for Chinese Tort Case AnalysisHuiyuan Xie, Chenyang Li, Huining Zhu, Chubin Zhang 等AAAI 2026 · 被引用 2 次
- From Query to Counsel: Structured Reasoning with a Multi-Agent Framework and Dataset for Legal ConsultationMingfei Lu, Yi Zhang, Mengjia Wu, Yue FengACL 2026 · 被引用 2 次
