AI 为什么会编造参考文献,又该怎么治
语言模型凭记忆写参考文献,所以有些文献根本不存在。研究测出了多高的比例,为什么光靠检索还不够,以及真正管用的办法。
约 8 分钟读完
ACL 2026 的程序委员会主席在核对录用论文的终稿时,发现 100 多篇引用了根本不存在的文献,于是撤回了这些论文的录用。ICLR 2026 更早一步:凡是经确认含有幻觉引用的投稿,一律直接拒稿。NeurIPS 2026 的投稿手册也写明,幻觉引用违反其行为准则。
假文献混进论文的路径其实很平常:有人让大模型列一份相关工作,模型给出一张看着没毛病的清单,没人点开核对。2023 年那起最出名的案子里,律师向法院提交了 ChatGPT 编造的判例,法院因此对他作出处罚。他在庭上说:「I just never thought it could be made up.」(我根本没想到它会是编的。)
它就是会编,而且比多数用户以为的更常见。下面讲清楚四件事:研究测出了什么,模型为什么会编,为什么加上检索只解决了一半,以及剩下一半怎么补。
模型编造文献有多频繁
下面每项研究对「假文献」的定义都不一样,所以每个数字都要连同它的测法一起看,不能拿来平均或排名。
| 研究 | 检查了什么 | 结果 |
|---|---|---|
| Walters 与 Wilder,Scientific Reports 2023 | ChatGPT 就 42 个主题写的文献综述,共 636 条引用 | GPT‑3.5 有 55% 是编的,GPT‑4 为 18% |
| Chelli 等,JMIR 2024 | 11 篇系统综述的 471 条参考文献;标题、第一作者、年份错两项即算幻觉 | GPT‑3.5 为 39.6%,GPT‑4 为 28.6%,Bard 为 91.4% |
| Agrawal 等,Findings of EACL 2024 | 每个模型生成 1,000 个计算机方向的标题,按完整标题做网络检索 | GPT‑4 有 46.8% 的标题查无此文 |
| OpenScholar,Nature 2026 | 用 Semantic Scholar 核对被引标题是否存在 | GPT‑4o 在计算机领域编造 78.7%,生物医学 94.8%;GPT‑5 仍有 39% |
| Tang 等,EMNLP 2025 | 为 1,105 篇综述文章各生成 10 条参考文献(GPT‑5 为 651 篇) | Claude 3.5 Sonnet 只有 51.6% 对得上真实 Paper,GPT‑5 只有 20.6% |
新模型通常更好。凡是同时测过 GPT‑3.5 和 GPT‑4 的研究,GPT‑4 都更少编造;在 OpenScholar 的分析里,GPT‑5 把 GPT‑4o 的比例大约降了一半。但没有一个接近零。(Tang 等人也提醒了一句公道话:数据库没匹配上的参考文献不一定是假的,因为检索本身可能漏掉真论文。)五条里编一条的模型,照样会把一篇假文献塞进你的参考文献列表。
模型为什么会写出不存在的 Paper
语言模型不查资料。它根据训练中学到的规律预测下一个 token,而参考文献对它来说只是又一段要预测的文字。Walters 和 Wilder 点出了症结:引用是「a special type of text for which predictive word choice, paraphrasing, and related techniques may be detrimental rather than useful」,也就是说,对这类文字,按概率挑词、换个说法这些本事反而有害。转述一个论点,是用自己的话讲;转述一个标题,就是引用了一篇没人写过的论文。
模型学会了参考文献长什么样,所以它写出来的东西格式都对:像模像样的作者,发这类主题的会议,说得通的年份。但格式对不对,和这篇 Paper 存不存在毫无关系。Tang 等人发现,模型写对的参考文献明显偏向高被引论文,他们推测这类论文在网上出现得多,训练数据里自然也多。OpenScholar 的作者对长尾知识也有同样的观察:模型见得越少的东西,错得越多。
还有个奇怪的细节。Agrawal 等人追问模型关于它自己给出的文献,发现 GPT‑4 等模型对编造的文献「often produce inconsistent author lists」,给出的作者名单前后不一;对真实的文献则「also often accurately recall the authors」,往往能准确说出作者。他们的解读是,问题的根源可能在「the generation (i.e., decoding) process」,也就是生成环节,而不在模型知道什么。模型并不是在骗你,它只是在补全一个模式,而这个过程中没有任何一步会停下来核对。
为什么光靠检索解决不了
最直接的办法是让模型先检索再引用。这有用,但只解决了大约一半。What Should I Cite?(WWW 2026)比较了有无检索时引用不存在论文的比例:检索让 GPT‑5 从 23.7% 降到 13.8%,Claude Sonnet 4 从 25.9% 降到 10.6%,Gemini 2.5 Pro 从 22.8% 降到 11.5%。好了很多,但仍是十条里有一条。
更大的问题是第二种失败:论文是真的,但它并没有说你那句话说的内容。HALoGEN(ACL 2025)的作者提醒:「even if references themselves are not hallucinated, LLMs may still attribute incorrect claims to them.」测量结果也是如此:
- Liu 等(Findings of EMNLP 2023)审查了四个生成式搜索引擎,只有 51.5% 的句子完全得到所附引用的支持,74.5% 的引用支持它所在的那句话。
- ALCE(EMNLP 2023)发现,在 ELI5 数据集上,即便是最好的模型,也有一半时间引用支持不完整。
- Magesh 等(Journal of Empirical Legal Studies 2025)测试了基于检索的商业法律研究工具,它们在 17% 到 33% 的查询上出现幻觉,而且研究的定义把错误地声称某个来源支持某个陈述也算作幻觉。
- DeepTRACE(ICLR 2026)审查了截至 2025 年 8 月的各家 Deep Research 产品,引用准确率从 Gemini Deep Research 的 40.3% 到 GPT‑5 Deep Research 的 79.1% 不等。
检索能把一篇真实论文放进上下文,但它不会让模型认真读这篇论文,也不会核对模型写下的那句话和它引用的段落是否对得上。
真正管用的办法
有四个设计能同时应对这两种失败。Lune 四条全都做到了,但它们没有一条是 Lune 独有的,你可以拿同一张清单去衡量任何工具。
一座封闭的文献库。 Lune 返回的每篇论文都是已知语料库里的真实记录,带有固定的标识和一个打得开的页面,所以取自检索结果的参考文献都能追溯。没有哪个工具能阻止模型自己添一条文献进去,所以检查方法很简单:草稿里对不上任何返回记录的那条参考文献,就是该删的。Lune 的语料库只收 CORE 与 CCF 排名的计算机顶会论文,不收开放网络上的内容。
读全文,而不是摘要。 OpenScholar 团队发现,即使 GPT‑4o 引用的是真实论文,「most of them are not substantiated by the corresponding abstracts」,多数都得不到所引摘要的支持。摘要只是概括,决定一个论断能否成立的数字、条件和限定都在正文里。只读摘要的系统,其余部分全靠猜。
逐句对照原文核查,并给出引文。 能抓住第二种失败的,是以句子为单位的核查:找到与这个论断相关的段落,原样引出;证据与论断相反,或者根本找不到证据,都要明确标出来。OpenScholar 自己的分析把效果归功于「reranking, self-feedback and verification」。Lune 的 verify_claims 会对每个论断给出「成立」「不成立」或「证据不足」的判定,只要判定附有引文,服务器就已确认这段引文确实出现在检索到的原文里。
允许说「没找到」。 一个必须每次都给出答案的工具,迟早会编。PaperAsk(WWW 2026)测试聊天助手检索论文时发现,「ChatGPT often withholds responses rather than risk errors, whereas Gemini produces fluent but fabricated answers.」宁可不答,也好过编一个。当没有相关结果达到门槛时,Lune 会把检索标记为低置信度,智能体就可以直说语料库没有覆盖这个问题,而不是拿一个勉强沾边的结果凑数。
投稿前,你可以自己做的检查
这不需要任何特定工具,只需要一个习惯:引用什么,就打开什么。
- 逐个解析 DOI 和 arXiv ID,核对标题、作者、会议和年份。真论文配错细节也是错:2025 年的一项研究里,GPT‑4o 给出的真实引用有 45% 带错,最常见的是 DOI 错误或无效。
- 给每个标题加引号搜索。搜不到就是危险信号,新近的论文尤其如此。
- 每一句带引用的话,都去被引论文里找到支持它的段落。找不到,就改写这句话,或者删掉这条引用。
- 越冷门的文献越要细查。模型对高被引论文的引用,准确率明显高于冷门论文。
- 把模型给出的参考文献当作待核实的线索,永远不要当成现成的参考文献列表。
ICLR、NeurIPS 和 ACL 都把责任算在作者头上,不管那条引用是谁敲进去的。出路不是不再用 AI 做文献工作,而是用只能引用自己打得开的论文的工具,其余的自己核对。想看这套流程从头到尾怎么跑,可以读用 Claude Code 做一次文献综述。
参考来源
- ACL 2026 程序委员会主席,关于撤回含幻觉引用论文的声明
- ICLR,ICLR 2026 评审流程回顾
- NeurIPS,2026 主会投稿手册
- Mata v. Avianca, Inc., No. 22-cv-1461 (S.D.N.Y. 2023),制裁意见与命令
- Walters 与 Wilder,「Fabrication and errors in the bibliographic citations generated by ChatGPT」,Scientific Reports 13, 14045 (2023)
- Chelli 等,「Hallucination Rates and Reference Accuracy of ChatGPT and Bard for Systematic Reviews」,Journal of Medical Internet Research 26, e53164 (2024)
- Agrawal 等,「Do Language Models Know When They're Hallucinating References?」,Findings of EACL 2024
- Asai 等,「Synthesizing scientific literature with retrieval-augmented language models」,Nature 650, 857-863 (2026)
- Tang 等,「Large Language Models for Automated Literature Review」,EMNLP 2025
- Linardon 等,「Influence of Topic Familiarity and Prompt Specificity on Citation Fabrication in Mental Health Research Using Large Language Models」,JMIR Mental Health 12, e80371 (2025)
- Zheng 等,「What Should I Cite? A RAG Benchmark for Academic Citation Prediction」,WWW 2026
- Ravichander 等,「HALoGEN: Fantastic LLM Hallucinations and Where to Find Them」,ACL 2025
- Liu、Zhang 与 Liang,「Evaluating Verifiability in Generative Search Engines」,Findings of EMNLP 2023
- Gao 等,「Enabling Large Language Models to Generate Text with Citations」,EMNLP 2023
- Magesh 等,「Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools」,Journal of Empirical Legal Studies 22, 216-242 (2025)
- Venkit 等,「DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence」,ICLR 2026
- Wu 等,「PaperAsk: A Benchmark for Reliability Evaluation of LLMs in Paper Search and Reading」,WWW 2026
