Lune

博客

AI 为什么会编造参考文献,又该怎么治

语言模型凭记忆写参考文献,所以有些文献根本不存在。研究测出了多高的比例,为什么光靠检索还不够,以及真正管用的办法。

约 8 分钟读完

ACL 2026 的程序委员会主席在核对录用论文的终稿时,发现 100 多篇引用了根本不存在的文献,于是撤回了这些论文的录用。ICLR 2026 更早一步:凡是经确认含有幻觉引用的投稿,一律直接拒稿。NeurIPS 2026 的投稿手册也写明,幻觉引用违反其行为准则。

假文献混进论文的路径其实很平常:有人让大模型列一份相关工作,模型给出一张看着没毛病的清单,没人点开核对。2023 年那起最出名的案子里,律师向法院提交了 ChatGPT 编造的判例,法院因此对他作出处罚。他在庭上说:「I just never thought it could be made up.」(我根本没想到它会是编的。)

它就是会编,而且比多数用户以为的更常见。下面讲清楚四件事:研究测出了什么,模型为什么会编,为什么加上检索只解决了一半,以及剩下一半怎么补。

模型编造文献有多频繁

下面每项研究对「假文献」的定义都不一样,所以每个数字都要连同它的测法一起看,不能拿来平均或排名。

研究检查了什么结果
Walters 与 Wilder,Scientific Reports 2023ChatGPT 就 42 个主题写的文献综述,共 636 条引用GPT‑3.5 有 55% 是编的,GPT‑4 为 18%
Chelli 等,JMIR 202411 篇系统综述的 471 条参考文献;标题、第一作者、年份错两项即算幻觉GPT‑3.5 为 39.6%,GPT‑4 为 28.6%,Bard 为 91.4%
Agrawal 等,Findings of EACL 2024每个模型生成 1,000 个计算机方向的标题,按完整标题做网络检索GPT‑4 有 46.8% 的标题查无此文
OpenScholar,Nature 2026用 Semantic Scholar 核对被引标题是否存在GPT‑4o 在计算机领域编造 78.7%,生物医学 94.8%;GPT‑5 仍有 39%
Tang 等,EMNLP 2025为 1,105 篇综述文章各生成 10 条参考文献(GPT‑5 为 651 篇)Claude 3.5 Sonnet 只有 51.6% 对得上真实 Paper,GPT‑5 只有 20.6%

新模型通常更好。凡是同时测过 GPT‑3.5 和 GPT‑4 的研究,GPT‑4 都更少编造;在 OpenScholar 的分析里,GPT‑5 把 GPT‑4o 的比例大约降了一半。但没有一个接近零。(Tang 等人也提醒了一句公道话:数据库没匹配上的参考文献不一定是假的,因为检索本身可能漏掉真论文。)五条里编一条的模型,照样会把一篇假文献塞进你的参考文献列表。

模型为什么会写出不存在的 Paper

语言模型不查资料。它根据训练中学到的规律预测下一个 token,而参考文献对它来说只是又一段要预测的文字。Walters 和 Wilder 点出了症结:引用是「a special type of text for which predictive word choice, paraphrasing, and related techniques may be detrimental rather than useful」,也就是说,对这类文字,按概率挑词、换个说法这些本事反而有害。转述一个论点,是用自己的话讲;转述一个标题,就是引用了一篇没人写过的论文。

模型学会了参考文献长什么样,所以它写出来的东西格式都对:像模像样的作者,发这类主题的会议,说得通的年份。但格式对不对,和这篇 Paper 存不存在毫无关系。Tang 等人发现,模型写对的参考文献明显偏向高被引论文,他们推测这类论文在网上出现得多,训练数据里自然也多。OpenScholar 的作者对长尾知识也有同样的观察:模型见得越少的东西,错得越多。

还有个奇怪的细节。Agrawal 等人追问模型关于它自己给出的文献,发现 GPT‑4 等模型对编造的文献「often produce inconsistent author lists」,给出的作者名单前后不一;对真实的文献则「also often accurately recall the authors」,往往能准确说出作者。他们的解读是,问题的根源可能在「the generation (i.e., decoding) process」,也就是生成环节,而不在模型知道什么。模型并不是在骗你,它只是在补全一个模式,而这个过程中没有任何一步会停下来核对。

为什么光靠检索解决不了

最直接的办法是让模型先检索再引用。这有用,但只解决了大约一半。What Should I Cite?(WWW 2026)比较了有无检索时引用不存在论文的比例:检索让 GPT‑5 从 23.7% 降到 13.8%,Claude Sonnet 4 从 25.9% 降到 10.6%,Gemini 2.5 Pro 从 22.8% 降到 11.5%。好了很多,但仍是十条里有一条。

更大的问题是第二种失败:论文是真的,但它并没有说你那句话说的内容。HALoGEN(ACL 2025)的作者提醒:「even if references themselves are not hallucinated, LLMs may still attribute incorrect claims to them.」测量结果也是如此:

  • Liu 等(Findings of EMNLP 2023)审查了四个生成式搜索引擎,只有 51.5% 的句子完全得到所附引用的支持,74.5% 的引用支持它所在的那句话。
  • ALCE(EMNLP 2023)发现,在 ELI5 数据集上,即便是最好的模型,也有一半时间引用支持不完整。
  • Magesh 等(Journal of Empirical Legal Studies 2025)测试了基于检索的商业法律研究工具,它们在 17% 到 33% 的查询上出现幻觉,而且研究的定义把错误地声称某个来源支持某个陈述也算作幻觉。
  • DeepTRACE(ICLR 2026)审查了截至 2025 年 8 月的各家 Deep Research 产品,引用准确率从 Gemini Deep Research 的 40.3% 到 GPT‑5 Deep Research 的 79.1% 不等。

检索能把一篇真实论文放进上下文,但它不会让模型认真读这篇论文,也不会核对模型写下的那句话和它引用的段落是否对得上。

真正管用的办法

有四个设计能同时应对这两种失败。Lune 四条全都做到了,但它们没有一条是 Lune 独有的,你可以拿同一张清单去衡量任何工具。

一座封闭的文献库。 Lune 返回的每篇论文都是已知语料库里的真实记录,带有固定的标识和一个打得开的页面,所以取自检索结果的参考文献都能追溯。没有哪个工具能阻止模型自己添一条文献进去,所以检查方法很简单:草稿里对不上任何返回记录的那条参考文献,就是该删的。Lune 的语料库只收 CORE 与 CCF 排名的计算机顶会论文,不收开放网络上的内容。

读全文,而不是摘要。 OpenScholar 团队发现,即使 GPT‑4o 引用的是真实论文,「most of them are not substantiated by the corresponding abstracts」,多数都得不到所引摘要的支持。摘要只是概括,决定一个论断能否成立的数字、条件和限定都在正文里。只读摘要的系统,其余部分全靠猜。

逐句对照原文核查,并给出引文。 能抓住第二种失败的,是以句子为单位的核查:找到与这个论断相关的段落,原样引出;证据与论断相反,或者根本找不到证据,都要明确标出来。OpenScholar 自己的分析把效果归功于「reranking, self-feedback and verification」。Lune 的 verify_claims 会对每个论断给出「成立」「不成立」或「证据不足」的判定,只要判定附有引文,服务器就已确认这段引文确实出现在检索到的原文里。

允许说「没找到」。 一个必须每次都给出答案的工具,迟早会编。PaperAsk(WWW 2026)测试聊天助手检索论文时发现,「ChatGPT often withholds responses rather than risk errors, whereas Gemini produces fluent but fabricated answers.」宁可不答,也好过编一个。当没有相关结果达到门槛时,Lune 会把检索标记为低置信度,智能体就可以直说语料库没有覆盖这个问题,而不是拿一个勉强沾边的结果凑数。

投稿前,你可以自己做的检查

这不需要任何特定工具,只需要一个习惯:引用什么,就打开什么。

  1. 逐个解析 DOI 和 arXiv ID,核对标题、作者、会议和年份。真论文配错细节也是错:2025 年的一项研究里,GPT‑4o 给出的真实引用有 45% 带错,最常见的是 DOI 错误或无效。
  2. 给每个标题加引号搜索。搜不到就是危险信号,新近的论文尤其如此。
  3. 每一句带引用的话,都去被引论文里找到支持它的段落。找不到,就改写这句话,或者删掉这条引用。
  4. 越冷门的文献越要细查。模型对高被引论文的引用,准确率明显高于冷门论文。
  5. 把模型给出的参考文献当作待核实的线索,永远不要当成现成的参考文献列表。

ICLR、NeurIPS 和 ACL 都把责任算在作者头上,不管那条引用是谁敲进去的。出路不是不再用 AI 做文献工作,而是用只能引用自己打得开的论文的工具,其余的自己核对。想看这套流程从头到尾怎么跑,可以读用 Claude Code 做一次文献综述。

参考来源

继续阅读

  1. CORE 与 CCF:计算机顶会排名怎么看

    CORE 的 A* 和 CCF 的 A 类分别是什么意思、由谁评定、两份名单在哪些会议上意见不一,以及怎样用排名又不误判一篇 Paper。

    约 6 分钟读完

  2. 用 Claude Code 做一次文献综述

    一次真实的演示:在 Claude Code 里多角度检索顶会 Paper,顺着引用往前往后追,读全文,列对比表,最后逐句对照原文核查。

    约 6 分钟读完

把顶会研究接入你的 AI 智能体

免费开始,无需绑卡

试用 Lune