# AI 为什么会编造参考文献，又该怎么治

语言模型凭记忆写参考文献，所以有些文献根本不存在。研究测出了多高的比例，为什么光靠检索还不够，以及真正管用的办法。

发布于 2026-10-01

ACL 2026 的程序委员会主席在核对录用论文的终稿时，发现 100 多篇引用了根本不存在的文献，于是撤回了这些论文的录用。ICLR 2026 更早一步：凡是经确认含有幻觉引用的投稿，一律直接拒稿。NeurIPS 2026 的投稿手册也写明，幻觉引用违反其行为准则。

假文献混进论文的路径其实很平常：有人让大模型列一份相关工作，模型给出一张看着没毛病的清单，没人点开核对。2023 年那起最出名的案子里，律师向法院提交了 ChatGPT 编造的判例，法院因此对他作出处罚。他在庭上说：「I just never thought it could be made up.」（我根本没想到它会是编的。）

它就是会编，而且比多数用户以为的更常见。下面讲清楚四件事：研究测出了什么，模型为什么会编，为什么加上检索只解决了一半，以及剩下一半怎么补。

## 模型编造文献有多频繁

下面每项研究对「假文献」的定义都不一样，所以每个数字都要连同它的测法一起看，不能拿来平均或排名。

| 研究                                                                                             | 检查了什么                                                         | 结果                                                            |
| ------------------------------------------------------------------------------------------------ | ------------------------------------------------------------------ | --------------------------------------------------------------- |
| [Walters 与 Wilder](https://www.nature.com/articles/s41598-023-41032-5)，Scientific Reports 2023 | ChatGPT 就 42 个主题写的文献综述，共 636 条引用                    | GPT‑3.5 有 55% 是编的，GPT‑4 为 18%                             |
| [Chelli 等](https://www.jmir.org/2024/1/e53164)，JMIR 2024                                       | 11 篇系统综述的 471 条参考文献；标题、第一作者、年份错两项即算幻觉 | GPT‑3.5 为 39.6%，GPT‑4 为 28.6%，Bard 为 91.4%                 |
| [Agrawal 等](https://aclanthology.org/2024.findings-eacl.62/)，Findings of EACL 2024             | 每个模型生成 1,000 个计算机方向的标题，按完整标题做网络检索        | GPT‑4 有 46.8% 的标题查无此文                                   |
| [OpenScholar](https://www.nature.com/articles/s41586-025-10072-4)，Nature 2026                   | 用 Semantic Scholar 核对被引标题是否存在                           | GPT‑4o 在计算机领域编造 78.7%，生物医学 94.8%；GPT‑5 仍有 39%   |
| [Tang 等](https://luneresearch.com/zh-Hans/papers/e84b5dc7-47b0-4cbe-8f6d-a8da1b37040a)，EMNLP 2025                      | 为 1,105 篇综述文章各生成 10 条参考文献（GPT‑5 为 651 篇）         | Claude 3.5 Sonnet 只有 51.6% 对得上真实 Paper，GPT‑5 只有 20.6% |

新模型通常更好。凡是同时测过 GPT‑3.5 和 GPT‑4 的研究，GPT‑4 都更少编造；在 OpenScholar 的分析里，GPT‑5 把 GPT‑4o 的比例大约降了一半。但没有一个接近零。（Tang 等人也提醒了一句公道话：数据库没匹配上的参考文献不一定是假的，因为检索本身可能漏掉真论文。）五条里编一条的模型，照样会把一篇假文献塞进你的参考文献列表。

## 模型为什么会写出不存在的 Paper

语言模型不查资料。它根据训练中学到的规律预测下一个 token，而参考文献对它来说只是又一段要预测的文字。Walters 和 Wilder 点出了症结：引用是「a special type of text for which predictive word choice, paraphrasing, and related techniques may be detrimental rather than useful」，也就是说，对这类文字，按概率挑词、换个说法这些本事反而有害。转述一个论点，是用自己的话讲；转述一个标题，就是引用了一篇没人写过的论文。

模型学会了参考文献长什么样，所以它写出来的东西格式都对：像模像样的作者，发这类主题的会议，说得通的年份。但格式对不对，和这篇 Paper 存不存在毫无关系。Tang 等人发现，模型写对的参考文献明显偏向高被引论文，他们推测这类论文在网上出现得多，训练数据里自然也多。OpenScholar 的作者对长尾知识也有同样的观察：模型见得越少的东西，错得越多。

还有个奇怪的细节。[Agrawal 等人](https://aclanthology.org/2024.findings-eacl.62/)追问模型关于它自己给出的文献，发现 GPT‑4 等模型对编造的文献「often produce inconsistent author lists」，给出的作者名单前后不一；对真实的文献则「also often accurately recall the authors」，往往能准确说出作者。他们的解读是，问题的根源可能在「the generation (i.e., decoding) process」，也就是生成环节，而不在模型知道什么。模型并不是在骗你，它只是在补全一个模式，而这个过程中没有任何一步会停下来核对。

## 为什么光靠检索解决不了

最直接的办法是让模型先检索再引用。这有用，但只解决了大约一半。[What Should I Cite?](https://luneresearch.com/zh-Hans/papers/0d10d695-c86b-4812-8a30-5ccf007953d4)（WWW 2026）比较了有无检索时引用不存在论文的比例：检索让 GPT‑5 从 23.7% 降到 13.8%，Claude Sonnet 4 从 25.9% 降到 10.6%，Gemini 2.5 Pro 从 22.8% 降到 11.5%。好了很多，但仍是十条里有一条。

更大的问题是第二种失败：论文是真的，但它并没有说你那句话说的内容。[HALoGEN](https://luneresearch.com/zh-Hans/papers/f9e6eacf-1ac5-4dea-9a5f-f7266f2aca15)（ACL 2025）的作者提醒：「even if references themselves are not hallucinated, LLMs may still attribute incorrect claims to them.」测量结果也是如此：

- [Liu 等](https://aclanthology.org/2023.findings-emnlp.467/)（Findings of EMNLP 2023）审查了四个生成式搜索引擎，只有 51.5% 的句子完全得到所附引用的支持，74.5% 的引用支持它所在的那句话。
- [ALCE](https://luneresearch.com/zh-Hans/papers/904b10e7-a0c0-460e-9874-85c142af3eb5)（EMNLP 2023）发现，在 ELI5 数据集上，即便是最好的模型，也有一半时间引用支持不完整。
- [Magesh 等](https://onlinelibrary.wiley.com/doi/10.1111/jels.12413)（Journal of Empirical Legal Studies 2025）测试了基于检索的商业法律研究工具，它们在 17% 到 33% 的查询上出现幻觉，而且研究的定义把错误地声称某个来源支持某个陈述也算作幻觉。
- [DeepTRACE](https://luneresearch.com/zh-Hans/papers/b266c5a6-45e8-4b68-9691-70f2fa27623a)（ICLR 2026）审查了截至 2025 年 8 月的各家 Deep Research 产品，引用准确率从 Gemini Deep Research 的 40.3% 到 GPT‑5 Deep Research 的 79.1% 不等。

检索能把一篇真实论文放进上下文，但它不会让模型认真读这篇论文，也不会核对模型写下的那句话和它引用的段落是否对得上。

## 真正管用的办法

有四个设计能同时应对这两种失败。Lune 四条全都做到了，但它们没有一条是 Lune 独有的，你可以拿同一张清单去衡量任何工具。

**一座封闭的文献库。** Lune 返回的每篇论文都是已知语料库里的真实记录，带有固定的标识和一个打得开的页面，所以取自检索结果的参考文献都能追溯。没有哪个工具能阻止模型自己添一条文献进去，所以检查方法很简单：草稿里对不上任何返回记录的那条参考文献，就是该删的。Lune 的语料库只收 CORE 与 CCF 排名的计算机顶会论文，不收开放网络上的内容。

**读全文，而不是摘要。** OpenScholar 团队发现，即使 GPT‑4o 引用的是真实论文，「most of them are not substantiated by the corresponding abstracts」，多数都得不到所引摘要的支持。摘要只是概括，决定一个论断能否成立的数字、条件和限定都在正文里。只读摘要的系统，其余部分全靠猜。

**逐句对照原文核查，并给出引文。** 能抓住第二种失败的，是以句子为单位的核查：找到与这个论断相关的段落，原样引出；证据与论断相反，或者根本找不到证据，都要明确标出来。OpenScholar 自己的分析把效果归功于「reranking, self-feedback and verification」。Lune 的 `verify_claims` 会对每个论断给出「成立」「不成立」或「证据不足」的判定，只要判定附有引文，服务器就已确认这段引文确实出现在检索到的原文里。

**允许说「没找到」。** 一个必须每次都给出答案的工具，迟早会编。[PaperAsk](https://luneresearch.com/zh-Hans/papers/cf1c6daa-ac71-4903-a0be-a9b5c80639fe)（WWW 2026）测试聊天助手检索论文时发现，「ChatGPT often withholds responses rather than risk errors, whereas Gemini produces fluent but fabricated answers.」宁可不答，也好过编一个。当没有相关结果达到门槛时，Lune 会把检索标记为低置信度，智能体就可以直说语料库没有覆盖这个问题，而不是拿一个勉强沾边的结果凑数。

## 投稿前，你可以自己做的检查

这不需要任何特定工具，只需要一个习惯：引用什么，就打开什么。

1. 逐个解析 DOI 和 arXiv ID，核对标题、作者、会议和年份。真论文配错细节也是错：2025 年的一项研究里，GPT‑4o 给出的真实引用有 45% 带错，最常见的是 DOI 错误或无效。
2. 给每个标题加引号搜索。搜不到就是危险信号，新近的论文尤其如此。
3. 每一句带引用的话，都去被引论文里找到支持它的段落。找不到，就改写这句话，或者删掉这条引用。
4. 越冷门的文献越要细查。模型对高被引论文的引用，准确率明显高于冷门论文。
5. 把模型给出的参考文献当作待核实的线索，永远不要当成现成的参考文献列表。

ICLR、NeurIPS 和 ACL 都把责任算在作者头上，不管那条引用是谁敲进去的。出路不是不再用 AI 做文献工作，而是用只能引用自己打得开的论文的工具，其余的自己核对。想看这套流程从头到尾怎么跑，可以读[用 Claude Code 做一次文献综述](https://luneresearch.com/zh-Hans/blog/literature-review-with-claude-code)。

## 参考来源

- ACL 2026 程序委员会主席，[关于撤回含幻觉引用论文的声明](https://2026.aclweb.org/acl_statement/)
- ICLR，[ICLR 2026 评审流程回顾](https://blog.iclr.cc/2026/03/31/a-retrospective-on-the-iclr-2026-review-process/)
- NeurIPS，[2026 主会投稿手册](https://neurips.cc/Conferences/2026/MainTrackHandbook)
- Mata v. Avianca, Inc., No. 22-cv-1461 (S.D.N.Y. 2023)，[制裁意见与命令](https://storage.courtlistener.com/recap/gov.uscourts.nysd.575368/gov.uscourts.nysd.575368.54.0_3.pdf)
- Walters 与 Wilder，「Fabrication and errors in the bibliographic citations generated by ChatGPT」，[Scientific Reports 13, 14045 (2023)](https://www.nature.com/articles/s41598-023-41032-5)
- Chelli 等，「Hallucination Rates and Reference Accuracy of ChatGPT and Bard for Systematic Reviews」，[Journal of Medical Internet Research 26, e53164 (2024)](https://www.jmir.org/2024/1/e53164)
- Agrawal 等，「Do Language Models Know When They're Hallucinating References?」，[Findings of EACL 2024](https://aclanthology.org/2024.findings-eacl.62/)
- Asai 等，「Synthesizing scientific literature with retrieval-augmented language models」，[Nature 650, 857-863 (2026)](https://www.nature.com/articles/s41586-025-10072-4)
- Tang 等，「Large Language Models for Automated Literature Review」，[EMNLP 2025](https://luneresearch.com/zh-Hans/papers/e84b5dc7-47b0-4cbe-8f6d-a8da1b37040a)
- Linardon 等，「Influence of Topic Familiarity and Prompt Specificity on Citation Fabrication in Mental Health Research Using Large Language Models」，[JMIR Mental Health 12, e80371 (2025)](https://mental.jmir.org/2025/1/e80371)
- Zheng 等，「What Should I Cite? A RAG Benchmark for Academic Citation Prediction」，[WWW 2026](https://luneresearch.com/zh-Hans/papers/0d10d695-c86b-4812-8a30-5ccf007953d4)
- Ravichander 等，「HALoGEN: Fantastic LLM Hallucinations and Where to Find Them」，[ACL 2025](https://luneresearch.com/zh-Hans/papers/f9e6eacf-1ac5-4dea-9a5f-f7266f2aca15)
- Liu、Zhang 与 Liang，「Evaluating Verifiability in Generative Search Engines」，[Findings of EMNLP 2023](https://aclanthology.org/2023.findings-emnlp.467/)
- Gao 等，「Enabling Large Language Models to Generate Text with Citations」，[EMNLP 2023](https://luneresearch.com/zh-Hans/papers/904b10e7-a0c0-460e-9874-85c142af3eb5)
- Magesh 等，「Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools」，[Journal of Empirical Legal Studies 22, 216-242 (2025)](https://onlinelibrary.wiley.com/doi/10.1111/jels.12413)
- Venkit 等，「DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence」，[ICLR 2026](https://luneresearch.com/zh-Hans/papers/b266c5a6-45e8-4b68-9691-70f2fa27623a)
- Wu 等，「PaperAsk: A Benchmark for Reliability Evaluation of LLMs in Paper Search and Reading」，[WWW 2026](https://luneresearch.com/zh-Hans/papers/cf1c6daa-ac71-4903-a0be-a9b5c80639fe)
