伪造引用和 AI 生成论文淹没同行评审:证据、影响与缓解措施
危机概述
两位审稿人标记了 22 篇提交至 NeurIPS、WACV 和 TerraBytes 工作坊的伪造引用和作者名单;68% 的论文显示出明显的 LLM 生成内容痕迹,且两篇使用虚构作者的论文仍被接受为口头报告。幻觉引用的普遍性已在数万篇出版物中得到记录,AI 生成的评审也正变得常见。
问题范围
| 会议 | 审稿人 | 标记的论文 | 总审阅数 |
|---|---|---|---|
| NeurIPS (Datasets & Benchmarks) | Caleb | 2 of 5 | 5 |
| NeurIPS (Position Paper) | Isaac | 2 of 2 | 2 |
| TerraBytes (ECCV workshop) | Caleb | 1 of 2 | 2 |
| Isaac | 4 of 5 | 5 | |
| WACV | Caleb | 3 of 4 | 4 |
| Isaac | 3 of 4 | 4 | |
| 总计 | Caleb | 6 of 11 (55 %) | 11 |
| Isaac | 9 of 11 (82 %) | 11 |
这些数字是更大趋势的一个微观样本:
- Nature(2026年4月) 估计 2025 年有数万篇论文可能包含无效的 AI 生成引用。
- Zhao 等(arXiv 2026‑05‑07) 统计了 2025 年在 arXiv、bioRxiv、SSRN 和 PubMed Central 中约 146,900 条幻觉引用,其中 85.3% 持续出现在已发表的版本中。
- The Lancet(2026) 发现至少包含一条伪造引用的论文比例从 1/2,828(2023 年)上升至 1/277(2026 年初)。
- Ansari(arXiv 2026‑02‑05) 对 NeurIPS 2025 的 100 条伪造引用进行审计;每条引用均通过了 3‑5 位专家审稿人,且有 53 篇论文(约占接受论文的 1%)仍收录在会议论文集中。
AI 生成的评审也很普遍
- Pangram(2025) 检测到 21% 的 ICLR 2026 评审是完全 AI 生成的,超过一半显示出一定的 AI 参与。
- Gartenberg 等(2026) 报告称 Organization Science 在 ChatGPT 之后的投稿激增了 42%,且其同行评审中超过 30% 现在使用 AI。
- ICML 2026 发现 795 篇评审(约占全部的 1%)违反了“禁止使用 LLM”政策。
- Li 等(2026) 表明对抗性改写的摘要可以在 38% 的攻击中将 AI 评审者评分提升 +1.31(Gemini 3 Flash)或 +0.88(GPT 5.4 Mini)。
审稿人观察到的情况
最严重的违规者
Isaac: 两篇稿件将真实作者换成了虚构的姓名;两者均在需修正参考文献的条件下被接受为口头报告。
Caleb: 一篇 53 页的 NeurIPS 论文充斥着幻觉术语和毫无意义的引用;另一篇 40 页的论文在每条引用旁嵌入了 LLM 注释。
伪造引用与伪造作者的相对严重性
两位审稿人一致认为,伪造作者名单的危害与完全虚假的引用同等严重,因为它们表明缺乏基本的审慎,并对整篇手稿产生怀疑。
可靠的“LLM 编写”特征
| 排名 | Caleb 的特征 | Isaac 的特征 |
|---|---|---|
| 1 | 重复的措辞(“不是 X,而是 Y”),粗体格式,破折号 | 文本与表格之间的度量不匹配 |
| 2 | 过于密集、难以解析的句子 | 冗长的讨论部分,仅重复数字 |
| 3 | 对结果过度夸大 | 不寻常的冒号/分号使用,营销式语言 |
审稿工作流程的变化
- 先审查参考文献: 评审现在在摘要之后立即扫描参考文献列表,常使用
bib‑audit技能。 - 加强 desk‑reject(直接拒稿)关注度: 评审花更多时间寻找伪造引用,以决定论文是否值得进行完整评审。
- 时间分配: 大多数评审报告称,他们相当大的一部分精力现在用于检测 AI 人工制品,而非评估科学价值,这引发了可持续性担忧。
缓解工具:bib‑audit
bib‑audit 是一个基于 Claude 的插件,功能如下:
- 将
.bib、.bbl或 PDF 参考文献解析为结构化字段。 - 将每条目与 Crossref、arXiv、DataCite 和 Semantic Scholar 进行匹配。
- 按严重程度优先标记不存在的作品、虚构作者、元数据不匹配以及格式错误。
- 对缺少 DOI 或 arXiv ID 的条目提供警示。
安装(CLI)
claude plugin marketplace add isaaccley/skills
claude plugin install bib-audit@isaaccley-skills
在提交前对参考文献运行此技能;它也可以集成到 CI 流水线中,作为只读的预提交门禁。
政策概况
- NeurIPS 2025‑2026: 仅通过批准的实验允许 AI 辅助评审;评审不得将稿件摘录分享给外部 LLM。
- WACV 2026‑2027: 将 AI 生成的评审标记为“高度不负责任”,并对违规评审者进行制裁。
- ECCV 2026: 禁止在撰写评审或分享大量稿件内容时使用任何 LLM。
社区观点(精选 HN 评论)
“此时,论文由 AI 撰写,评审由 AI 完成,阅读也由 AI 进行——我们正在将人类从学术循环中自动化剔除。” – nneonneo
“伪造引用应当像剽窃一样处理;否则激励结构仍然失效。” – DarkUranium
“如果会议要求作者上传参考文献的 PDF,许多幻觉引用可以自动被捕获。” – leikarnes
“我们需要 desk‑reject 机制或标记工具;仅靠披露政策不足以阻止不良行为者。” – Isaac
谁应承担责任?
两位审稿人认为 作者 是主要责任人,因为他们选择提交低质量、AI 生成的稿件。然而,他们也指出 导师、项目主席和会议组织者 必须执行更严格的 desk‑reject 标准,并提供工具(例如 bib‑audit)以保护评审免受低劣稿件的侵扰。
对研究者和评审的要点
- 绝不提交未验证的参考文献的论文。 在上传前使用自动化参考文献审计并进行人工检查。
- 如果使用 LLM,需进行积极编辑。 将每个生成的引用、度量和陈述与原始来源核对。
- 评审应将伪造引用视为直接拒稿的依据。 分配一次小规模、早期的参考文献扫描,以避免浪费精力。
- 会议需要可执行的政策和工具。 仅靠披露不足以解决问题;需要自动化标记和明确的惩罚措施。
参考文献(人工核实)
- Naddaf & Quill, Nature 2026 – 幻觉引用污染文献。
- Zhao 等, arXiv 2605.07723 – 大规模不存在引用的证据。
- Topaz 等, The Lancet 2026 – 在 250 万生物医学论文中出现的伪造引用。
- Ansari, arXiv 2602.05930 – NeurIPS 2025 中 100 条伪造引用的分类。
- Emi, Pangram 博客 2025 – 21% 的 ICLR 2026 评审为 AI 生成。
- Li 等, arXiv 2606.10159 – 利用 AI 辅助同行评审的游戏化。
- Gartenberg 等, Organization Science 2026 – 投稿和评审中的 AI 激增。
- Kamath, ICML 博客 2026 – LLM 评审政策的违规情况。
- Lipton & Steinhardt, Queue 2019 – 对机器学习论文中“数学化”现象的早期批评。
参考的工具和政策
bib-audit插件:https://github.com/isaaccley/skills/tree/main/plugins/bib-audit- John Owens 的参考文献错误指南:https://www.ece.ucdavis.edu/~jowens/biberrors.html
- NeurIPS LLM 政策(2025)和 AI 评审实验(2026)
- WACV 评审指南(2026,2027)
- ECCV 2026 评审政策