伪造引用和 AI 生成论文淹没同行评审:证据、影响与缓解措施

危机概述

两位审稿人标记了 22 篇提交至 NeurIPS、WACV 和 TerraBytes 工作坊的伪造引用和作者名单;68% 的论文显示出明显的 LLM 生成内容痕迹,且两篇使用虚构作者的论文仍被接受为口头报告。幻觉引用的普遍性已在数万篇出版物中得到记录,AI 生成的评审也正变得常见。


问题范围

会议 审稿人 标记的论文 总审阅数
NeurIPS (Datasets & Benchmarks) Caleb 2 of 5 5
NeurIPS (Position Paper) Isaac 2 of 2 2
TerraBytes (ECCV workshop) Caleb 1 of 2 2
Isaac 4 of 5 5
WACV Caleb 3 of 4 4
Isaac 3 of 4 4
总计 Caleb 6 of 11 (55 %) 11
Isaac 9 of 11 (82 %) 11

这些数字是更大趋势的一个微观样本:

  • Nature(2026年4月) 估计 2025 年有数万篇论文可能包含无效的 AI 生成引用。
  • Zhao 等(arXiv 2026‑05‑07) 统计了 2025 年在 arXiv、bioRxiv、SSRN 和 PubMed Central 中约 146,900 条幻觉引用,其中 85.3% 持续出现在已发表的版本中。
  • The Lancet(2026) 发现至少包含一条伪造引用的论文比例从 1/2,828(2023 年)上升至 1/277(2026 年初)。
  • Ansari(arXiv 2026‑02‑05) 对 NeurIPS 2025 的 100 条伪造引用进行审计;每条引用均通过了 3‑5 位专家审稿人,且有 53 篇论文(约占接受论文的 1%)仍收录在会议论文集中。

AI 生成的评审也很普遍

  • Pangram(2025) 检测到 21% 的 ICLR 2026 评审是完全 AI 生成的,超过一半显示出一定的 AI 参与。
  • Gartenberg 等(2026) 报告称 Organization Science 在 ChatGPT 之后的投稿激增了 42%,且其同行评审中超过 30% 现在使用 AI。
  • ICML 2026 发现 795 篇评审(约占全部的 1%)违反了“禁止使用 LLM”政策。
  • Li 等(2026) 表明对抗性改写的摘要可以在 38% 的攻击中将 AI 评审者评分提升 +1.31(Gemini 3 Flash)或 +0.88(GPT 5.4 Mini)。

审稿人观察到的情况

最严重的违规者

Isaac: 两篇稿件将真实作者换成了虚构的姓名;两者均在需修正参考文献的条件下被接受为口头报告。

Caleb: 一篇 53 页的 NeurIPS 论文充斥着幻觉术语和毫无意义的引用;另一篇 40 页的论文在每条引用旁嵌入了 LLM 注释。

伪造引用与伪造作者的相对严重性

两位审稿人一致认为,伪造作者名单的危害与完全虚假的引用同等严重,因为它们表明缺乏基本的审慎,并对整篇手稿产生怀疑。

可靠的“LLM 编写”特征

排名 Caleb 的特征 Isaac 的特征
1 重复的措辞(“不是 X,而是 Y”),粗体格式,破折号 文本与表格之间的度量不匹配
2 过于密集、难以解析的句子 冗长的讨论部分,仅重复数字
3 对结果过度夸大 不寻常的冒号/分号使用,营销式语言

审稿工作流程的变化

  • 先审查参考文献: 评审现在在摘要之后立即扫描参考文献列表,常使用 bib‑audit 技能。
  • 加强 desk‑reject(直接拒稿)关注度: 评审花更多时间寻找伪造引用,以决定论文是否值得进行完整评审。
  • 时间分配: 大多数评审报告称,他们相当大的一部分精力现在用于检测 AI 人工制品,而非评估科学价值,这引发了可持续性担忧。

缓解工具:bib‑audit

bib‑audit 是一个基于 Claude 的插件,功能如下:

  1. .bib.bbl 或 PDF 参考文献解析为结构化字段。
  2. 将每条目与 Crossref、arXiv、DataCite 和 Semantic Scholar 进行匹配。
  3. 按严重程度优先标记不存在的作品、虚构作者、元数据不匹配以及格式错误。
  4. 对缺少 DOI 或 arXiv ID 的条目提供警示。

安装(CLI)

claude plugin marketplace add isaaccley/skills
claude plugin install bib-audit@isaaccley-skills

在提交前对参考文献运行此技能;它也可以集成到 CI 流水线中,作为只读的预提交门禁。

政策概况

  • NeurIPS 2025‑2026: 仅通过批准的实验允许 AI 辅助评审;评审不得将稿件摘录分享给外部 LLM。
  • WACV 2026‑2027: 将 AI 生成的评审标记为“高度不负责任”,并对违规评审者进行制裁。
  • ECCV 2026: 禁止在撰写评审或分享大量稿件内容时使用任何 LLM。

社区观点(精选 HN 评论)

“此时,论文由 AI 撰写,评审由 AI 完成,阅读也由 AI 进行——我们正在将人类从学术循环中自动化剔除。” – nneonneo

“伪造引用应当像剽窃一样处理;否则激励结构仍然失效。” – DarkUranium

“如果会议要求作者上传参考文献的 PDF,许多幻觉引用可以自动被捕获。” – leikarnes

“我们需要 desk‑reject 机制或标记工具;仅靠披露政策不足以阻止不良行为者。” – Isaac

谁应承担责任?

两位审稿人认为 作者 是主要责任人,因为他们选择提交低质量、AI 生成的稿件。然而,他们也指出 导师、项目主席和会议组织者 必须执行更严格的 desk‑reject 标准,并提供工具(例如 bib‑audit)以保护评审免受低劣稿件的侵扰。

对研究者和评审的要点

  1. 绝不提交未验证的参考文献的论文。 在上传前使用自动化参考文献审计并进行人工检查。
  2. 如果使用 LLM,需进行积极编辑。 将每个生成的引用、度量和陈述与原始来源核对。
  3. 评审应将伪造引用视为直接拒稿的依据。 分配一次小规模、早期的参考文献扫描,以避免浪费精力。
  4. 会议需要可执行的政策和工具。 仅靠披露不足以解决问题;需要自动化标记和明确的惩罚措施。

参考文献(人工核实)

  • Naddaf & Quill, Nature 2026 – 幻觉引用污染文献。
  • Zhao , arXiv 2605.07723 – 大规模不存在引用的证据。
  • Topaz , The Lancet 2026 – 在 250 万生物医学论文中出现的伪造引用。
  • Ansari, arXiv 2602.05930 – NeurIPS 2025 中 100 条伪造引用的分类。
  • Emi, Pangram 博客 2025 – 21% 的 ICLR 2026 评审为 AI 生成。
  • Li , arXiv 2606.10159 – 利用 AI 辅助同行评审的游戏化。
  • Gartenberg , Organization Science 2026 – 投稿和评审中的 AI 激增。
  • Kamath, ICML 博客 2026 – LLM 评审政策的违规情况。
  • Lipton & Steinhardt, Queue 2019 – 对机器学习论文中“数学化”现象的早期批评。

参考的工具和政策

Sources