假引用與 AI 生成論文氾濫同行評審:證據、影響與緩解
Fake Citations and AI‑Generated Papers Flood Peer Review: Evidence, Impact, and Mitigation
The crisis in a nutshell
Two reviewers flagged fabricated citations and author lists in 22 submissions to NeurIPS, WACV, and the TerraBytes workshop; 68 % of the papers showed clear signs of LLM‑generated slop, and two papers with invented authors were still accepted for oral talks. The prevalence of hallucinated references is now documented across tens of thousands of publications, and AI‑generated reviews are becoming common.
Scope of the problem
| 會議 | 審稿人 | 被標記的論文 | 總審稿數 |
|---|---|---|---|
| NeurIPS (Datasets & Benchmarks) | Caleb | 2 of 5 | 5 |
| NeurIPS (Position Paper) | Isaac | 2 of 2 | 2 |
| TerraBytes (ECCV workshop) | Caleb | 1 of 2 | 2 |
| Isaac | 4 of 5 | 5 | |
| WACV | Caleb | 3 of 4 | 4 |
| Isaac | 3 of 4 | 4 | |
| 總計 | Caleb | 6 of 11 (55 %) | 11 |
| Isaac | 9 of 11 (82 %) | 11 |
These numbers are a micro‑sample of a larger trend:
- Nature(2026 年 4 月) 估計 2025 年有數萬篇論文可能包含無效的 AI 生成引用。
- Zhao 等(arXiv 2026‑05‑07) 統計 2025 年在 arXiv、bioRxiv、SSRN 與 PubMed Central 中約 146,900 筆幻覺引用,其中 85.3% 持續出現在正式出版版本中。
- The Lancet(2026) 發現至少包含一筆虛構引用的論文比例從 1/2,828(2023 年)上升至 1/277(2026 年初)。
- Ansari(arXiv 2026‑02‑05) 審核了 NeurIPS 2025 中的 100 筆虛構引用;每筆引用均通過 3‑5 位專家審稿,且有 53 篇論文(約佔接受率的 1%)仍列入會議論文集。
AI‑generated reviews are also widespread
- Pangram(2025) 發現 21% 的 ICLR 2026 審稿完全由 AI 生成,超過一半的審稿顯示出部分 AI 參與。
- Gartenberg 等(2026) 報告 Organization Science 在 ChatGPT 之後的投稿激增 42%,且超過 30% 的同行審稿現在使用 AI。
- ICML 2026 發現 795 份審稿(約佔全部的 1%)違反了「禁止 LLM」政策。
- Li 等(2026) 顯示對抗性改寫的摘要可在 38% 的攻擊中將 AI 審稿者分數提升 +1.31(Gemini 3 Flash)或 +0.88(GPT 5.4 Mini)。
What reviewers observed
Worst offenders
Isaac: 兩篇稿件將真實作者換成虛構姓名;兩者皆在必須修正引用的條件下被接受為口頭報告。
Caleb: 一篇 53 頁的 NeurIPS 論文充斥幻覺術語與荒謬引用;另一篇 40 頁的論文在每個引用旁嵌入了 LLM 註解。
Relative severity of fake citations vs. fake authors
兩位審稿人皆同意,虛構的作者名單與完全捏造的引用同樣具破壞性,因為它們顯示出基本的審慎不足,並對整篇手稿產生疑慮。
Reliable “LLM‑written” tell‑tale signs
| 排名 | Caleb 的徵兆 | Isaac 的徵兆 |
|---|---|---|
| 1 | 重複的措辭(「不是 X,而是 Y」),粗體格式,破折號 | 文字與表格之間的指標不匹配 |
| 2 | 過於密集、難以解析的句子 | 冗長的討論段落僅重述數字 |
| 3 | 過度誇大結果 | 不尋常的冒號/分號使用,行銷式語言 |
How reviewing workflows have changed
- 先審參考文獻: 審稿人現在在摘要之後立即掃描參考文獻列表,常使用
bib‑audit技能。 - 加強即時拒稿的關注: 審稿人花更多時間搜尋虛構引用,以決定論文是否值得進行完整審稿。
- 時間分配: 大多數審稿人表示,他們相當大比例的精力現在用於偵測 AI 產物,而非評估科學價值,這引發了可持續性的擔憂。
Mitigation tool: bib‑audit
bib‑audit 是一個基於 Claude 的插件,具備以下功能:
- 解析
.bib、.bbl或 PDF 參考文獻,轉換為結構化欄位。 - 將每筆條目與 Crossref、arXiv、DataCite 與 Semantic Scholar 進行比對。
- 依嚴重程度優先標示不存在的作品、虛構作者、元資料不符與格式錯誤。
- 為缺少 DOI 或 arXiv ID 的條目提供建議性警告。
安裝(CLI)
claude plugin marketplace add isaaccley/skills
claude plugin install bib-audit@isaaccley-skills
在提交前對參考文獻執行此技能;它也可整合至 CI 流程,作為唯讀的預提交門檻。
Policy landscape
- NeurIPS 2025‑2026: 僅允許在授權實驗下使用 AI 輔助審稿;審稿人不得將稿件摘錄分享給外部 LLM。
- WACV 2026‑2027: 將 AI 生成的審稿標記為「高度不負責任」,並對違規審稿人進行制裁。
- ECCV 2026: 禁止任何 LLM 用於撰寫審稿或分享大量稿件內容。
Community perspectives (selected HN comments)
「此時的論文由 AI 撰寫、由 AI 審稿、由 AI 閱讀——我們正將人類從學術循環中自動化排除。」 – nneonneo
「假引用應視為抄襲;否則激勵結構仍然失衡。」 – DarkUranium
「若會議要求作者上傳參考文獻 PDF,許多幻覺引用可自動被捕捉。」 – leikarnes
「我們需要即時拒稿機制或標記工具;僅有披露政策不足以阻止不良行為者。」 – Isaac
Who bears responsibility?
兩位審稿人皆認為 作者 是主要肇事者,因為他們選擇提交低投入、AI 生成的稿件。然而,他們也指出 指導教授、程序主席與會議主辦單位 必須執行更嚴格的即時拒稿標準,並提供工具(例如 bib‑audit)以保護審稿人免受低質內容侵擾。
Takeaways for researchers and reviewers
- 絕不要提交未驗證的參考文獻。 在上傳前使用自動化參考文獻稽核與人工檢查。
- 若使用 LLM,必須積極編輯。 核對每筆生成的引用、指標與敘述,確保與原始來源相符。
- 審稿人應將虛構引用視為即時拒稿的依據。 分配少量、早期的參考文獻掃描,以免浪費精力。
- 會議需要可執行的政策與工具。 僅有披露不足以解決問題;必須有自動標記與明確懲罰。
References (human‑verified)
- Naddaf & Quill, Nature 2026 – 幻覺引用污染文獻。
- Zhao 等, arXiv 2605.07723 – 大規模的不存在引用證據。
- Topaz 等, The Lancet 2026 – 在 250 萬篇生醫論文中出現的虛構引用。
- Ansari, arXiv 2602.05930 – NeurIPS 2025 中 100 筆虛構引用的分類。
- Emi, Pangram blog 2025 – 21% 的 ICLR 2026 審稿為 AI 生成。
- Li 等, arXiv 2606.10159 – 利用 AI 輔助審稿的遊戲化手法。
- Gartenberg 等, Organization Science 2026 – 投稿與審稿的 AI 激增。
- Kamath, ICML blog 2026 – LLM 審稿政策的違規情形。
- Lipton & Steinhardt, Queue 2019 – 早期對機器學習論文「數學化」的批評。
Tools and policies referenced
bib-audit插件: https://github.com/isaaccley/skills/tree/main/plugins/bib-audit- John Owens 的參考文獻錯誤指南: https://www.ece.ucdavis.edu/~jowens/biberrors.html
- NeurIPS LLM 政策(2025)與 AI 審稿實驗(2026)
- WACV 審稿人指南(2026、2027)
- ECCV 2026 審稿政策