arXiv 對幻覺引用之打擊:AI 時代的問責制

大型語言模型 (LLMs) 整合進學術工作流程已加速了研究產出,但也引入了一個危險的趨勢: 「slop」(AI 生成內容)的激增——這些內容看起來權威,但事實上是錯誤的。最值得注意的是,「幻覺引用」(hallucinated references)現象——即引用不存在的論文——已開始污染科學記錄。

為了應對這一點,arXiv 正在實施一項嚴格的新政策,以確保學術交流的完整性。這項倡議的核心是回歸基本的學術問責制:即無論使用何種工具生成內容,人類作者應對其提交作品中的每一個字和引用負全部責任。

新的執行政策

根據 Thomas G. Dietterich 的說法,arXiv 的行為準則明確規定,透過在論文上簽名,作者即承擔其內容的全責。為了執行這一點,arXiv 正針對提交包含幻覺引用的論文者引入嚴厲的處罰。

對於提交此類作品的建議處罰是 arXiv 一年禁令。在禁令到期後,作者重返該平台的途徑並非立即生效;隨後的提交必須先在聲譽良好的同行評審場合被接受,然後才能上傳到預印本伺服器。

為何這對科學至關重要

對於研究社群的許多人來說,此舉被視為必要的干預。學術文獻目前正面臨品質危機,AI 生成的填充內容和不準確之處正大量湧入,使得研究人員更難找到真正的見解。

正如一位社群成員所指出的:

"Academic literature is in crisis because of all of the slop. Forcing some consequences on easily-detectable hallucinations can only be a good thing."

透過將 arXiv 的使用權視為一種特權而非權利,該平台旨在遏制在使用生成式 AI 時常伴隨的「提交後即不管」的心態。其目標是迫使作者手動驗證每一個引用,確保科學對話保持在現實基礎之上。

挑戰與倫理考量

雖然社群普遍支持對作弊行為的打擊,但該政策也引發了關於 AI 輔助研究界限的重要問題。

驗證負擔

一個主要的擔憂是,在快速發展的領域(例如推理代理或自主 AI)中驗證引用的難度。由於這些領域的發展速度快於傳統索引,驗證的負擔對作者而言變得更加繁重。

自主發現的問題

對於 AI 在發現中的角色也存在更深層的哲學問題。如果 AI 自主生成了一個形式化證明的結果——例如黎曼猜想的證明——社群必須決定,在技術上正確但由機器端到端生成的條件下,這樣的結果是否在這些規則下是被允許的。

給研究人員的教訓

對作者而言,教訓很明確:仔細審查你的草稿。存在「AI slop」(未經過濾的 LLM 輸出)不僅是專業上的尷尬,現在更是一種責任,可能導致被逐出全球最重要的預印本伺服器之一長達一年。

正如一位研究人員所警告的,審稿人越來越擅長發現 AI 生成文本的特徵。在論文中留下明顯的 AI 痕跡並提交論文,將是通往「惡劣的修改要求」的捷徑,且根據新政策,這可能會在一個人的專業記錄上留下永久性的污點。

Sources