arXiv 对幻觉引用的打击:AI 时代的问责制
大语言模型 (LLMs) 与学术工作流的整合加速了研究产出,但也引入了一种危险的趋势:"slop"(即看起来权威但事实错误的 AI 生成内容)的激增。最值得注意的是,"幻觉引用"(即引用不存在的论文)这一现象已开始污染科学记录。
作为回应,arXiv 正在实施一项严格的新政策,以确保学术交流的完整性。这项举措的核心是回归基本的学术问责制:即无论使用何种工具生成内容,人类作者应对其提交的所有文字和引用承担全部责任。
新的执行政策
根据 Thomas G. Dietterich 的说法,arXiv 的行为准则明确规定,通过在论文上签名,作者对其内容承担全部责任。为了执行这一点,arXiv 正在对提交包含幻觉引用的论文的人员引入严厉的处罚。
对于提交此类作品的拟议处罚是 arXiv 一年禁令。在该禁令到期后,作者重返该平台的路径并非立即生效;随后的提交必须首先在声誉良好的同行评审机构被接收,然后才能上传到预印本服务器。
为什么这对科学很重要
对于研究界的许多人来说,这一举措被视为一次必要的干预。学术文献目前正面临质量危机,AI 生成的填充内容和不准确之处大量涌入,使得研究人员更难发现真实的见解。
正如一位社区成员所指出的:
"学术文献正因为所有的 slop 而陷入危机。对易于检测到的幻觉强加一些后果只能是一件好事。"
通过将 arXiv 的访问权限视为一种特权而非权利,该平台旨在遏制通常伴随生成式 AI 使用而来的"提交即忘"心态。其目标是迫使作者手动验证每一个引用,确保科学对话保持在现实基础上。
挑战与伦理考量
虽然社区普遍支持打击作弊行为,但该政策也引发了关于 AI 辅助研究边界的重要问题。
验证负担
在一个快速发展的领域,例如推理智能体 (reasoning agents) 或自主 AI,验证引用是非常困难的。由于这些领域的发展速度快于传统的索引速度,验证的负担对作者来说变得更加沉重。
自主发现的问题
关于 AI 在发现中的作用,还存在一个更深层次的哲学问题。如果一个 AI 自主生成了一个形式化证明的结果——例如黎曼猜想 (Riemann Hypothesis) 的证明——社区必须决定,如果该结果在技术上是正确的,但完全由机器端到端生成,那么根据这些规则,此类结果是否是被允许的。
给研究人员的教训
对于作者而言,教训是显而易见的:仔细审查你的草稿。"AI slop"(即未经筛选的 LLM 输出)的存在不仅是职业上的尴尬,现在更是一种可能导致被逐出全球最重要的预印本服务器之一长达一年的责任风险。
正如一位研究人员所警告的,审稿人越来越擅长识别 AI 生成文本的特征。在提交的论文中留下字面意义上的 AI 痕迹,是通往"难缠的修改请求"的快车道,并且根据新政策,可能会在个人的职业记录上留下永久性的污点。