ACM的提议:允许在数字图书馆上进行LLM训练——收益、风险与社区反应

ACM呼吁让LLM在其数字图书馆上进行训练

ACM认为,授予大型语言模型(LLMs)访问ACM数字图书馆的权限将提升AI的事实性并扩大计算研究的影响力,同时承认存在显著的归属、许可和集中风险。


为什么包含很重要

  • 可信的学术研究岌岌可危。 ACM的同行评审语料库是计算领域最权威的集合之一。将其排除在AI训练之外会导致知识工具低估高质量研究。
  • AI正成为主要的发现界面。 研究人员、工程师和政策制定者日益依赖AI驱动的文献综述、代码生成和语义搜索。如果缺少ACM内容,社区将失去对其工作如何被综合和应用的影响力。
  • 对作者的潜在好处。 负责任的包含可以提升LLM输出的事实依据,增加跨语言和地区的全球可及性,并创造类似引用的新指标(例如,AI中介的影响力)。许可收入还可以支持编辑、保存和会议活动。

“研究影响力可能越来越取决于不仅是引用和下载量,还取决于想法是否在AI系统中被呈现、综合和实际运用。” – Scott Delman,ACM出版总监

ACM识别的核心风险

  • 归属失误和幻觉。 当前的LLM经常省略引用或误传研究结果,这会削弱学术交流的信任。
  • 法律和技术合规。 许可必须执行透明的权利管理,防止未经授权的衍生作品,并确保作者保留对其论文使用方式的控制权。
  • 经济集中。 允许少数商业AI供应商拥有独家训练权可能导致价值集中,限制社区的议价能力。
  • LLM合作伙伴质量参差不齐。 并非所有AI项目都与ACM的使命高度一致;每项协议必须根据其保障措施和治理结构进行评估。

Hacker News上的社区反应

评论 要点 显著引用
@juancn 内容可能已经被抓取。 "他们可能已经抓取了它。"
@skippyfish 文章本身似乎是AI生成的,凸显了悖论。 "ACM一直在大量使用AI生成的内容……它是100% AI生成,充满了LLM的措辞。"
@Cynddl 指出虚伪:ACM的非营利使命与盈利许可之间的矛盾;作者未获得补偿。 "作为研究者……这是一堂虚伪的教科书。"
@spoaceman7777 认为阻止访问只会伤害遵守规则的学者。 "阻止访问只会伤害遵守规则的人。解除阻止让他们能够与违规者竞争。"
@rurban 建议分层模型:对开放权重模型免费,对封闭权重模型收费。 "所以对开放权重模型免费,对封闭权重模型收费。很简单。"
@etdznots 声称大多数ACM文本已在LLM训练语料库中。 "大多数ACM文本已经是所有前沿LLM预训练语料库的一部分。"
@jreynar 呼吁普遍免费访问,引用美国纳税人资助的研究要求。 "科学出版物应向所有人开放……研究应是共享的知识,供其他智能体构建。"
@stevenalowe 建议ACM自行在图书馆上训练模型。 "是的,请——更好的是,自己训练一个ACM模型。"

这些评论展示了观点的光谱:有些人认为此举不可避免且有益,另一些人则视其为背离ACM非营利精神,且许多人指出这些材料可能已经在LLM训练数据中。

ACM的计划前进路径

  1. 收集社区反馈。 ACM已发布Google表单,收集成员、作者和志愿者的意见。
  2. 制定治理框架。 任何许可协议都将包括归属保证、使用监控以及解决幻觉的机制。
  3. 探索分层许可。 可能在开放权重社区模型和封闭商业产品之间进行区分。
  4. 创建AI感知的影响指标。 跟踪ACM论文在检索增强生成(RAG)和其他AI驱动工作流中的使用情况,以补充传统引用。
  5. 维护作者权利。 确保作者保留对衍生使用的控制权,并在适用情况下获得适当的认可或补偿。

结论

ACM正积极讨论是否允许LLM在其数字图书馆上进行训练。组织认为,只要采取强有力的保障措施,收益——提升AI准确性、扩大传播以及可能的新收入——将超过风险。社区的意见将决定最终政策,结果将影响在AI时代学术计算知识的获取和利用方式。


关键要点: 是否向LLM开放ACM数字图书馆的决定取决于在更丰富、更准确的AI工具的前景与适当归属、法律合规以及保护计算社区学术生态系统之间取得平衡。

Sources