ACM 提議允許在數位圖書館上訓練大型語言模型 – 好處、風險與社群回應

ACM 提議允許在數位圖書館上訓練大型語言模型 – 好處、風險與社群回應

ACM 主張,允許大型語言模型存取其數位圖書館將提升 AI 的準確性並擴大研究影響力,同時也承認存在署名、授權與集中化的風險。

ACM 提議允許在數位圖書館上訓練大型語言模型 – 好處、風險與社群回應

ACM 呼籲允許大型語言模型在其數位圖書館上訓練

ACM 主張,允許大型語言模型(LLMs)存取 ACM 數位圖書館將提升 AI 的事實性並擴大計算研究的影響力,同時也承認存在顯著的署名、授權與集中化風險。


為何納入很重要

  • 可信的學術研究正受到威脅。 ACM 的同行審查語料庫是計算領域最具權威性的收藏之一。若將其排除於 AI 訓練之外,可能會產生低估高品質研究的知識工具。
  • AI 正成為主要的探索介面。 研究人員、工程師與政策制定者日益依賴 AI 驅動的文獻回顧、程式碼生成與語意搜尋。若缺少 ACM 內容,社群將失去對其工作如何被綜合與應用的影響力。
  • 對作者的潛在好處。 負責任的納入可以提升 LLM 輸出的事實基礎,增加跨語言與地區的全球可及性,並創造類似引用的全新指標(例如 AI 中介的影響力)。授權收入亦可支援編輯、保存與會議活動。

"研究影響力可能越來越取決於不僅是引用與下載次數,還包括想法是否在 AI 系統中被呈現、綜合與落實。" – Scott Delman, ACM 出版主管


ACM 所辨識的核心風險

  • 署名失敗與幻覺。 目前的 LLM 常常省略引用或曲解研究結果,這可能削弱對學術傳播的信任。
  • 法律與技術合規。 授權必須執行透明的權利管理,防止未經授權的衍生作品,並確保作者保有對其論文使用方式的控制權。
  • 經濟集中。 允許少數商業 AI 供應商取得獨家訓練權限可能導致價值集中,限制社群的議價能力。
  • LLM 合作夥伴品質參差不齊。 並非所有 AI 計畫都與 ACM 的使命相符;每項協議必須根據其防護措施與治理結構進行評估。

Hacker News 上的社群回應

評論 主要觀點 顯著引述
@juancn 內容可能已被抓取。 "他們可能已經抓取過了。"
@skippyfish 文章本身似乎是 AI 生成的,凸顯矛盾。 "ACM 已經大量傾向於 AI 生成的內容…它是 100% AI 生成,充滿 LLM 的術語。"
@Cynddl 指出虛偽:ACM 的非營利使命與營利授權的矛盾;作者未獲補償。 "作為研究者…這是一堂偽善的大師課。"
@spoaceman7777 主張封鎖存取只會傷害遵守規則的學者。 "封鎖存取只會傷害遵守規則的人。解除封鎖讓他們能與違規者競爭。"
@rurban 建議分層模式:對開放權重模型免費,對封閉權重模型收費。 "所以對開放權重模型免費,對封閉權重模型收費。簡單。"
@etdznots 聲稱大多數 ACM 文字已在 LLM 訓練語料庫中。 "大多數 ACM 文字已經是所有前沿 LLM 預訓練語料庫的一部分。"
@jreynar 呼籲普遍免費存取,引用美國納稅人資助的研究要求。 "科學出版物應對所有人開放存取…研究應是共享的知識,讓其他智慧體能夠在此基礎上發展。"
@stevenalowe 建議 ACM 自行在圖書館上訓練模型。 "是的,請這樣做——更好的是,自己訓練 ACM 模型。"

這些評論揭示了多元的觀點:有些人認為此舉不可避免且有益,另一些人則視之為背離 ACM 非營利精神,還有許多人指出這些資料可能已在 LLM 訓練資料中。


ACM 計畫的前進路徑

  1. 收集社群回饋。 ACM 已發布 Google 表單,以收集會員、作者與志工的意見。
  2. 制定治理框架。 任何授權協議都將包含署名保證、使用監控,以及處理幻覺的機制。
  3. 探索分層授權。 可能在開放權重社群模型與封閉商業產品之間做區分。
  4. 建立 AI 感知的影響指標。 追蹤 ACM 論文在檢索增強生成(RAG)及其他 AI 驅動工作流程中的使用情形,以補足傳統引用。
  5. 維護作者權利。 確保作者保有對衍生使用的控制權,並在適用時獲得適當的認可或補償。

重點結論

ACM 正在積極討論是否允許 LLM 在其數位圖書館上訓練。該組織認為,只要設置完善的防護措施,利益——提升 AI 準確度、擴大傳播以及可能的新增收入——將超過風險。社群的意見將形塑最終政策,且結果將影響 AI 時代學術計算知識的取得與運用方式。


關鍵要點: 是否開放 ACM 數位圖書館給 LLM,取決於在更豐富、更精確的 AI 工具承諾與適當署名、法律合規以及保護計算社群學術生態系之需求之間取得平衡。

Sources