ACM 提議允許在數位圖書館上訓練大型語言模型 – 好處、風險與社群回應
ACM 提議允許在數位圖書館上訓練大型語言模型 – 好處、風險與社群回應
ACM 主張,允許大型語言模型存取其數位圖書館將提升 AI 的準確性並擴大研究影響力,同時也承認存在署名、授權與集中化的風險。
ACM 提議允許在數位圖書館上訓練大型語言模型 – 好處、風險與社群回應
ACM 呼籲允許大型語言模型在其數位圖書館上訓練
ACM 主張,允許大型語言模型(LLMs)存取 ACM 數位圖書館將提升 AI 的事實性並擴大計算研究的影響力,同時也承認存在顯著的署名、授權與集中化風險。
為何納入很重要
- 可信的學術研究正受到威脅。 ACM 的同行審查語料庫是計算領域最具權威性的收藏之一。若將其排除於 AI 訓練之外,可能會產生低估高品質研究的知識工具。
- AI 正成為主要的探索介面。 研究人員、工程師與政策制定者日益依賴 AI 驅動的文獻回顧、程式碼生成與語意搜尋。若缺少 ACM 內容,社群將失去對其工作如何被綜合與應用的影響力。
- 對作者的潛在好處。 負責任的納入可以提升 LLM 輸出的事實基礎,增加跨語言與地區的全球可及性,並創造類似引用的全新指標(例如 AI 中介的影響力)。授權收入亦可支援編輯、保存與會議活動。
"研究影響力可能越來越取決於不僅是引用與下載次數,還包括想法是否在 AI 系統中被呈現、綜合與落實。" – Scott Delman, ACM 出版主管
ACM 所辨識的核心風險
- 署名失敗與幻覺。 目前的 LLM 常常省略引用或曲解研究結果,這可能削弱對學術傳播的信任。
- 法律與技術合規。 授權必須執行透明的權利管理,防止未經授權的衍生作品,並確保作者保有對其論文使用方式的控制權。
- 經濟集中。 允許少數商業 AI 供應商取得獨家訓練權限可能導致價值集中,限制社群的議價能力。
- LLM 合作夥伴品質參差不齊。 並非所有 AI 計畫都與 ACM 的使命相符;每項協議必須根據其防護措施與治理結構進行評估。
Hacker News 上的社群回應
| 評論 | 主要觀點 | 顯著引述 |
|---|---|---|
| @juancn | 內容可能已被抓取。 | "他們可能已經抓取過了。" |
| @skippyfish | 文章本身似乎是 AI 生成的,凸顯矛盾。 | "ACM 已經大量傾向於 AI 生成的內容…它是 100% AI 生成,充滿 LLM 的術語。" |
| @Cynddl | 指出虛偽:ACM 的非營利使命與營利授權的矛盾;作者未獲補償。 | "作為研究者…這是一堂偽善的大師課。" |
| @spoaceman7777 | 主張封鎖存取只會傷害遵守規則的學者。 | "封鎖存取只會傷害遵守規則的人。解除封鎖讓他們能與違規者競爭。" |
| @rurban | 建議分層模式:對開放權重模型免費,對封閉權重模型收費。 | "所以對開放權重模型免費,對封閉權重模型收費。簡單。" |
| @etdznots | 聲稱大多數 ACM 文字已在 LLM 訓練語料庫中。 | "大多數 ACM 文字已經是所有前沿 LLM 預訓練語料庫的一部分。" |
| @jreynar | 呼籲普遍免費存取,引用美國納稅人資助的研究要求。 | "科學出版物應對所有人開放存取…研究應是共享的知識,讓其他智慧體能夠在此基礎上發展。" |
| @stevenalowe | 建議 ACM 自行在圖書館上訓練模型。 | "是的,請這樣做——更好的是,自己訓練 ACM 模型。" |
這些評論揭示了多元的觀點:有些人認為此舉不可避免且有益,另一些人則視之為背離 ACM 非營利精神,還有許多人指出這些資料可能已在 LLM 訓練資料中。
ACM 計畫的前進路徑
- 收集社群回饋。 ACM 已發布 Google 表單,以收集會員、作者與志工的意見。
- 制定治理框架。 任何授權協議都將包含署名保證、使用監控,以及處理幻覺的機制。
- 探索分層授權。 可能在開放權重社群模型與封閉商業產品之間做區分。
- 建立 AI 感知的影響指標。 追蹤 ACM 論文在檢索增強生成(RAG)及其他 AI 驅動工作流程中的使用情形,以補足傳統引用。
- 維護作者權利。 確保作者保有對衍生使用的控制權,並在適用時獲得適當的認可或補償。
重點結論
ACM 正在積極討論是否允許 LLM 在其數位圖書館上訓練。該組織認為,只要設置完善的防護措施,利益——提升 AI 準確度、擴大傳播以及可能的新增收入——將超過風險。社群的意見將形塑最終政策,且結果將影響 AI 時代學術計算知識的取得與運用方式。
關鍵要點: 是否開放 ACM 數位圖書館給 LLM,取決於在更豐富、更精確的 AI 工具承諾與適當署名、法律合規以及保護計算社群學術生態系之需求之間取得平衡。