Microsoft 與 OpenAI 內部文件揭露關於 AI 抓取與市場替代的承認

來自《紐約時報》(The New York Times)針對 OpenAI 與 Microsoft 提起之版權訴訟的未經編輯文件顯示,內部承認 AI 訓練行為構成大規模的勞動挪用,並對其所依賴的內容創作者構成直接的經濟威脅。這些文件顯示,這些公司意識到其產品可能會取代原始來源,進而可能創造一個「毀滅循環」(doom loop),即 AI 摧毀了其自身數據供應鏈的經濟基礎。

關於「竊取」與「生存威脅」的內部承認

內部通訊揭露了公開的「合理使用」(fair use)辯護與私下高層評估之間的鮮明對比。Microsoft 應用科學總監 Brent Hecht 在 2023 年 1 月的一份內部備忘錄中,將 AI 抓取描述為「前所未有的驚人竊取」以及「人類歷史上最大規模的勞動竊取」。

同樣地,OpenAI 的領導層也承認了其技術的破壞性。ChatGPT 負責人 Nick Turley 寫道,出版商面臨來自 AI 產品的「生存威脅」,這些產品「很大程度上具有替代性」,且隨著技術進步,這種情況將日益嚴重。OpenAI 總裁 Greg Brockman 將這些模型描述為「非常擅長新聞」,而 Microsoft 執行長 Satya Nadella 則作證稱,聊天機器人的互動已經「替代」了用戶訪問原始來源網站的需求。

市場替代與「毀滅循環」

Microsoft 的內部數據顯示,將 Copilot 作為「答案引擎」部署後,已顯著減少了對原始出版商的流量。具體而言,與傳統的 Bing 搜尋結果相比,《紐約時報》網域的點擊率下降了高達 93%。

在 2024 年 1 月的一份簡報中,Brent Hecht 將這種趨勢描述為「毀滅循環」,並指出「最終產品威脅到其必要供應商的經濟基礎是非常罕見的」。這顯示了一種系統性風險,即 AI 在取代訪問來源網站需求方面的成功,透過摧毀產生高品質訓練數據的生態系統,反而削弱了模型本身的表現。

關於規避付費牆與數據剝離的指控

這些文件詳細說明了 OpenAI 和 Microsoft 用於獲取訓練數據的具體方法,包括涉嫌規避付費牆以及移除版權聲明。

  • 規避付費牆: 文件指控 OpenAI 研究人員開發了「駭客手段」來規避《紐約時報》的付費牆,據報導,OpenAI 總裁 Greg Brockman 對此回應稱「啊,不錯」。
  • 版權剝離: 據稱這些公司蓄意從訓練數據中剝離版權聲明,以防止模型向終端用戶輸出這些聲明。
  • 數據規模: 據報導,OpenAI 的訓練中期數據集包含超過 91,692 份來自《紐約時報》、《每日新聞》(Daily News)和《調查報導中心》(Center for Investigative Reporting)的作品。僅一個源自 Common Crawl 的數據集就包含了超過 200 萬份來自 nytimes.com 的文件。
  • 協作抓取: 該文件聲稱 OpenAI 將 GPT-3 訓練數據集交付給 Microsoft,而 Microsoft 則透過名為「Project Taxi」和「Project Mango」的計畫向 OpenAI 提供訓練數據。

法律背景與合理使用

這些承認使 AI 公司通常採用的「合理使用」辯護變得複雜。合理使用的一個關鍵支柱是,新作品不得替代或損害原始作品的市場。然而,關於「替代性」產品以及點擊率下降 93% 的內部承認,提供了 AI 模型直接與原始內容競爭的證據。

儘管川普政府最近提交了一份為 OpenAI 未經授權使用版權材料進行辯護的簡報,但這些解封的文件為原告提供了事實基礎,以主張訓練過程並非轉換性的,而是市場替代。

社群觀點與反駁意見

技術社群之間的討論凸顯了對 AI 訓練本質的深刻分歧:

「這是對我們所有文化的搶劫,然後再以加價的方式賣回給我們……這麼多人的畢生心血在沒有考慮、補償或同意的情況下被挪用。」

相反地,有些人認為這個過程更像是人類學習而非竊取,並暗示版權法對於 LLM 的規模來說顯得力不從心:

「沒有複製,只有拾穗……我們作為一個社會明確決定這些抽象事物屬於公共領域,而這些正是這些實驗室所收割的東西。」

其他批評者指出了「勞動竊取」這一措辭的諷刺意味,指出跨大西洋奴隸貿易等歷史暴行才代表了人類歷史上真正最大規模的勞動竊取,並認為這種語言即使對於內部企業備忘錄來說也過於誇張。

Sources

相關