微软与 OpenAI 内部文件披露了关于 AI 抓取和市场替代的承认
在《纽约时报》针对 OpenAI 和微软提起的版权诉讼中,未删减的法庭文件披露了内部承认的内容:AI 训练实践构成了对劳动成果的大规模挪用,并对它们所依赖的内容创作者构成了直接的经济威胁。这些文件表明,这些公司意识到其产品可能会替代原始来源,从而可能创造一个“厄运循环”,即 AI 摧毁了其自身数据供应链的经济基础。
关于“盗窃”和“生存威胁”的内部承认
内部通讯揭示了公开的“合理使用”辩护与私下高管评估之间的鲜明对比。微软应用科学总监 Brent Hecht 在 2023 年 1 月的一份内部备忘录中将 AI 抓取描述为“史无前例的惊人盗窃”和“人类历史上最大规模的劳动盗窃”。
同样,OpenAI 的领导层也承认了其技术的破坏性。ChatGPT 负责人 Nick Turley 写道,出版商面临着来自 AI 产品的“生存威胁”,这些产品“在很大程度上具有替代性”,并且随着技术的进步,这种替代性将越来越强。OpenAI 总裁 Greg Brockman 将这些模型描述为“非常擅长新闻”,而微软首席执行官 Satya Nadella 则作证称,聊天机器人的交互已经“替代”了用户访问原始来源网站的需求。
市场替代与“厄运循环”
微软的内部数据显示,将 Copilot 作为“答案引擎”部署后,流向原始出版商的流量显著减少。具体而言,与传统的 Bing 搜索结果相比,《纽约时报》域名的点击率下降了高达 93%。
在 2024 年 1 月的一次演示中,Brent Hecht 将这种趋势描述为“厄运循环”,并指出“终端产品威胁到其核心供应商的经济基础是非常罕见的”。这表明存在一种系统性风险,即 AI 在取代访问源网站需求方面的成功,通过摧毁产生高质量训练数据的生态系统,反而削弱了模型本身的性能。
关于绕过付费墙和剥离数据的指控
这些文件详细说明了 OpenAI 和微软获取训练数据的具体方法,包括涉嫌绕过付费墙和删除版权声明的行为。
- 绕过付费墙: 文件指控 OpenAI 研究人员开发了“黑客手段”来绕过《纽约时报》的付费墙,据报道,OpenAI 总裁 Greg Brockman 对此回应称“啊,不错”。
- 剥离版权: 据称,这些公司故意从训练数据中剥离版权声明,以防止模型向最终用户输出这些声明。
- 数据规模: 据报道,OpenAI 的训练中期数据集包含了超过 91,692 份来自《纽约时报》、《每日新闻》和《调查报道中心》的作品副本。仅一个源自 Common Crawl 的数据集就包含了超过 200 万份来自
nytimes.com的文档。 - 协作抓取: 该文件声称 OpenAI 向微软交付了 GPT-3 训练数据集,而微软则通过名为“Project Taxi”和“Project Mango”的项目向 OpenAI 提供训练数据。
法律背景与合理使用
这些承认使 AI 公司通常采用的“合理使用”辩护变得复杂。合理使用的核心支柱之一是新作品不得替代或损害原作品的市场。然而,关于“替代性”产品和点击率下降 93% 的内部承认,提供了 AI 模型直接与原始内容竞争的证据。
尽管特朗普政府最近提交了一份支持 OpenAI 未经许可使用版权材料的简报,但这些未密封的文件为原告提供了事实依据,以论证训练过程并非转换性使用,而是市场替代。
社区观点与反驳意见
技术社区之间的讨论突显了对 AI 训练本质的深刻分歧:
“这是对我们所有文化的掠夺,然后再加价卖回给我们……这么多人的毕生心血在没有考虑、补偿或同意的情况下被挪用。” — @handle
相反,一些人认为这个过程更类似于人类学习而非盗窃,并暗示版权法对于大语言模型(LLM)的规模来说已经力不从心:
“没有复制,只有搜集……我们作为一个社会明确决定这些抽象事物属于公共领域,而这些正是这些实验室所收获的东西。” — @handle
其他批评者指出了“劳动盗窃”这一措辞的讽刺意味,指出跨大西洋奴隶贸易等历史暴行才是人类历史上真正的最大规模劳动盗窃,并认为这种语言即使对于内部企业备忘录来说也过于夸张。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch