OpenAI 与新闻业:对《纽约时报》诉讼的回应

OpenAI 公开回应了《纽约时报》提起的诉讼,声明这些指控毫无依据,并主张在公开可得的互联网材料上训练 AI 模型属于合理使用。公司坚持支持新闻业,并积极致力于消除模型输出中对训练数据的“重复出现”。

AI 训练作为合理使用及退出机制

OpenAI 主张,使用公开可得的互联网材料训练 AI 模型在长期先例下属于合理使用。公司认为这一原则对创新者至关重要,并且对保持美国在 AI 领域的竞争力至关重要。

为支持这一立场,OpenAI 引用了向美国版权局提交评论的广泛支持者,包括:

  • 学者
  • 图书馆协会
  • 民间社会组织
  • 初创公司
  • 美国领先公司
  • 创作者和作者

OpenAI 还指出,欧盟、日本、新加坡和以色列也有类似法律允许在受版权保护的内容上训练模型。尽管在合理使用上持有法律立场,OpenAI 为出版商提供了一个简便的退出流程,以阻止其工具访问其网站,该流程已于 2023 年 8 月被《纽约时报》采用。

处理内容“重复出现”

OpenAI 将“重复出现”(即对特定训练数据的记忆)定义为学习过程中的罕见失误。公司表示,模型的设计目的是学习通用概念并将其应用于新问题,而非记忆特定文本。

OpenAI 认为,当内容在不同公共网站上出现多次时,重复出现的情况更为常见。为此,公司已采取措施限制无意的记忆。OpenAI 还强调,故意操纵模型重复出现内容违反其使用条款。

与新闻机构的合作

OpenAI 旨在通过合作伙伴关系支持健康的新闻生态系统,重点关注三个主要目标:

  1. 运营支持:部署产品帮助记者和编辑完成耗时任务,例如翻译报道和分析大量公共记录。
  2. 模型增强:在额外的历史性、非公开内容上训练模型。
  3. 读者连接:在 ChatGPT 中实时显示带有署名的内容,为出版商提供与读者连接的新方式。

现有合作伙伴包括美联社、Axel Springer、美国新闻项目和纽约大学。

对《纽约时报》指控的回应

OpenAI 声称,《纽约时报》未完整呈现其法律争议的全貌。公司表示,关于在 ChatGPT 中实时显示并署名的高价值合作伙伴关系的谈判一直进展顺利,直至 2023 年 12 月 19 日。

关于内容重复出现的指控,OpenAI 断言:

  • 《纽约时报》在谈判期间屡次拒绝提供重复出现的示例,尽管 OpenAI 承诺进行调查。
  • 《纽约时报》引用的示例似乎是多年以前的文章,已在第三方网站上广泛传播。
  • 《纽约时报》可能使用了对抗性提示,包括长篇文章摘录,故意诱导模型重复出现内容,这并非典型的用户行为。

Sources