OpenAI 对数据和 AI 的方法
OpenAI 正在开发一款名为 Media Manager 的新工具,为创作者和内容所有者提供直接控制其作品是否被纳入或排除在机器学习研究和训练之外的能力。此举是更广泛战略的一部分,旨在为 AI 时代的内容建立社会契约,在多样化训练数据的需求与创作者和出版商的权利之间取得平衡。
Media Manager 与创作者控制
OpenAI 正在构建 Media Manager,为内容所有者提供一种可扩展的解决方案,以表达他们对 AI 训练的偏好。虽然 OpenAI 之前率先使用网络爬虫权限(类似 robots.txt 标准)让出版商选择退出训练,但公司承认这些信号并不完整,因为许多创作者并不控制其内容所在的网站。
关键细节包括:
- Timeline:目标是在 2025 年之前完成该工具的部署。
- Technical Requirement:开发该工具需要前沿的机器学习研究,以在多个来源中识别受版权保护的文本、图像、音频和视频。
- Objective:OpenAI 希望 Media Manager 能够为创作者管理其内容与 AI 系统关系设立行业标准。
数据来源与模型训练
OpenAI 从头开始训练每一代基础模型,使用规模和多样性不断提升的数据集,以提升模型的知识、理解和语言能力。公司依赖三大类数据:
- Publicly Available Data:包括行业标准的机器学习数据集和网络爬取。OpenAI 排除带有付费墙的来源、主要聚合个人身份信息(PII)的来源、违反公司政策的来源,或已明确选择退出的来源。
- Proprietary Data Partnerships:OpenAI 与合作伙伴合作获取非公开内容,如档案和元数据。示例包括用于 Sora 训练的私人视频库以及与冰岛政府的合作,以保存本土语言。OpenAI 表示不会为已经纯粹公开的信息寻求付费合作。
- Human Feedback:模型通过 AI 训练师、红队成员、员工以及通过数据控制设置选择参与模型改进的用户的反馈进行优化。
出版商合作与内容发现
为了从“注意力经济”转向赋能创作者的模式,OpenAI 正在将出版商内容直接整合到其产品中,以提升可见度并加强用户与原始来源的联系。
- Source Attribution:ChatGPT 已更新以改进来源链接,为用户提供更好的上下文,并为出版商提供与受众连接的新方式。
- Strategic Partnerships:OpenAI 已与全球新闻机构建立合作关系,包括 Financial Times、Le Monde、Prisa Media 和 Axel Springer,以在 ChatGPT 中展示其内容并提升新闻编辑室可用的工具。
- Educational Partnerships:与 Khan Academy 和 ExamSolutions 的合作用于提升模型的数学表现,以扩展个性化 AI 辅导。
数据隐私与使用政策
OpenAI 对用于训练的数据设定了明确的界限,以保护隐私和商业机密:
- Business Data:OpenAI 不会使用来自 ChatGPT Team、ChatGPT Enterprise 或 API 平台的数据进行训练。
- User Control:ChatGPT Free 和 Plus 用户可以通过账户设置管理其数据是否用于未来模型改进。
- Sensitive Information:公司采用技术降低对个人和敏感信息的处理,并专门训练模型以避免提供关于个人的私人或敏感数据。
Sources
- OriginalOur approach to data and AI