OpenAI 数据合作伙伴

OpenAI 已推出数据合作伙伴计划,旨在与组织合作生成公共和私有数据集,用于 AI 模型训练。此举旨在扩大训练数据的广度,以确保 AI 模型能够深入理解各种学科、行业、文化和语言,OpenAI 表示这对于创建安全且有益的通用人工智能(AGI)至关重要。

数据获取目标与要求

OpenAI 正在寻找能够反映人类社会且目前不易在公开网络上获取的大规模数据集。该计划侧重于表达人类意图的数据,例如长篇写作或对话,而非零散的片段。

关键技术要求和能力包括:

  • 多模态支持:OpenAI 可以处理文本、图像、音频和视频。
  • 数据数字化:公司使用内部 AI 技术帮助合作伙伴数字化和结构化数据。这包括用于 PDF 的世界领先光学字符识别(OCR)以及用于转录口语的自动语音识别(ASR)。
  • 数据清洗:OpenAI 提供与合作伙伴团队协作处理数据,以去除自动生成的伪造物或转录错误。
  • 排除项:该计划明确排除包含敏感或个人信息,或属于第三方信息的数据集。

合作模式

组织可以通过两条不同的途径与 OpenAI 合作:

开源档案

此途径适用于希望创建可供任何人在 AI 模型训练中使用的开源数据集的合作伙伴。OpenAI 也可能使用这些数据集来训练额外的开源模型。

私有数据集

此途径适用于希望在保持数据私有的同时提升 AI 对其特定领域理解的组织。这些数据集用于训练专有 AI 模型,包括基础模型、微调模型和自定义模型。OpenAI 承诺将按照合作伙伴偏好的敏感度和访问控制来处理此数据。

实际应用与示例

OpenAI 已在这些合作伙伴关系中取得进展,以在特定领域提升模型性能:

  • 语言支持:OpenAI 与冰岛政府和 Miøeind ehf 合作,整合 curated 数据集以提升 GPT-4 使用冰岛语的能力。
  • 法律理解:OpenAI 与非营利组织 Free Law Project 建立合作,将大量法律文件纳入 AI 训练,以实现法律理解的民主化。

Sources