OpenAI 數據合作夥伴

OpenAI 已推出 Data Partnerships,這是一項旨在與組織合作,產出公開和私人資料集以用於 AI 模型訓練的計畫。此舉旨在擴大訓練資料的廣度,確保 AI 模型能深入理解各種主題、產業、文化和語言,OpenAI 認為這對於創造安全且有益的通用人工智慧(AGI)至關重要。

數據獲取目標與需求

OpenAI 正在尋找能反映人類社會且目前尚未輕易公開於線上的大規模資料集。該計畫專注於能表達人類意圖的資料,例如長篇寫作或對話,而非零散的片段。

主要的技術需求與能力包括:

  • Multimodal Support: OpenAI 可以處理文字、圖像、音訊和影片。
  • Data Digitization: 公司使用內部 AI 技術協助合作夥伴數位化和結構化資料。這包括用於 PDF 的世界級光學字元辨識(OCR)以及用於轉錄口語的自動語音辨識(ASR)。
  • Data Cleaning: OpenAI 提供與合作夥伴團隊合作,處理資料並移除自動生成的 artefact 或轉錄錯誤。
  • Exclusions: 該計畫明確排除包含敏感或個人資訊,或屬於第三方的資料集。

合作模式

組織可以透過兩種不同的途徑與 OpenAI 合作:

開源存檔

此途徑適合希望建立公開供任何人用於 AI 模型訓練的開源資料集的合作夥伴。OpenAI 也可能使用這些資料集來訓練額外的開源模型。

私人資料集

此途徑適合希望保持資料私有,同時提升 AI 對其特定領域理解的組織。這些資料集用於訓練專屬 AI 模型,包括基礎模型、微調模型和自訂模型。OpenAI 承諾將依照合作夥伴偏好的敏感度和存取控制來處理此資料。

真實世界應用與範例

OpenAI 已經在特定領域實施這些合作夥伴關係,以提升模型效能:

  • Language Support: OpenAI 與冰島政府和 Miøeind ehf 合作,整合策劃資料集以提升 GPT-4 對冰島語的表達能力。
  • Legal Understanding: 與非營利組織 Free Law Project 建立合作夥伴關係,將大量法律文件納入 AI 訓練,以民主化法律理解的存取。

Sources