OpenAI 對資料與 AI 的方法
OpenAI 正在開發一項名為 Media Manager 的新工具,讓創作者與內容擁有者能直接控制其作品是否被納入機器學習研究與訓練。此舉是建立 AI 時代內容社會契約的更廣泛策略之一,旨在平衡多元訓練資料的需求與創作者、出版者的權利。
Media Manager 與創作者控制
OpenAI 正在打造 Media Manager,以提供內容擁有者一個可擴展的方式,表達他們對 AI 訓練的偏好。雖然 OpenAI 先前率先使用網路爬蟲權限(類似 robots.txt 標準)讓出版者可以選擇不被訓練,但公司也承認這些訊號並不完整,因為許多創作者無法控制其內容所寄宿的網站。
關於 Media Manager 的關鍵細節包括:
- 時間表:目標是在 2025 年前完成此工具的部署。
- 技術需求:開發此工具需要最前沿的機器學習研究,以辨識多來源中的受版權保護文字、圖像、音訊與影片。
- 目標:OpenAI 希望 Media Manager 能成為產業標準,指引創作者管理其內容與 AI 系統之間的關係。
資料來源與模型訓練
OpenAI 從頭開始訓練每一代基礎模型,使用規模與多樣性不斷提升的資料集,以增進模型的知識、理解與語言能力。公司主要依賴三大類資料來源:
- 公開可取得的資料:包括業界標準的機器學習資料集與網路爬蟲。OpenAI 會排除付費牆、主要聚合個人可識別資訊(PII)的來源、違反公司政策的來源,或已明確選擇退出的來源。
- 專屬資料合作:OpenAI 與合作夥伴取得非公開內容,例如檔案與中繼資料。例子包括用於 Sora 訓練的私人影片庫,以及與冰島政府的合作,以保存本土語言。OpenAI 表示不會為已純粹公開的資訊尋求付費合作。
- 人工回饋:模型會透過 AI 訓練師、紅隊成員、員工以及已在資料控制設定中選擇參與模型改進的使用者的回饋進行微調。
出版商合作與內容發現
為了從「注意力經濟」轉向賦能創作者,OpenAI 正將出版商內容直接整合至其產品中,以提升可見度並加強使用者與原始來源的連結。
- 來源標註:ChatGPT 已更新以改善來源連結,為使用者提供更佳的上下文,同時讓出版商有新方式與受眾互動。
- 策略性合作:OpenAI 已與全球新聞機構建立合作,包括《Financial Times》、Le Monde、Prisa Media 與 Axel Springer,將其內容顯示於 ChatGPT,並提升新聞編輯室可使用的工具。
- 教育合作:與 Khan Academy 及 ExamSolutions 的合作被用來提升模型的數學表現,擴展個人化 AI 輔導的範圍。
資料隱私與使用政策
OpenAI 為了保護隱私與商業機密,對用於訓練的資料設置了明確界限:
- 商業資料:OpenAI 不會使用 ChatGPT Team、ChatGPT Enterprise 或 API 平台的資料進行訓練。
- 使用者控制:ChatGPT Free 與 Plus 的使用者可透過帳號設定管理其資料是否用於未來模型的改進。
- 敏感資訊:公司採用技術減少個人與敏感資訊的處理,並特別訓練模型避免提供關於個人的私人或敏感資料。
Sources
- OriginalOur approach to data and AI