OpenAI 對 AI 安全的做法
OpenAI 採用多層次的安全框架,確保強大的 AI 系統安全且廣泛惠及大眾。此方法結合嚴謹的部署前測試、迭代的實務部署以及持續的對齊研究,以降低風險並改善模型行為。
部署前測試與對齊
OpenAI 進行嚴格測試,並在發布任何新系統前徵求外部專家的回饋。組織使用諸如「人類回饋強化學習」(RLHF) 等技術來提升模型行為與對齊程度。
對於 GPT-4,OpenAI 在公開發布前,花費超過六個月跨部門協作,使模型更安全且更符合對齊目標。
迭代部署與實務學習
OpenAI 認為實驗室測試有其限制,無法預測所有正面或濫用的使用情境。為此採用迭代部署策略:
- 逐步發布: 新的 AI 系統會謹慎地釋出給逐漸擴大的使用者群,並設置充分的安全防護。
- 監測濫用: 透過服務與 API 提供模型,OpenAI 能監控並對濫用行為採取行動,並根據實務資料而非理論建立緩解措施。
- 社會調整: 迭代部署讓社會與利害關係人能對 AI 的發展發揮重要影響,並提供時間讓技術更有效地被採用。
兒童安全與內容審查
保護兒童是 OpenAI 安全工作的重要焦點。組織維持嚴格的使用政策,禁止產生仇恨、騷擾、暴力或成人內容。
GPT-4 的關鍵安全指標包括:
- 禁止內容: 與 GPT-3.5 相比,GPT-4 回應禁止內容請求的可能性降低了 82%。
- 兒童安全工具: OpenAI 使用 Thorn 的 Safer 來偵測、審查並向全國失蹤與被剝削兒童中心(National Center for Missing and Exploited Children)回報上傳至影像工具的兒童性虐待資料(CSAM)。
- 年齡要求: 使用者必須年滿 18 歲,或在父母同意下年滿 13 歲。
OpenAI 亦與如 Khan Academy 等合作夥伴合作,為特定使用情境(如為學生與教師提供 AI 助手)開發量身訂製的安全緩解措施。
隱私與資料處理
OpenAI 的大型語言模型以廣泛的語料庫訓練,包含公開可取得的內容、授權內容以及由人工審查員產生的授權內容。資料僅用於提升模型的實用性,而非販售服務、廣告或建立個人檔案。
為保護私人個人,OpenAI 採取多項策略:
- 移除個人資訊: 在可行的情況下,從訓練資料集中移除個人資訊。
- 拒絕引用: 模型經過微調以拒絕對私人個人資訊的請求。
- 刪除請求: 組織會回應個人要求刪除其資料的請求。
事實準確性與幻覺
OpenAI 指出,大型語言模型依據模式預測下一系列詞彙,可能導致事實不準確。為提升準確度,OpenAI 利用使用者對錯誤 ChatGPT 輸出的回饋作為主要資料來源。
根據此迭代改進流程,GPT-4 產出事實內容的可能性比 GPT-3.5 高出 40%。
全球治理與持續研究
OpenAI 認為全球治理是確保 AI 發展受到有效監管、避免企業「走捷徑」以爭先的必要條件。OpenAI 積極與各國政府合作,確保嚴格的安全評估被納入法規。
組織主張,提升 AI 安全與能力應同步進行,因為更強大的模型更善於遵循指示且更易於引導。OpenAI 將持續加強安全防護,隨著 AI 系統演進,未來模型可能需要超過六個月的額外安全工作才能完成。
Sources
- OriginalOur approach to AI safety