OpenAI 語言模型安全與濫用經驗教訓
OpenAI 已確定,AI 系統的真實世界部署提供了關鍵的安全與濫用見解,這些見解無法透過孤立的研究獲得。主要的收穫是,基於 API 的濫用經常以與最初理論擔憂不同的形式出現,而且基礎安全研究——例如對齊——直接提升了 AI 系統的商業實用性。
降低風險的迭代部署策略
OpenAI 採用持續迭代的部署方式,以在降低風險的同時最大化收益,因為負責任的部署並不存在單一的「銀彈」解決方案。此策略著重於在擴大到更大族群之前,先在小規模中學習。
此部署生命週期的關鍵組件包括:
- Pre-deployment Analysis: 使用紅隊工具和安全評估(例如,檢查 InstructGPT 是否有安全退化)。
- Gradual Rollout: 從 GPT-3 和 InstructGPT 系列等模型的私人測試開始,以限制初始使用者基礎。
- Pilot Studies: 與少數客戶一起測試新穎的使用案例,例如長文內容生成,以確定安全條件。
- Usage Monitoring: 實施 token 配額、速率限制和使用案例審查,以保持對模型使用方式的可見性。
- Retrospective Reviews: 對主要部署和安全事件進行詳細分析。
為進一步減少傷害,OpenAI 在開發管道中整合了干預措施,包括預訓練資料的策劃、為遵循指令進行微調,以及建立工具來篩選有害輸出。
語言模型濫用模式
儘管 OpenAI 最初將重點放在高層次風險上,如影響行動和生成誤導性政治內容或惡意軟體,但真實世界的數據顯示濫用範圍更廣。
OpenAI 已偵測並阻止了數百名試圖將 GPT-3 用於未預期或比預期更普遍目的的行為者。"in the wild" 濫用的例子包括:
- 對可疑醫療產品的垃圾郵件促銷。
- 種族主義幻想的角色扮演。
值得注意的是,OpenAI 發現限制輸出長度——最初旨在遏制長形式影響行動——對政策違反幾乎沒有影響。該組織現在相信,設計用於放大誤導資訊的短形式內容可能比長形式內容構成更大的風險。
風險與影響測量的挑戰
現有的學術基準常常無法反映在生產環境中遇到的安全與濫用風險。OpenAI 發現學術資料集存在幾項限制,包括過於狹窄的焦點(例如,僅測量職業性別偏見)、未能測量 AI 使用的生成維度,以及與真實世界使用案例在風格上不同的提示。
為彌合這些差距,OpenAI 正在開發:
- New Evaluation Metrics: 專門用於測量模型輸出的毒性。
- In-house Classifiers: 用於偵測違反仇恨言論、暴力、騷擾、自傷和色情內容政策的工具。
這些分類器同時用於過濾預訓練資料和測量資料干預的效果。此外,OpenAI 正在研究其模型的經濟影響,指出在文案撰寫和摘要方面有顯著的生產力提升,儘管對勞動市場的淨效應仍不清楚。
安全與商業實用性的協同效應
安全研究常常直接帶來商業利益,從而在對齊與實用性之間產生協同效應。
這種協同效應的證據包括:
- InstructGPT 偏好: 開發者普遍偏好 InstructGPT 模型而非基礎 GPT-3 模型,因為它們經過微調以遵循使用者意圖,且不太可能產生有害或不正確的輸出。這項對齊工作最初是出於長期安全目標,而非商業動機。
- 減少摩擦: 對齊的模型減少了對複雜「提示工程」的需求,節省了模型上下文視窗的空間。
- 真實性: 研究從互聯網檢索資訊以更真實地回答問題,同時提升了安全性和產品對使用者的價值。
- 運營利益: 為防止垃圾郵件而設計的速率限制也幫助客戶管理他們的開支。
儘管存在這些協同效應,OpenAI 認識到安全與實用性可能會有 trade-off;例如,更強大的系統需要更長的評估期間,這可能會延遲盈利機會。
外部合作與研究
OpenAI 強調,單一組織無法擁有所有 AI 安全的答案。為改善生態系統,他們已實施以下舉措:
- API Access: 結束 API 等待名單,讓更多個體能夠互動並了解最先進的系統。
- Subsidized Credits: 向專注於偏見和濫用的外部研究人員提供 API 點數。
- Labor Market Research: 發布關於 Codex 模型族群經濟影響的研究議程,並呼籲外部合作者研究這些影響。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch