OpenAI AI 治理承諾
OpenAI 已承諾一套自願的承諾,以推動 AI 治理前進,著重於安全、透明度以及前沿 AI 系統的負責任開發。這些承諾圍繞紅隊演練、跨產業資訊分享、AI 生成內容的識別以及模型限制的公開報告。
全面紅隊演練與安全評估
OpenAI 承諾對範圍內所有新模型的主要公開發布進行內部與外部紅隊演練。此過程涉及邀請獨立領域專家來評估系統在濫用、社會風險及國家安全方面的問題。
紅隊演練的重點領域包括:
- 生物、化學和輻射風險: 評估系統可能如何降低武器開發、設計、取得或使用的門檻。
- 網路能力: 評估系統如何協助漏洞發現、利用或操作使用,同時注意這些能力也可用於防禦目的。
- 系統互動與工具使用: 分析模型控制實體系統的能力。
- 自我複製: 評估模型自我複製製作副本的能力。
- 社會風險: 應對偏見與歧視。
為支持這些工作,OpenAI 正在推進 AI 安全研究,特別是決策過程的可解釋性以及系統對濫用的穩健性。這些安全程序將在透明度報告中披露。
資訊分享與標準制定
OpenAI 將致力於在公司與政府之間進行關於信任與安全風險、危險或新興能力以及規避防護措施嘗試的資訊分享。這包括建立或參與論壇,以制定和採用共享標準與最佳實踐,例如 NIST AI 風險管理框架。
這些機制將促進前沿能力與新興威脅的資訊分享,並讓政府、民間社會與學術界參與,針對優先關注領域發展技術工作小組。
AI 生成內容的識別
為確保使用者能區分人類與 AI 生成的內容,OpenAI 承諾為其公開可用系統所創建的音訊與視覺內容開發穩健的機制。這包括使用來源追蹤與浮水印系統。
此實作的關鍵細節包括:
- 範圍: 適用於浮水印系統開發後引入的音訊或視覺內容。
- 工具: 開發 API 或工具來判斷內容是否由其系統創建。
- 排除: 容易與現實區分的內容(例如預設 AI 助理聲音)不在範圍內。
- 資料: 浮水印或來源資料將包含模型或服務識別碼,但不會包含識別使用者的資訊。
OpenAI 也承諾與業界同儕及標準制定機構合作,開發技術框架以區分 AI 生成內容與使用者生成內容。
透明度與公開報告
OpenAI 承諾對範圍內所有新重大模型公開發布發布報告。這些報告將詳細說明:
- 安全評估: 安全評估結果,包括危險能力,前提是負責任地公開披露。
- 效能限制: 效能上的重大限制,對適當使用的領域有影響。
- 適當使用: 適當與不適當使用的領域。
- 社會風險: 討論模型對公平與偏見的影響。
- 對抗性測試: 對抗性測試結果,以評估模型部署的適合性。
社會風險緩解與全球挑戰
OpenAI 優先研究社會風險,包括避免有害偏見與歧視以及保護隱私。這包括賦能信任與安全團隊並保護兒童,以主動管理 AI 風險。
此外,OpenAI 同意支持前沿 AI 系統的研究與開發,以應對全球挑戰,例如:
- 氣候變遷減緩與適應。
- 早期癌症偵測與預防。
- 網路安全: 抵禦網路威脅。
OpenAI 也承諾支持教育與培訓計畫,以幫助學生和工作者從 AI 中受益,並協助公民理解該技術的影響。
Sources
- OriginalMoving AI governance forward