OpenAI 兒童安全承諾:採用安全設計原則

OpenAI 與包括 Amazon、Anthropic、Civitai、Google、Meta、Metaphysic、Microsoft、Mistral AI 與 Stability AI 在內的產業領導者合作,已採納安全設計(Safety by Design)原則。此倡議由非營利組織 Thorn 與 All Tech Is Human 主導,旨在主動減輕生成式 AI 對兒童的風險,確保在 AI 技術的開發、部署與維護過程中將兒童安全置於首位。

主動開發兒童安全 AI

OpenAI 承諾建構與訓練生成式 AI 模型,主動處理兒童安全風險。此開發階段聚焦於三項主要技術與營運目標:

  • Training Data Integrity: OpenAI 將負責任地取得訓練資料集,並積極偵測與移除訓練資料中的兒童性虐待資料(CSAM)與兒童性剝削資料(CSEM),並將任何確認的 CSAM 向相關當局通報。
  • Iterative Testing: 開發過程納入回饋迴路與迭代壓力測試策略,以識別漏洞。
  • Adversarial Misuse: 公司正部署專門設計的解決方案,以應對與防止模型的對抗性濫用。

部署與分發保護措施

為確保在生成式 AI 模型的發布與分發過程中的安全,OpenAI 承諾採取以下措施:

  • Evaluation and Prevention: 模型僅在完成兒童安全訓練與評估後才會發布與分發,且在整個過程中整合保護措施。
  • Abuse Response: OpenAI 將打擊並回應濫用內容與行為,並納入預防措施以減少傷害。
  • Developer Ownership: 公司鼓勵開發者在以下安全設計原則中承擔所有權。

持續維護與風險緩解

OpenAI 透過持續監測與回應新興的兒童安全風險,維持平台安全。此承諾的關鍵內容包括:

  • Combating AIG-CSAM: OpenAI 承諾從其平台移除由惡意行為者產生的 AI 生成兒童性虐待資料(AIG‑CSAM)。
  • Research Investment: 公司將投資於研究與未來技術解決方案,以對抗 CSAM、AIG‑CSAM 與 CSEM。
  • Stakeholder Engagement: OpenAI 持續與全國失蹤與受剝削兒童中心(NCMEC)、科技聯盟,以及公司政府與產業利害關係人合作,以加強通報機制與兒童保護議題。

透明度與報告

作為此工作小組的一部分,OpenAI 與其同儕同意每年發布進度更新,以維持在實施這些安全原則方面的透明度與問責制。

Sources