OpenAI 紅隊網絡

OpenAI 已啟動紅隊網絡,這是一個由全球領域專家組成的正式社群,負責嚴格評估 AI 模型,以在開發生命週期的各個階段識別風險並提升安全性。

形式化 AI 風險評估

OpenAI 紅隊網絡的設計是作為一個永久的學科專家資源,而非僅在主要發布前進行的一系列孤立測試。此結構使得安全流程能夠獲得更具迭代性和持續性的輸入。

網絡的主要特徵包括:

  • 迭代部署: 紅隊演練被視為迭代部署流程的核心部分,建基於先前與外部專家在 GPT-4 和 DALL·E 2 等模型上的工作。
  • 彈性參與: 成員會根據他們在特定項目上的專業知識被召集。時間投入具有彈性,每年可能僅需 5–10 小時。
  • 協作環境: 除了特定的委託活動外,成員可以互相交流,分享發現和一般的紅隊演練實踐。
  • 互補方法: 該網絡與其他安全措施並行運作,包括第三方審計、研究員存取計畫和開源評估。

針對性領域專業知識

OpenAI 優先考慮地理和領域多樣性,以確保 AI 系統能從廣泛的視角和生活經驗中進行評估。該網絡尋求廣泛領域的專家,包括但不限於:

  • 科學與技術: 生物學、化學、物理、電腦科學、網路安全和生物特徵辨識。
  • 社會科學: 政治學、經濟學、社會學、心理學、人類學和認知科學。
  • - 法律與政策: 法律、醫療保健、金融和政治使用。
  • 倫理與安全: 公平與偏見、對齊、兒童安全、隱私以及錯誤/誤導資訊。
  • 溝通: 語言、語言學、說服和隱寫術。

加入該網絡不需要先前的 AI 系統經驗,因為主要價值在於專家所帶來的領域特定視角,用於評估 AI 的影響。

補償與保密

參與紅隊網絡是一項有報酬的活動。然而,由於紅隊演練通常涉及測試未發布或敏感的能力,參與者通常需要簽署保密協議(NDA)。雖然成員身份本身不會限制成員發表自己獨立研究的能力,但具體項目參與將保密無限期。

替代安全貢獻途徑

對於不在紅隊網絡中的個人,OpenAI 提供其他貢獻 AI 安全的途徑:

開源評估 (Evals)

OpenAI 的開源 Evals 儲存庫提供了社群進行安全評估的範本。現有評估的範例包括:

  • 說服: 測試一個 AI 是否能欺騙另一個 AI 說出一個秘密詞(MakeMeSay)或說服它捐款(MakeMePay)。
  • 隱寫: 測試一個 AI 是否能在不被偵測的情況下傳遞秘密訊息,或在不直接溝通的情況下進行協調(謝林點)。

研究員存取計畫

此計畫提供點數,以支援研究負責任地部署 AI 及減緩相關風險的研究者。

Sources