結合人類與 AI 推進紅隊演練 —— OpenAI 對於 o1 系列模型的做法與應用
TL;DR
OpenAI 發布了一份白皮書,概述了其對 AI 模型進行外部紅隊演練(red teaming)的四個步驟,並說明了在公開發布前,如何使用此方法對 OpenAI o1 系列模型進行測試。
外部紅隊演練的方法
該白皮書描述了一個用於設計有效紅隊演練活動的可重複流程。
1. 選擇紅隊團隊的組成
紅隊的組成是基於模型的目標與關鍵測試領域。團隊成員包含具有多元觀點的人士,例如在自然科學、網路安全、區域政治知識或語言方面的專家。在演練之前會進行威脅建模,以根據預期的模型能力、先前觀察到的問題以及潛在應用來確定測試的優先順序。內部團隊會設定初步的優先事項,隨後由外部紅隊成員進行優化或擴展。
2. 決定紅隊成員可以存取的模型或系統版本
提供給紅隊成員的模型版本可能會影響結果,且應與活動目標保持一致。在沒有安全緩解措施的情況下進行早期存取測試,可以揭示因能力提升而產生的新風險;而後期版本則可以用來測試計畫中的緩解措施。紅隊成員在整個活動期間可能會測試多個版本。
3. 建立介面、指令與文件指南
有效的互動依賴於清晰的指令、合適的測試介面以及具備可操作性的文件。指令內容涵蓋模型描述、現有或計畫中的防護措施、如何使用介面、優先測試領域,以及記錄結果的指南。介面可以是 API 或像 ChatGPT 這樣的消費者產品介面,從而實現快速的程式化測試、針對特定提示詞(prompts)的意見回饋收集,或模擬使用者互動。來自這些介面的結構化回饋隨後可用於指導風險評估與自動化評估。
4. 綜合數據並建立評估機制
活動結束後,會對紅隊的輸出進行品質評估,並將其與現有政策進行比對,以確定其是否違反政策、需要新政策,或需要改變行為。通過品質檢查的數據可以轉化為可重複的自動化評估,用於未來的模型更新。
在 OpenAI o1 系列中的應用
OpenAI 將此方法應用於為 OpenAI o1 系列模型進行公開使用做準備。外部紅隊演練活動針對以下方面對模型進行了測試:
- 對於越獄(jailbreaks)的抵抗力
- 對於現實世界攻擊規劃提示詞的安全處理
- 在自然科學領域的安全應用
- 更廣泛的主題,例如 AI 研究與開發能力
該活動遵循上述四個步驟,使用適當的團隊組成、模型版本、介面與文件來產生數據,並將其納入政策審查與自動化評估流程中。
注意:所有細節均直接取自白皮書及隨附的公告;未添加任何外部主張、數據或引言。