OpenAI 生物威脅評估:建立早期警示系統
OpenAI 開發了一套新的評估方法,作為偵測 AI 模型何時可能顯著提升生物威脅製造風險的「警示線」。此研究旨在判斷取得 GPT-4 是否會為惡意行為者提供超出網路上已可取得的危險資訊。
研究設計與方法論
為評估 AI 對生物風險資訊取得的影響,OpenAI 進行了一項包含 100 名人類參與者的研究,分為兩個族群:50 位生物學專家(具備專業濕實驗室經驗的博士)以及 50 位學生層級參與者(至少修過一門大學級生物課程)。
實驗組別
每個族群的參與者被隨機分配至以下兩組之一:
- 對照組: 僅能使用網路。
- 處理組: 同時可使用 GPT-4 與網路。
評估範圍
參與者被要求完成涵蓋生物威脅製造過程五個階段的任務:
- 構思
- 獲取
- 放大
- 配方
- 釋放
表現指標
Gryphon Scientific 的專家評分員使用客觀評分標準,依三項主要指標以 1-10 分制評分回應:
- 準確性: 參與者是否包含完成任務所需的所有關鍵步驟。
- 完整性: 參與者是否包含所有隱含資訊與必要細節。
- 創新性: 參與者是否設計出新穎方法,例如規避 DNA 合成篩選的防護措施。
此外,研究還追蹤了 所需時間 與 自評難度。
主要發現
取得 GPT-4 帶來了任務表現的輕微提升,但這些結果未達統計顯著性。
表現提升
- 準確性: 與僅使用網路的基線相比,專家的平均分數提升了 0.88,學生則提升了 0.25。
- 完整性: 專家提升了 0.82,學生提升了 0.41。
值得注意的觀察
- 縮小差距: 在放大與配方任務中,使用語言模型使學生的表現提升至與專家基線相同的水平。
- 資訊可得性: 研究發現,危險內容(包括生物威脅製造的逐步方法)已相對容易透過一般網路搜尋取得。
- 實體瓶頸: OpenAI 指出,僅有資訊取得不足以製造威脅;實體限制,如濕實驗室的使用權與微生物學、病毒學的專業知識,仍是主要瓶頸。
方法論洞見與安全性
OpenAI 採用了特定設計原則,以確保評估能引發模型全部能力:
- 人類在迴路中(Human-in-the-Loop): 研究使用人類參與者而非自動化基準測試,因為人類能調整提示並修正錯誤,以更好地從模型中提取資訊。
- 能力引發(Capability Elicitation): 參與者接受了使用大型語言模型的最佳實踐與避免失效模式的訓練。專家獲得了僅供研究使用的客製化 GPT-4 版本,能回應生物風險問題且不會拒絕。
- 安全協議(Security Protocols): Gryphon Scientific 所提供的訓練涵蓋關注的雙重用途研究(DURC)與嚴格保密,以防止產生資訊危害。
生物風險評估的未來方向
OpenAI 確認了在為 AI 模型建立有效安全門檻時的若干挑戰:
- 定義「警示線」: 目前尚未清楚界定何種程度的資訊取得提升才構成顯著的風險增加。
- 統計分析: OpenAI 認為在風險評估中,偽陰性(漏掉風險)比偽陽性(誤報風險)更昂貴,需採用優先捕捉風險的統計方法,而非傳統的防止 p-hacking 的最小化。