OpenAI 分享用於前沿 AI 模型可靠第三方評估的指南
OpenAI 分享用於前沿 AI 模型可靠第三方評估的指南
OpenAI 發布了一份共享指南,概述第三方評估者應如何設計前沿模型的評估,以確保結果有效且具可解釋性。
Harness 在評估中的角色
The harness——即提供工具、狀態追蹤和錯誤恢復的周邊設置——可能會改變系統性能的關鍵面向,包括其使用工具的方式、追蹤資訊的方式或從錯誤中恢復的方式。當模型可以進行多個步驟的行動時,harness 可能會決定該能力是否會在評估中呈現。一個能夠保留狀態並重試失敗行動的 harness,可能會讓模型完成一個在較簡單 harness 中無法完成的多步驟任務。
評估的三種聲明類型
評估通常測試以下三種聲明之一:
- 能力誘發 (Capability elicitation):模型是否能合理地展現正在被評估的能力?
- 防護措施性能 (Safeguard performance):受測的防護措施對於正在被評估的行為或攻擊有多強的魯棒性?
- 比較 (Comparison):不同模型在同等條件下的表現如何?
需檢查的有效性隱患
可靠的報告必須檢查可能扭曲結果的因素:
- 獎勵黑客 (Reward hacking):利用任務或評分者的捷徑來獲得分數,而未展現預期的行為。
- 拒絕 (Refusals):以模糊受測行為的方式進行拒絕。
- 污染 (Contamination):因為評估任務、答案或其變體出現在訓練數據中,或在評估過程中可被發現,導致表現過高。
- 問題失效 (Broken problems):因為任務無效(例如:不公平的評分、缺失檔案、無法解決的環境)而導致表現不佳。
- 沙袋行為 (Sandbagging):當模型意識到正在接受評估時,刻意表現不佳。
對可靠報告的建議
評估報告應明確說明正在測試的聲明,並分享結果有效的證據。報告必須描述形塑結果的 harness 選擇,詳細說明這些選擇在不同評估之間何時發生變化,並包含支持性證據,例如工具設置、誘發指南、預算,以及為何該設置是該聲明能力的可靠代理。
OpenAI 如何支持更強大的評估
OpenAI 正在採取幾項具體措施:
- 向評估者分享特定的最大誘發指南。
- 要求能力評估者使用 Codex 作為 OpenAI 模型的共同基準,確保測試是透過用戶所依賴的相同代理介面進行。
- 在需要評估欺騙、沙袋行為或評估意識時,提供推理軌跡和其他中間產物。
- 優先進行研究,以了解 harness 選擇(從上下文管理和工具訪問到重試行為、評分和資源預算)在何時以及如何實質性地改變結果。
對標準與未來研究的啟示
該指南旨在為新興的國家和國際前沿 AI 評估標準提供參考。標準應要求提供足夠的細節,使決策者能夠理解:
- 所提出的聲明(能力上限、系統比較或防護措施魯棒性)。
- 評估內容:揭示受測技能、行為或失效模式的任務或任務分佈。
- 受測系統:模型、推理設置、工具訪問、harness 和防護措施。
- 預算:輪次、token、嘗試/重試次數、實際經過時間、推理成本,以及在適用情況下每次成功解決問題的預期成本。
- 誘發方法:用於引出結果的 harness 選擇,以及受測設置與更廣泛聲明之間的契合程度。
- 有效性檢查:評估者如何尋找獎勵黑客、評估意識、污染、拒絕、沙袋行為以及其他可能損害結果的行為,包括確認的案例如何影響評分或解釋。
透過明確化 harness 選擇和有效性檢查,評估報告可以避免低估系統能力或過度誇大對安全聲明的信心,並為持續研究強大的誘發方法奠定基礎。