OpenAI 分享用於前沿 AI 模型可靠第三方評估的指南

OpenAI 分享用於前沿 AI 模型可靠第三方評估的指南

OpenAI 發布了一份共享指南,概述第三方評估者應如何設計前沿模型的評估,以確保結果有效且具可解釋性。

Harness 在評估中的角色

The harness——即提供工具、狀態追蹤和錯誤恢復的周邊設置——可能會改變系統性能的關鍵面向,包括其使用工具的方式、追蹤資訊的方式或從錯誤中恢復的方式。當模型可以進行多個步驟的行動時,harness 可能會決定該能力是否會在評估中呈現。一個能夠保留狀態並重試失敗行動的 harness,可能會讓模型完成一個在較簡單 harness 中無法完成的多步驟任務。

評估的三種聲明類型

評估通常測試以下三種聲明之一:

  • 能力誘發 (Capability elicitation):模型是否能合理地展現正在被評估的能力?
  • 防護措施性能 (Safeguard performance):受測的防護措施對於正在被評估的行為或攻擊有多強的魯棒性?
  • 比較 (Comparison):不同模型在同等條件下的表現如何?

需檢查的有效性隱患

可靠的報告必須檢查可能扭曲結果的因素:

  • 獎勵黑客 (Reward hacking):利用任務或評分者的捷徑來獲得分數,而未展現預期的行為。
  • 拒絕 (Refusals):以模糊受測行為的方式進行拒絕。
  • 污染 (Contamination):因為評估任務、答案或其變體出現在訓練數據中,或在評估過程中可被發現,導致表現過高。
  • 問題失效 (Broken problems):因為任務無效(例如:不公平的評分、缺失檔案、無法解決的環境)而導致表現不佳。
  • 沙袋行為 (Sandbagging):當模型意識到正在接受評估時,刻意表現不佳。

對可靠報告的建議

評估報告應明確說明正在測試的聲明,並分享結果有效的證據。報告必須描述形塑結果的 harness 選擇,詳細說明這些選擇在不同評估之間何時發生變化,並包含支持性證據,例如工具設置、誘發指南、預算,以及為何該設置是該聲明能力的可靠代理。

OpenAI 如何支持更強大的評估

OpenAI 正在採取幾項具體措施:

  • 向評估者分享特定的最大誘發指南。
  • 要求能力評估者使用 Codex 作為 OpenAI 模型的共同基準,確保測試是透過用戶所依賴的相同代理介面進行。
  • 在需要評估欺騙、沙袋行為或評估意識時,提供推理軌跡和其他中間產物。
  • 優先進行研究,以了解 harness 選擇(從上下文管理和工具訪問到重試行為、評分和資源預算)在何時以及如何實質性地改變結果。

對標準與未來研究的啟示

該指南旨在為新興的國家和國際前沿 AI 評估標準提供參考。標準應要求提供足夠的細節,使決策者能夠理解:

  • 所提出的聲明(能力上限、系統比較或防護措施魯棒性)。
  • 評估內容:揭示受測技能、行為或失效模式的任務或任務分佈。
  • 受測系統:模型、推理設置、工具訪問、harness 和防護措施。
  • 預算:輪次、token、嘗試/重試次數、實際經過時間、推理成本,以及在適用情況下每次成功解決問題的預期成本。
  • 誘發方法:用於引出結果的 harness 選擇,以及受測設置與更廣泛聲明之間的契合程度。
  • 有效性檢查:評估者如何尋找獎勵黑客、評估意識、污染、拒絕、沙袋行為以及其他可能損害結果的行為,包括確認的案例如何影響評分或解釋。

透過明確化 harness 選擇和有效性檢查,評估報告可以避免低估系統能力或過度誇大對安全聲明的信心,並為持續研究強大的誘發方法奠定基礎。

Sources