OpenAI 基於規則的獎勵(RBR)模型安全

OpenAI 開發了基於規則的獎勵(RBR),這是一種新的對齊方法,使 AI 模型能在不需要大量人類資料收集的情況下安全運作。透過以清晰、程式化的規則取代或補充人類回饋,RBR 能更快速更新安全政策,並在模型的有用性與防止傷害之間取得更有效的平衡。

基於規則的獎勵運作方式

基於規則的獎勵利用一組預先定義的命題——描述期望或不期望回應特徵的簡單敘述——來評估模型輸出。這些命題被組合成規則,根據適用於提示的特定安全政策對回應進行分類。

三種回應類別

根據請求,系統會將提示映射到以下三種期望的回應類型之一:

  • 硬性拒絕:用於犯罪仇恨言論、極端主義或暴力犯罪指示。理想的回應包括簡短的道歉與無法遵從的說明,避免使用評判性語言或過度冗長。
  • 軟性拒絕:用於敏感主題,如自我傷害。理想的回應提供富有同理心的道歉,承認使用者的情緒狀態,同時仍然拒絕請求。
  • 遵從:用於良性請求,模型應完整滿足使用者的需求。

技術實作

自動評分器(固定的語言模型)根據回應對命題的遵循程度給予分數。這些分數隨後用於擬合線性模型,其權重參數從包含已知理想回應類型的少量提示資料集中學習得到。

這些 RBR 獎勵被整合到標準的「從人類回饋中強化學習」(RLHF)流程中。具體而言,它們與僅有助益的獎勵模型的獎勵結合,作為額外訊號輸入至近端策略最佳化(PPO)演算法,以促使模型遵守安全政策。

效能與結果

使用 RBR 訓練的模型在安全表現上可與使用人類回饋訓練的模型相媲美,同時提供多項運營優勢:

  • 降低過度拒絕:RBR 能減少模型錯誤拒絕安全請求的情況,提升模型的整體效用。
  • 效率:此方法大幅降低對大量人類資料的依賴,使訓練過程更快速且成本更低。
  • 敏捷性:只要修改或新增規則,即可快速更新安全指引,無需大量重新訓練模型。
  • 能力維持:RBR 的實作不會對常見能力基準的評估指標產生負面影響。

限制與倫理考量

雖然 RBR 在規則明確的任務上有效,但對於主觀性任務(如撰寫高品質論文)則較不適合。為了緩解此問題,OpenAI 將 RBR 與人類回饋結合,使用 RBR 處理具體指導原則(例如「不要使用俚語」),而以人類回饋處理諸如連貫性等細緻品質。

從倫理角度來看,將安全檢查從人類轉移至 AI 可能降低人類監督,且若使用帶有偏見的模型提供 RBR 獎勵,可能會放大偏見。OpenAI 指出,研究人員必須謹慎設計 RBR,以確保公平性與準確性。

未來應用

除了安全之外,OpenAI 認為 RBR 可適用於任何以明確規則定義期望行為的任務,例如為特定應用調整回應的個性或格式。未來的工作將包括消融研究以了解 RBR 組件、使用合成資料開發規則,以及在多元領域進行更廣泛的人類評估。

Sources