OpenAI AI 系統行為與治理框架

OpenAI 正在實施一套框架,以闡明 ChatGPT 行為的形成方式,並過渡到更具可自訂性、由公眾參與的治理模式。此轉變旨在減少偏見、防止權力過度集中,並確保 AI 系統符合多元的人類價值觀。

形塑 AI 行為的兩步驟流程

ChatGPT 的行為並非明確編程,而是透過兩階段的訓練過程學習而來:預訓練與微調。

預訓練

在最初階段,模型會在包含廣泛網路文本的大規模資料集上進行訓練。模型學習預測句子中的下一個詞,從而獲得語法、世界事實與推理能力。然而,此階段也會讓模型接觸到來源資料中存在的偏見。

微調

為了縮小系統行為的範圍,OpenAI 會使用第二階段,將模型在由人工審查員產生的狹窄資料集上進行微調。這些審查員遵循特定指引,對模型對各種示例輸入的回應進行評分。模型隨後從這些回饋中概括,回應廣泛的使用者輸入。這是一個迭代過程,包含 OpenAI 與審查員每週的會議,以澄清指導方針並提升模型效能。

應對偏見與政策透明度

OpenAI 認為訓練過程中產生的偏見是「錯誤,而非特性」,並致力透過多項透明度與研究倡議來減少這些偏見:

  • 指引揭露: OpenAI 已分享部分關於政治與爭議議題的指引,明確指示審查員不偏袒任何政治團體。
  • 審查員人口統計: 公司正努力分享審查員的彙總人口統計資訊,以辨識並減輕潛在的偏見來源。
  • 技術研究: OpenAI 正研究更可控的微調流程,結合外部進展,如憲法式 AI(Constitutional AI)與基於規則的獎勵。
  • 指導改進: 該實驗室正提供更清晰的指示給審查員,關於爭議人物、主題與潛在偏見陷阱。

未來框架:AI 治理的三大構件

為確保 AI 的利益與影響能廣泛分佈,OpenAI 正在制定基於三個關鍵構件的策略:

1. 改善預設行為

OpenAI 旨在讓 AI 系統「開箱即用」且有用,透過減少明顯與微妙的偏見來達成。這包括提升系統的準確性,以防止其「捏造」資訊,並精進其拒絕機制,使其能正確辨識何時拒絕輸出、何時允許。

2. 在廣泛界限內的使用者自訂

OpenAI 正開發升級功能,讓使用者能依其個人價值觀自訂 ChatGPT 的行為。為防止惡意使用或產生盲目迎合現有信念的「諂媚 AI」,這些自訂將受限於社會所定義的界限之內。

3. 公眾對預設與硬性界限的意見

為避免權力過度集中,OpenAI 正試行徵求公眾對 AI 系統規則的意見。現行與未來的倡議包括:

  • 紅隊測試: 尋求外部意見以測試技術的極限。
  • 情境特定意見: 徵求對 AI 在特定領域(如教育)角色的回饋。
  • 廣泛治理: 探索公眾對系統行為、部署政策與揭露機制(如浮水印)的意見。
  • 第三方稽核: 與外部組織合作,對安全與政策工作進行稽核。

Sources