OpenAI 集體對齊與模型規範更新

OpenAI 已啟動一項集體對齊研究計畫,將公共偏好納入其模型規範(Model Spec),即管理 AI 預設行為的指導方針。此舉旨在確保通用人工智慧(AGI)造福人類,透過反映廣泛的全球價值與優先順序,而非僅依賴單一機構來定義理想行為。

將公共意見納入模型規範

OpenAI 透過收集來自 19 個國家超過 1,000 名人士的意見,更新了其模型規範。此過程結合自動化與人工審查迴路,將全球偏好轉化為可執行的指導方針。雖然許多參與者的偏好與現行規範相符,但也有部分差異促成了措辭說明或核心原則的提案變更。

反饋收集流程

與直接審閱規範文件不同,參與者審查了預先挑選的提示與回應,這些提示屬於價值敏感領域,理想行為往往具主觀性。

  • Methodology(方法論): 參與者為每個提示的四個可能完成度排序(其中三個涵蓋不同的現實觀點,另一個由 GPT-4o 產生)。
  • Scope(範圍): 每位參與者審查 5 至 20 個提示,提供排序、理由說明以及根據預先編寫的評分標準進行打分。
  • Demographics(人口統計): 參與者來自 19 個國家(最初來自 50 多個國家),包括美國、墨西哥、南非、荷蘭、智利、英國、印度、肯亞與日本。

將偏好轉化為指導方針

OpenAI 採用了兩條互補的迴路,將原始參與者資料轉化為模型規範提案:

  1. Fully-Automated Loop(全自動迴路): 一個推理模型辨識參與者與模型規範排序器(Model Spec Ranker,簡稱 MSR)之間的意見分歧模式——MSR 負責依照現行規範對回應進行排序。自動迴路提出變更建議,以提升與群眾的對齊程度。
  2. Human-First Loop(以人為本迴路): 研究人員全面審視人類偏好並提出更新,之後再由推理模型驗證,以確定群眾的理由是否支援變更的初衷。

OpenAI 指出,以人為本的迴路捕捉到了細微差異,例如間接的自殺意圖,這是全自動迴路所遺漏的;而全自動迴路則提供了更好的可擴展性。

採納與拒絕

模型規範的提案變更需經內部審核,層層衡量群眾偏好與安全政策、平台風險及部署限制之間的關係。

未被採納的變更

因安全與研究考量,兩個高度受關注的領域未能在規範中更新:

  • Tailored Political Content(客製化政治內容): 許多參與者希望獲得更個人化的政治內容。OpenAI 基於大規模個人化政治定位的風險而拒絕此需求。
  • Erotica for Consenting Adults(成人同意的情色內容): 雖然大量群眾支持開放情色內容,OpenAI 表示仍需進一步的研究與產品開發,才能安全上線。

技術限制與未來方向

OpenAI 承認此早期實驗仍有多項限制:

  • Selection Bias(選樣偏差): 參與者樣本相較全球人口規模較小,且僅限能閱讀英文的使用者。
  • Model Spec Ranker (MSR) Bias(模型規範排序器偏差): 由於規範本身未完全具體化,MSR 對規則的解讀可能受其訓練資料影響,導致解讀偏差。
  • Legitimacy and Validation(合法性與驗證): 自動化流程的結果對人類而言較難解讀,且最終提案未直接回饋給參與者驗證。
  • Trade-off Analysis(權衡分析): 參與者在孤立情境下評估行為,未考慮相互競爭原則之間的取捨(例如情色與兒童安全的衝突)。

結論

此集體對齊流程是構建端對端系統的首次迭代,旨在蒐集並融合多元人類價值至 AI 預設行為。OpenAI 已在 HuggingFace 上釋出公共輸入資料集,以促進 AI 生態系的進一步研究。未來工作將著重於擴大流程規模,納入更多觀點,並可能定義多套反映不同價值體系的預設規範。

Sources