AI Safety Needs Social Scientists

OpenAI 已發布一篇論文,主張長期的 AI 安全研究必須納入社會科學,以確保對齊演算法在與真實人類互動時能夠成功。由於將先進的 AI 系統與人類價值觀對齊需要處理人類理性、情感和偏見的心理學問題,OpenAI 正積極招募社會科學家與機器學習研究人員合作。

The Challenge of Human Value Alignment

AI 對齊的目標是確保先進的 AI 系統能可靠地執行人類希望其執行的動作。OpenAI 目前的方法包括詢問人們的價值觀,利用該數據訓練機器學習 (ML) 模型,並優化系統以根據這些學習到的模型來行動。這項研究透過 Learning from Human Preferences、AI Safety via Debate 以及 Learning Complex Goals with Iterated Amplification 等方法來實施。

然而,由於多種因素,人類的輸入往往是不可靠的:

  • Cognitive Biases: Humans exhibit various cognitive biases and inconsistent ethical beliefs that may not hold up upon reflection.
  • Contextual Sensitivity: The way a question is phrased can significantly alter the answer. For example, the inclusion of the word " morally" in a question can change judgments about the wrongness of an action.
  • Complexity: People often make inconsistent choices when presented with complex tasks, such as gambles.

Bridging the Gap with Human-Only Experiments

雖然 OpenAI 利用 amplification 和 debate 等方法來針對人類價值觀背後的推理進行研究,但這些演算法在現實、以人為中心的場景中的行為仍是未知的。目前的機器學習可能太過薄弱,無法揭示那些僅在針對複雜、帶有價值觀問題的自然語言討論中才會出現的對齊問題。

OpenAI 建議進行完全由人類參與的實驗,以規避目前 ML 的限制。在這些實驗中,人們扮演 AI agent 的角色。例如,在「debate」對齊方法中——通常涉及兩個 AI debaters 與一名人類法官——研究人員可以使用兩名人類 debaters 與一名人類法官,來觀察該過程在實際運作的方式。從這些僅限於人類的互動中獲得的經驗,隨後可以轉移到機器學習模型的開發中。

The Role of Social Science in AI Safety

單憑機器學習專業知識不足以設計與執行以下類型的人類中心實驗。這些研究需要基於現有的人類認知與行為知識,進行嚴謹的實驗設計。

OpenAI 指出,對於這項跨學科努力而言,至關重要的社會科學領域包括:

  • Experimental psychology
  • Cognitive science
  • Economics
  • Political science
  • Social psychology
  • Neuroscience
  • Law

Collaborative Initiatives

作為邁向此整合的第一步,OpenAI 研究人員與史丹佛大學行為科學高級研究中心 (CASBS) 合作組織了一場工作坊。這項合作夥伴關係涉及與 Mariano-Florentino Cuéllar、Margaret Levi 和 Federica Carugati 等專家進行持續性的會議,以討論社會科學與 AI 對齊的交集點。

Sources