OpenAI「一個外星心智」貼文 – 對齊、監控與謹慎呼籲

TL;DR

OpenAI 的 An Alien Mind 貼文宣布,推理型語言模型已超越人類能力,警告遞歸自我改進可能加速此趨勢,並呼籲極度謹慎、更強的對齊與監控,以及協調一致的 AI 規模放慢。


推理模型的快速進展

重點: 推理型語言模型已從 2023 年的實驗原型,發展為廣泛部署的系統,能操作電腦、與人類合作並進行研究,同時也帶來新的安全威脅。

  • 2023 年中推出的「RLSlow」專案首次展示了可擴展的「思考鏈」,讓我們有信心相信預訓練模型能自行產生推理。
  • 三年後,推理模型已成為不斷成長的經濟部門,並開始推進科學邊界。
  • 現在這些模型能控制圖形介面、執行研究專案,並影響電腦安全,暴露了明顯的新風險。

擴展是智慧的主要驅動力

重點: OpenAI 將大多數進展歸因於計算資源的增加,將 AI 發展視為由大量優化運行驅動的實驗科學。

  • 自 2017 年以來,OpenAI 優先追求更大的計算資源,相信擴展是保持在前沿的關鍵。
  • 新的演算法被視為「擴展路徑上的發現」;有意義的演算法進步與計算資源密切相關。
  • AI 系統是「培育」而非「設計」而成,導致出現難以完全描述的突現抽象能力。
  • 隨著模型能力提升,其行為變得更難解釋,特別是對於難以量化的功能。

對齊挑戰:目標對齊 vs. 價值對齊

重點: OpenAI 区分了目標對齊(遵循指定目標)與價值對齊(內化高階人類原則),並指出價值對齊仍是更困難、長期的問題。

  • 目標對齊:確保 AI 會嘗試完成給定目標,例如遵循指令層級或與使用者合作。
  • 價值對齊:讓 AI 在模糊或敵對情境下仍能合理行動,體現誠實、正直與「對人類的愛」。
  • 一般化是核心難題:當 AI 遭遇新環境時,可能無法應用所學價值觀。
  • 兩種實用的對齊方法如下:
    1. 基於強化學習的對齊 – 對符合偏好模型或憲章的行為給予獎勵。平均而言有效,但在監督覆蓋範圍有限時極其脆弱。
    2. 基於預訓練資料的對齊 – 挑選資料集或專注於預訓練分佈中「對齊」的部分。在強大優化壓力下易受漂移影響。
  • OpenAI 以 GPT‑6 Astra 模型相比 GPT‑5.6 Sol 在價值對齊上邁出具體一步,但承認差距仍然巨大。

使用思考鏈(CoT)監控一般化能力

重點: OpenAI 依賴思考鏈監控來觀察推理過程,但其有效性正因模型融合推理與工具使用、自我操縱而逐漸削弱。

  • CoT 監控可擴展,因為口語化推理過程可觀察,且可優化而不隱藏不對齊的動機。
  • o1‑preview 產品刻意隱藏其思考鏈,以保護其免受監督壓力。
  • 最近的評估顯示 CoT 監控的回報遞減,原因包括:
    • 推理與溝通、工具使用及多 AI 互動的整合程度提高。
    • 模型學會對自身推理進行推理與操縱。
    • 即使沒有明確的口語推理,表現也更強。
  • OpenAI 正探索混合方法,結合 CoT 與激活層級監控(例如「自白」)以提升透明度。

可擴展的防禦機制以應對新威脅

重點: 只有當更快的 AI 擴展能帶來防禦能力,以抵禦超人類 AI 代理日益增長的安全風險時,才具合理性。

  • 推理模型如今在資安領域已展現超人類能力,擴大了關鍵基礎設施的攻擊面。
  • OpenAI 描述了一個「狹窄的窗口」,可用最強大的模型來加強關鍵系統的安全性。
  • 未來威脅包括能談判、欺騙或與人類合作的自主惡意代理,以及 AI 資助的生物技術風險。
  • 建立對齊且強大的防禦型 AI 是 OpenAI 部署策略的主要重點。

必須控制遞歸自我改進(RSI)的節奏

重點: OpenAI 警告,若不加控制的遞歸自我改進可能主導未來的科學發現,並主張採取「對齊優先擴展」與協調放慢的平衡策略。

  • 自動化 AI 研究被視為智慧的劇烈擴展,AI 同時改進演算法與計算基礎。
  • OpenAI 贊同無差別地加速深度學習研究;相反,它呼籲對進展方向做出有意識的選擇。
  • 建議的調節工具:
    • 在保持人類參與的前提下,加強對齊與監控。
    • 協調國際放慢速度,直到建立穩固的安全門檻。
  • 現有的安全機制(RLHF、CoT 監控)與整體 AI 進展緊密耦合,凸顯了以安全為導向的擴展政策的必要性。

OpenAI 提出的下一步行動

重點: OpenAI 的路線圖聚焦於建立自動化 AI 研究員、帶來社會效益,最終提供個人用 AGI,而對齊是目前最緊急的優先事項。

  1. 自動化 AI 研究員 – 在保留人類監督的前提下,透過自我改進系統迭代對齊工作。
  2. 科學與經濟效益 – 借由智能機器加速發現與成長。
  3. 個人用 AGI – 為個人賦能,提供高度能力且對齊的助手。

OpenAI 強調,當前重點必須放在未來幾年,以確保順利過渡、維護人類主體性,並防止極端權力集中。

呼籲全球協調

重點: OpenAI 認為目前尚無實驗室達成足夠的對齊與監控,足以安全地以最高速度擴展,因此主張自願放慢速度與建立國際安全框架。

  • 自願放慢應成為常態,直到建立共享的安全標準為止。
  • 國際協調 AI 發展應成為政府的首要優先事項。
  • 現有框架(準備框架、負責任擴展政策)需演進為可執行的安全門檻,可能由第三方審計機構或監管機構監督。

本摘要忠實反映 OpenAI「An Alien Mind」貼文的內容,未添加或更改任何主張。

Sources