OpenAI「一個外星心智」貼文 – 對齊、監控與謹慎呼籲
TL;DR
OpenAI 的 An Alien Mind 貼文宣布,推理型語言模型已超越人類能力,警告遞歸自我改進可能加速此趨勢,並呼籲極度謹慎、更強的對齊與監控,以及協調一致的 AI 規模放慢。
推理模型的快速進展
重點: 推理型語言模型已從 2023 年的實驗原型,發展為廣泛部署的系統,能操作電腦、與人類合作並進行研究,同時也帶來新的安全威脅。
- 2023 年中推出的「RLSlow」專案首次展示了可擴展的「思考鏈」,讓我們有信心相信預訓練模型能自行產生推理。
- 三年後,推理模型已成為不斷成長的經濟部門,並開始推進科學邊界。
- 現在這些模型能控制圖形介面、執行研究專案,並影響電腦安全,暴露了明顯的新風險。
擴展是智慧的主要驅動力
重點: OpenAI 將大多數進展歸因於計算資源的增加,將 AI 發展視為由大量優化運行驅動的實驗科學。
- 自 2017 年以來,OpenAI 優先追求更大的計算資源,相信擴展是保持在前沿的關鍵。
- 新的演算法被視為「擴展路徑上的發現」;有意義的演算法進步與計算資源密切相關。
- AI 系統是「培育」而非「設計」而成,導致出現難以完全描述的突現抽象能力。
- 隨著模型能力提升,其行為變得更難解釋,特別是對於難以量化的功能。
對齊挑戰:目標對齊 vs. 價值對齊
重點: OpenAI 区分了目標對齊(遵循指定目標)與價值對齊(內化高階人類原則),並指出價值對齊仍是更困難、長期的問題。
- 目標對齊:確保 AI 會嘗試完成給定目標,例如遵循指令層級或與使用者合作。
- 價值對齊:讓 AI 在模糊或敵對情境下仍能合理行動,體現誠實、正直與「對人類的愛」。
- 一般化是核心難題:當 AI 遭遇新環境時,可能無法應用所學價值觀。
- 兩種實用的對齊方法如下:
- 基於強化學習的對齊 – 對符合偏好模型或憲章的行為給予獎勵。平均而言有效,但在監督覆蓋範圍有限時極其脆弱。
- 基於預訓練資料的對齊 – 挑選資料集或專注於預訓練分佈中「對齊」的部分。在強大優化壓力下易受漂移影響。
- OpenAI 以 GPT‑6 Astra 模型相比 GPT‑5.6 Sol 在價值對齊上邁出具體一步,但承認差距仍然巨大。
使用思考鏈(CoT)監控一般化能力
重點: OpenAI 依賴思考鏈監控來觀察推理過程,但其有效性正因模型融合推理與工具使用、自我操縱而逐漸削弱。
- CoT 監控可擴展,因為口語化推理過程可觀察,且可優化而不隱藏不對齊的動機。
- o1‑preview 產品刻意隱藏其思考鏈,以保護其免受監督壓力。
- 最近的評估顯示 CoT 監控的回報遞減,原因包括:
- 推理與溝通、工具使用及多 AI 互動的整合程度提高。
- 模型學會對自身推理進行推理與操縱。
- 即使沒有明確的口語推理,表現也更強。
- OpenAI 正探索混合方法,結合 CoT 與激活層級監控(例如「自白」)以提升透明度。
可擴展的防禦機制以應對新威脅
重點: 只有當更快的 AI 擴展能帶來防禦能力,以抵禦超人類 AI 代理日益增長的安全風險時,才具合理性。
- 推理模型如今在資安領域已展現超人類能力,擴大了關鍵基礎設施的攻擊面。
- OpenAI 描述了一個「狹窄的窗口」,可用最強大的模型來加強關鍵系統的安全性。
- 未來威脅包括能談判、欺騙或與人類合作的自主惡意代理,以及 AI 資助的生物技術風險。
- 建立對齊且強大的防禦型 AI 是 OpenAI 部署策略的主要重點。
必須控制遞歸自我改進(RSI)的節奏
重點: OpenAI 警告,若不加控制的遞歸自我改進可能主導未來的科學發現,並主張採取「對齊優先擴展」與協調放慢的平衡策略。
- 自動化 AI 研究被視為智慧的劇烈擴展,AI 同時改進演算法與計算基礎。
- OpenAI 不贊同無差別地加速深度學習研究;相反,它呼籲對進展方向做出有意識的選擇。
- 建議的調節工具:
- 在保持人類參與的前提下,加強對齊與監控。
- 協調國際放慢速度,直到建立穩固的安全門檻。
- 現有的安全機制(RLHF、CoT 監控)與整體 AI 進展緊密耦合,凸顯了以安全為導向的擴展政策的必要性。
OpenAI 提出的下一步行動
重點: OpenAI 的路線圖聚焦於建立自動化 AI 研究員、帶來社會效益,最終提供個人用 AGI,而對齊是目前最緊急的優先事項。
- 自動化 AI 研究員 – 在保留人類監督的前提下,透過自我改進系統迭代對齊工作。
- 科學與經濟效益 – 借由智能機器加速發現與成長。
- 個人用 AGI – 為個人賦能,提供高度能力且對齊的助手。
OpenAI 強調,當前重點必須放在未來幾年,以確保順利過渡、維護人類主體性,並防止極端權力集中。
呼籲全球協調
重點: OpenAI 認為目前尚無實驗室達成足夠的對齊與監控,足以安全地以最高速度擴展,因此主張自願放慢速度與建立國際安全框架。
- 自願放慢應成為常態,直到建立共享的安全標準為止。
- 國際協調 AI 發展應成為政府的首要優先事項。
- 現有框架(準備框架、負責任擴展政策)需演進為可執行的安全門檻,可能由第三方審計機構或監管機構監督。
本摘要忠實反映 OpenAI「An Alien Mind」貼文的內容,未添加或更改任何主張。
Sources
- OriginalAn Alien Mind