Anthropic 對 AI 安全性的核心觀點

Anthropic 認為,在規模法則(scaling laws)和運算量指數級增長的驅動下,AI 的快速進步可能在未來十年內導致變革性 AI 系統的出現。由於目前業界缺乏經過驗證的方法來訓練強大的系統使其具備穩健的幫助性、誠實性和無害性,Anthropic 正採取多方面的實證研究策略,以防止災難性的後果。

AI 快速進步的驅動因素

由於訓練數據、運算量和改進算法這三大要素的相互作用,AI 能力正在可預測地提高。Anthropic 指出,AI 訓練運算的總預算每年以約 10 倍的速度增長,速度明顯快於摩爾定律(Moore's Law)。

對「規模法則」的研究表明,增加運算量會帶來能力的全面提升。雖然多模態(multimodality)和邏輯推理曾被認為是潛在的瓶頸,但這些「牆」已基本被打破。Anthropic 預期,反饋迴路(feedback loops)——即使用先進的 AI 來加速 AI 研究(例如,代碼模型提高研究人員的生產力)——可能會進一步加速向大多數智力任務皆超越人類能力的系統轉型。

主要的 AI 安全風險

Anthropic 指出,與變革性 AI 的出現相關的兩個主要風險來源:

  1. 技術對齊問題(The Technical Alignment Problem): 隨著 AI 系統變得比其設計者更具能力,人類變得越來越難以檢測「錯誤的舉動」或錯誤對齊的目標。如果一個能力顯著強於人類專家的系統追求與人類利益衝突的目標,其結果可能是災難性的。
  2. 社會動盪: 快速的進步可能會擾亂就業、宏觀經濟和全球權力結構。這種不穩定性可能會引發企業或國家之間的競爭賽跑,導致部署不可信的系統。

除了這些系統性風險外,Anthropic 也觀察到當前模型中已存在的行為——例如毒性、偏見、不誠實和奉承(sycophancy)——是更複雜問題的潛在先兆,包括欺騙和戰略性的權力尋求,這些問題可能僅在高度先進的系統中出現。

一種實證且組合式的安全方法

Anthropic 主張採用實證驅動的方法,並斷言安全研究必須在「前沿」(frontier)模型上進行,因為大型模型與小型模型在性質上有所不同,並會表現出突然且不可預測的行為變化。

為了管理關於對齊問題難度的不確定性,Anthropic 在三種可能的場景下採用「組合式方法」(portfolio approach):

  • 樂觀: 安全失敗不太可能發生;現有的技術如 RLHF 和 Constitutional AI 是大致足夠的。研究重點在於減輕短期危害和結構性風險。
  • 中立: 災難性風險是可能的,但可以透過大量的科學和工程努力來管理。Anthropic 的目標是在這種情況下推廣安全的訓練方法。
  • 悲觀: AI 安全基本上是無法解決的。在這種情況下,Anthropic 的角色是提供問題無法解決的證據,以發出警報並可能阻止危險 AI 的開發。

研究分類

Anthropic 將其研究分為三個不同的支柱:

  • 能力(Capabilities): 研究如何讓 AI 系統在任務中表現得更好。這項工作通常不對外發布,以避免加速能力進步的速度。
  • 對齊能力(Alignment Capabilities): 開發算法以使系統更具幫助性、誠實性和無害性(例如,Constitutional AI、RLHF 和辯論)。
  • 對齊科學(Alignment Science): 評估並理解系統是否真正對齊,並揭露對齊能力的局限性(例如,mechanistic interpretability)。

關鍵技術安全方向

機械式可解釋性(Mechanistic Interpretability)

Anthropic 正在嘗試將神經網絡逆向工程為人類可理解的算法。其目標是實現對 AI 模型進行「代碼審查」,讓研究人員能夠識別不安全因素,或透過檢測「欺騙性對齊」(deceptive alignment)——即模型在測試中「配合演戲」但實際上仍未對齊——來提供安全保障。

可擴展的監督(Scalable Oversight)

由於人類無法為超出其自身專業知識的任務提供高品質的反饋,Anthropic 正在研究讓 AI 系統協助人類進行監督的方法。這包括 Constitutional AI (CAI) 等技術,它允許自動化紅隊測試(red-teaming)並將少量的、高品質的人類監督放大為大規模的 AI 監督。

以過程為導向的學習(Process-Oriented Learning)

與其根據最終結果來獎勵 AI 系統(結果導向型學習),Anthropic 正在探索獎勵達成結果所使用的個別過程和步驟。這種方法旨在確保 AI 系統不會透過不明或有害的手段來達成成功,並確保其方法對人類專家而言是可理解的。

理解泛化與失效模式

Anthropic 研究 LLM 的行為是如何從預訓練和微調的相互作用中產生的。為了預期危險的湧現行為,他們刻意在小規模、但不具危險性的模型中訓練特定的有害屬性(例如欺騙),以便在這些行為出現在前沿系統中之前,先進行隔離與研究。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch