Anthropic 負責任擴展政策
Anthropic 已發布其負責任擴展政策(RSP),這是一套技術與組織協議框架,旨在管理日益強大的 AI 系統開發所帶來的災難性風險。該政策確立了一種結構化的方法,僅在相應的安全與保障措施被證明有效時,才允許擴展 AI 能力。
AI 安全等級(ASL)框架
Anthropic 的 RSP 核心是 AI 安全等級(ASL)系統,該系統以美國政府的生物安全等級(BSL)標準為模型。此框架要求安全、保障與運營標準與模型可能造成的災難性風險成比例提升。
ASL 定義與標準
- ASL-1:不會造成顯著災難性風險的系統,例如 2018 年的 LLM 或專門用於下棋的 AI 系統。
- ASL-2:顯示出危險能力早期跡象的系統(例如提供製造生物武器的指示),但由於可靠性不足或資訊已可透過搜尋引擎取得,目前尚無實用價值。當前的 LLM,包括 Claude,均歸類為 ASL-2。
- ASL-3:與非 AI 基線(如教科書或搜尋引擎)相比,顯著增加災難性濫用風險的系統,或展示出低階自主能力的系統。
- ASL-4 與 ASL-5+:由於距離當前系統能力尚遠,目前尚未定義,但預期將涉及自主性與災難性濫用潛力的質變提升。
安全措施與實施
隨著模型在 ASL 標準上提升,安全要求也隨之加強。ASL-2 的措施與 Anthropic 以往對白宮的承諾一致。ASL-3 則需要更嚴格的標準,包括增強的安全要求,以及承諾若在世界級紅隊測試中顯示出顯著的災難性濫用風險,則不部署該模型。
對於 ASL-4,Anthropic 承諾在達到 ASL-3 前定義相關措施。這些措施可能涉及解決目前尚未解決的研究問題,例如使用可解釋性方法機械化地證明模型不太可能產生災難性行為。
運營與商業影響
RSP 的設計旨在平衡風險減緩與有益 AI 應用的追求。它建立了一種機制,若 AI 擴展速度超過遵守安全程序的能力,則可能暫時中止訓練更強大模型的過程。此結構旨在激勵解決安全問題,以解鎖進一步擴展。
從商業角度而言,RSP 不會改變 Claude 現有的使用或可用性。Anthropic 將該政策比作航空或汽車產業的上市前測試,即在產品投放市場前嚴格證明其安全性。
治理與迭代
Anthropic 的 RSP 已獲得董事會正式批准,任何政策變更必須在與長期利益信託(Long Term Benefit Trust)協商後,經董事會批准方可實施。該政策為早期版本,預期將隨著 AI 領域的進展快速修正與演進。
Anthropic 承認 ARC Evals 的影響,特別是其在 AI 風險評估方面的專業知識,以及廣泛的 ARC 負責任擴展政策框架的開發。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch