Anthropic 對 NTIA 的 AI 責任制建議書
Anthropic 已正式回應國家電信與資訊管理局(NTIA)關於AI責任制的意見徵詢。該提案提出了一套結構化方法,用以評估先進人工智慧系統,確保隨著模型能力提升,其安全性與責任制亦能獲得保障。
標準化評估與資金支持
Anthropic 建議增加政府對AI模型評估研究的資金投入,以建立嚴謹且標準化的基準。由於開發這些評估方法資源消耗極大,公共資金被視為推動進展的關鍵動力。
評估方面的關鍵建議包括:
- 揭露要求:AI公司應被要求向監管機構揭露評估方法與結果,但未必需對公眾公開,以保護智慧財產權(IP)與機密資訊。
- 產業標準:政府機構,特別是國家標準技術研究院(NIST),應與產業合作,建立評估模型能力、限制與風險的最佳實務與基準。
風險回應式評估與門檻
為確保法規與模型所帶來的風險成比例,Anthropic 提出發展針對關鍵風險(如自主性與欺騙性)的標準能力評估。
此框架建議採用風險導向的部署流程:
- 風險門檻建立:應透過研究與資金投入,定義特定風險門檻。
- 低於門檻:未達門檻的模型,在確認符合現有安全標準後,可進行部署。
- 高於門檻:超過風險門檻且缺乏足夠安全緩解措施的模型,其部署應被中止,監督應加強,並通知監管機構以決定必要的防護措施。
大規模訓練執行的預註冊
Anthropic 建議AI開發者在訓練開始前,向其國家政府預註冊大規模訓練執行的詳細資訊。此註冊資料庫將追蹤:
- 模型規格與類型
- 計算基礎設施
- 預期訓練完成日期
- 安全計畫
此流程旨在讓監管機構在模型建立前即知悉潛在風險,且聚合資料將受到高標準的資安與隱私保護。
外部審計與紅隊測試
為驗證安全主張,Anthropic 建議強制要求外部紅隊測試,並賦予第三方審計機構權力。
第三方審計機構要求
審計機構必須具備以下三項關鍵特質,方能有效執行任務:
- 技術素養:具備深厚的機器學習經驗。
- 安全意識:具備保護可能對國家安全構成威脅的敏感智慧財產權的能力。
- 彈性:具備執行輕量級評估的能力,能在不影響美國競爭力的情況下識別威脅。
外部紅隊測試
外部紅隊測試應作為釋出先進AI系統的先決條件。Anthropic 建議由NIST等中央機構管理,或透過研究者API存取的去中心化方式執行。公司強調,必須在強制實施前建立高品質的紅隊測試選項,因為目前具備必要人才的機構主要集中在私人實驗室。
可解釋性與產業合作
Anthropic 主張透過政府補助大學、非營利組織與企業,增加對可解釋性研究的資金投入。這可讓安全工作在前沿實驗室之外的小型模型上進行。
此外,該提案也針對兩項系統性障礙提出解決方案:
- 法規可行性:Anthropic 指出,目前要求模型完全可解釋的法規尚不可行,但隨著研究進展,未來可能實現。
- 反壟斷清晰度:監管機構應提供明確指引,說明AI公司如何在公共利益下協調安全事務,而不違反反壟斷法,以降低產業合作的法律不確定性。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch