Anthropicの責任あるスケーリングポリシー
Anthropicは、ますます高度なAIシステムの開発に関連する大規模なリスクを管理するための技術的および組織的プロトコルの枠組みである、責任あるスケーリングポリシー(RSP)を発表しました。このポリシーは、対応する安全対策やセキュリティ対策が実際に有効であることを確認した上で、AIの能力を拡張することを規定しています。
AI安全レベル(ASL)フレームワーク
AnthropicのRSPの中心は、米国政府の生物安全レベル(BSL)基準をモデルにしたAI安全レベル(ASL)システムです。このフレームワークでは、モデルの重大なリスクの潜在能力に応じて、安全対策、セキュリティ対策、運用基準が比例して拡張される必要があります。
ASLの定義と基準
- ASL-1:意味のある大規模なリスクをもたらさないシステム。たとえば2018年のLLMやチェス専用のAIシステムなど。
- ASL-2:危険な能力の初期の兆候を示すシステム(例:バイオ兵器の作成手順の提供)。ただし、信頼性が不足しているか、検索エンジンで既に入手可能な情報であるため、実用性はまだ低い。現在のLLM、Claudeを含むものすべてはASL-2に分類される。
- ASL-3:非AIベースの基準(たとえば教科書や検索エンジン)と比較して、重大な悪用リスクが大幅に増加するシステム、または低レベルの自律能力を示すシステム。
- ASL-4およびASL-5+:現在のシステム能力から遠く離れているため、まだ定義されていませんが、自律性と重大な悪用リスクの質的拡大を伴うことが予想されます。
セキュリティ対策と実装
モデルのASLスケールが上昇するにつれて、セキュリティ要件はより厳格になります。ASL-2の対策は、Anthropicの以前のホワイトハウスへの約束と一致しています。ASL-3では、より厳しい基準が求められ、セキュリティ要件の強化に加え、世界最高レベルのレッドチームによる攻撃的テストで重大な大規模な悪用リスクを示した場合、モデルの展開をしないことを約束する必要があります。
ASL-4では、AnthropicはASL-3に到達する前に対策を定義することをコミットしています。これらの対策には、現在解決されていない研究課題の解決が含まれる可能性があり、たとえば解釈可能性手法を用いて、モデルが大規模な行動を取る可能性が低いことを機械的に証明することなどが含まれます。
運用およびビジネスへの影響
RSPは、リスク低減と有益なAIアプリケーションの追求のバランスを図るために設計されています。より強力なモデルのトレーニングが、安全対策の遵守能力を上回る場合、一時的にトレーニングを停止するメカニズムが設けられています。この構造は、安全対策の解決を促進し、さらなるスケーリングを可能にする意図があります。
ビジネスの観点から見ると、RSPはClaudeの現在の利用状況や可用性に変更を加えません。Anthropicはこのポリシーを、航空機や自動車産業における市場投入前のテストに例え、製品が市場に提供される前に安全が厳密に証明されることを強調しています。
治理と進化
AnthropicのRSPは、取締役会によって正式に承認されており、ポリシーの変更は、長期的利点信託との協議を経て、取締役会の承認が必要です。このポリシーは初期のバージョンであり、AI分野の進展に伴い、迅速な修正を繰り返しながら進化することが期待されています。
Anthropicは、ARC Evalsの影響を認め、特にAIリスク評価の専門性および広範なARC責任あるスケーリングポリシー枠組みの開発について言及しています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch