Anthropic 責任的スケーリング・ポリシーに関する考察
Anthropicは、最先端のAIモデルにおける壊滅的なリスクと悪用を管理するための実用的なガイドラインへと、高レベルの安全コンセプトを変換するために、責任的スケーリング・ポリシー(RSP)を運用化しています。このポリシーは、安全性とセキュリティの対策がモデルの能力とともにスケールするように、組織の優先事項、プロジェクトのタイムライン、および脅威モデリングのための構造化されたフレームワークを確立します。
RSPの5つの高レベルのコミットメント
Anthropicの現在の責任的スケーリングのためのフレームワークは、適切な保護策なしに危険な能力を持つモデルを配備することを防ぐために設計された、5つの核心的なコミットメントに基づいています。
- レッドライン能力の確立: 現在の安全基準(ASL-2)の下で保存または配備するにはリスクが高すぎる特定の能力を特定し、公開すること。
- レッドライン能力のテスト: ドメインエキスパートと協力して、「Frontier Risk Evaluations」—モデルがレッドライン能力に近づいているか、あるいは到達しているかを示す実証的なテスト—を設計すること。
- レッドライン能力への対応: より高いティアの安全性とセキュリティの対策であるASL-3標準を開発すること。Anthropicは、レッドライン能力を持つモデルにASL-3標準を適用できない場合、トレーニングまたは配備を一時停止することを約束します。
- 反復的な拡張: ASL-3のアクティビティを進める前に、Anthropicは、その標準の上限を定義し、ASL-4標準が必要となるトリガーとなる新しいレッドライン能力を確立します。
- 保証メカニズム: 評価のためのストレス・テスト、緩和策の公開またはエキスパートによる検証、および取締役会とLong-Term Benefit Trustによる監視。
脅威モデリングと評価手法
Anthropicは、自社のFrontier Red TeamおよびAlignment Scienceチームを活用して、ASL-3標準をトリガーする能力を特定します。テストは現在、サイバーセキュリティ、CBRN(化学、生物、放射性、および核)、およびモデルが直近にテストされたモデルの4倍の計算量に達する場合のModel Autonomyの領域において実施されています。
評価アプローチ
Anthropicは、モデルのリスクを評価するために4つの主要な手法を用います。
- Question & Answer Datasets: 実行は速いですが、制約されたフォーマットによって制限される可能性があります。
- Human Trials: 悪用を測定するために、モデル支援を受けた被験者と検索エンジンを使用する被験者を比較します。これには、堅牢な統計的推論とエキスパートによるベースラインが必要です。
- Automated Task Evaluations: 自律的なアクションをテストするために仮想環境を使用します。これには、安全なインフラストラクチャと、ツール使用の、手動によるレビューが必要です。
- Expert Red-Teaming: トランスクリプトを通じてモデルの挙動をオープンエンドに探索し、、エキスパートの意見を求めます。
評価における技術的課題
Anthropicは、評価の信頼性に関して、いくつかの未解決の研究課題を特定しています。
- Predictive Scaling: 危険な閾値に達する前に緩和策を準備するために、現在の証拠を将来のリスクレベルへと外挿することの必要性。
- Capability Elicitation: プロンプト・エンジニアリングやファインチューニングのような技術が隠れた能力をアンロックしてしまうため、テスト中にすべての関連する能力が引き出されることを保証することの難しさ。
- External Legibility: 標準を緩和することによる生産上の圧力から回避するため、テスト結果を事前に指定すること。また、証拠を統合するためのより良い方法を模索すること。
ASL-3 セキュリティ標準
ASL-3標準は、非国家主体によるモデルの重みの盗難、または製品インターフェースを介したモデルの悪用を防ぐために設計されています。これは、国家レベルの主体による、多大なリソースを持つ主体に対する保護を目的としたものではありません。
製品インターフェースの安全性
Anthropicは、人間の悪用を防ぐために、「防御の深層化(defense-in-depth)」アプローチを採用しており、以下を組み合わせています。
- Reinforcement Learning from Human Feedback (RLHF) と Constitutional AI。
- プロンプト、完了、および会話における悪用を検出し出すための、多段階の分類器モデル。
- ジェイルブレイクに対するインシデント対応とパッチ適用。
インフラストラクチャと重みのセキュリティ
非国家主体に対する防御のため、Anthropicはセキュリティ・ワークフォースを増強しており、現在、従業員の約8%がセキュリティ関連の領域で働いています。主な技術的制御策は以下の通りです。
- Multi-party Authorization: アクセスに対して複数の承認を必要とすることで、データの流出を防ぐリスクを低減します。
- Time-bounded Access Controls: 最小権限の原則に基づき、一時的なアクセスを権限付与します。
- Insider Threat Mitigation: 内部者によるデバイスの侵害を、最も高いリスクベクターとして対処します。
ガバナンスと保証構造
RSPが意図した通りに実行されることを確実にするため、Anthropicはいくつかの監視メカニズムを実装しています。
Central Coordination: 専任のResponsible Scaling Teamが、ワークストリーム間の依存関係を管理します。
Adversarial Testing: Alignment Stress Testingチームが、「第二の防御線」として、評価および介入策のストレス・テストを行います。
Internal Reporting: 非遵守の報告ポリシーにより、従業員はResponsible Scaling Officerに対して、匿名で懸念事項を報告することができます。
External Oversight: 取締役会、Long-Term Benefit Trust、および米国商務省産業・セキュリティ局(Bureau of Industry and Security)に対して、定期的なアップデートが提供されます。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch