NTIAに対するAnthropicのAIアカウンタビリティに関する推奨事項

Anthropicは、米国国家電信情報局(NTIA)によるAIアカウンタビリティに関する意見公募に対し、正式な回答を提出しました。この提案は、モデルの能力向上に伴い、安全性とアカウンタビリティを確保するために、高度な人工知能システムを評価するための構造化されたアプローチの概要を示しています。

Standardized Evaluations and Funding

Anthropicは、厳格で標準化されたベンチマークを作成するために、AIモデルの評価研究に対する政府の資金提供を増やすことを推奨しています。これらの評価の開発はリソースをintensiveなものとするため、公的資金は進歩のための重要な推進力であると考えられています。

評価に関する主な提案は以下の通りです:

  • Disclosure Requirements: AI企業は、知的財産(IP)や機密情報を保護するため、必ずしも一般公開する必要はないものの、規制当局に対して評価方法と結果を開示することを義務付けられるべきです。
  • Industry Standards: 政府機関、特に米国国立標準技術研究所(NIST)は、業界と協力して、モデルの能力、限界、およびリスクを評価するためのベストプラクティスとベンチマークを確立すべきです。

Risk-Responsive Assessments and Thresholds

規制がモデルによってもたらされるリスクに比例するようにするため、Anthropicは、自律性や欺瞞といった重大なリスクを対象とした標準的な能力評価の開発を提案しています。

このフレームワークは、リスクベースのデプロイメント・パイプラインを提案しています:

  • Risk Threshold Establishment: 研究と資金提供は、特定の的なリスク閾値を定義するために使用されるべきです。
  • Below Threshold: この閾値未満のモデルは、既存の安全基準への準拠を検証した後にデプロイ可能です。
  • Above Threshold: リスク閾値を超え、十分な安全対策が欠如しているモデルは、デプロイを停止し、監視を強化し、規制当局に通知して、必要な保護策を決定する必要があります。

Pre-registration of Large Training Runs

Anthropicは、AI開発者が大規模なトレーニング・ランの詳細は、トレーニング開始前に国家政府に事前登録するための機密レジストリを提案しています。このレジストリは、以下を追跡します:

  • Model specifications and type
  • Compute infrastructure
  • Intended training completion date
  • Safety plans

このプロセスは、モデルが作成される前に規制当局が潜在的なリスクを認識できるようにすることを目的としており、集計されたデータは高度なサイバーセキュリティとプライバシー基準によって保護されます。 or the purpose of the following translation, translation of the

External Auditing and Red Teaming

安全性の主張を検証するため、Anthropicは、外部レッドチーミングの義務化と、第三者監査人の権限強化を推奨しています。

Third-Party Auditor Requirements

監査人は、効果的に機能するために、以下の3つの特定の特性を備えている必要があります:

  1. Technical Literacy: 深い機械学習の経験。
  2. Security Consciousness: 国家安全保障上の脅威となる可能性のある機密IPを保護する能力。
  3. Flexibility: 米国の競争力を妨げることなく、脅威を特定するための軽量な評価を実施する能力。

External Red Teaming

外部レッドチーミングは、高度なAIシステムのリリースに向けた前提条件であるべきです。Anthropicは、これをNISTのような中央集権的な機関、または研究者によるAPIアクセスを通じた分散型のアプローチによって管理することを提案しています。同社は、、このことが義務化される前に、高品質なレッドチーミングの選択肢が確立される必要があると強調しています。現在の必要な才能は、主に民間ラボに存在しています。

Interpretability and Industry Collaboration

Anthropicは、大学、非営利団体、および企業への政府助成金を通じて、解釈可能性(interpretability)の研究に対する資金提供を増やすことを行うことを提唱唱しています。これにより、フロンティア・ラボの外側で、より小さなモデルに対して安全性に関する研究が行えるようになります。

Additionally, the proposal addresses two systemic hurdles:

  • Regulatory Feasibility: Anthropicは、完全に解釈可能なモデルを要求する規制は、現在は実現不可能ですが、研究が進展するにつれて可能になる可能性があります。
  • Antitrust Clarity: 規制当局は、AI企業が独占禁止法に違反することなく、公共の利益のために安全性の向上についてどのように連携できるかについて、明確なガイダンスを提供すべきであり、これにより業界の協力に関する法的不確実性を軽減します。

Sources

関連