Anthropic 第三者テストAIポリシー案

TL;DR

Anthropicは、安全性に関する主張を検証し、社会的な危害を防ぐために、フロンティアAIシステムに対する第三者テスト体制の確立を提唱しています。このアプローチは、業界、政府、学術界が関与する、広く信頼される監視インフラを構築し、自己管理だけでは対処できないリスクを管理することを目指しています。

第三者による監視の必要性

フロンティアAIシステム(膨大な計算リソースを必要とする大規模な生成モデル)は、数多くのダウンストリームのユースケースに適応可能な「万能マシン」として機能します。これらのシステムはベースモデルの能力と弱点を継承するため、既存のセクター別の規制枠組みにはうまく当てはまりません。

Anthropicは、自社のResponsible Scaling Policy (RSP) のような自己管理フレームワークは不可欠であるものの、単一の民間企業による決定に依存しているため、それだけでは不十分であると主張しています。強固な第三者体制が必要な理由は以下の通りです:

  • 安全性の検証: 選挙の完全性、有害な差別、および国家安全保障上の悪用に関するモデルの挙動を、独立して検証すること。
  • 壊滅的な事故の防止: コードへの脆弱性の挿入や、人間の意図に反する行動など、創発的で自律的な挙動を特定すること。
  • 「反射的な」規制の回避: 重大なインシデントが発生した際に、抑制的で非効率的な立法措置につながることを防ぐため、効果的な規制を事前に設計すること。

強固なテスト体制のためのフレームワーク

効果的なテスト体制は、小規模な企業に不利益を与えないよう、最も計算集約的で大規模なシステムのみに適用されるよう、正確に範囲を絞る必要があります。Anthropicは以下の構造的要素を提案しています:

二段階テストプロセス

  1. 自動化ステージ: 潜在的な問題を迅速に特定するため、偽陰性を避けることに重点を置いた、高速で広範なテストフェーズ。
  2. エキスパート・ステージ: フラグが立てられた問題に対して、専門家による人間主導の引き出し(elicitation)を利用した、徹底的な二次テスト。

多様なテスト・エコシステム

正当性と競争を確保するため、テストはさまざまな主体によって実施されるべきです:

  • 民間企業: 下請け企業(例:Gryphon Scientific)や、財務会計で使用されるものと同様の監査法人。
  • 大学: 政府機関の監督下にある可能性もある、テスト・イニシアチブを運営する学術機関。
  • 政府: 特定の、法的に義務付けられた領域、特に機密扱いの国家安全保障上のリスクを伴う領域に対する直接的なテスト。

実装のための主要要件

  • 共通の標準: 安全性テストのフレームワークに何を含めるべきかについて、業界、政府、学術界の間で合意すること。
  • 政府の資金提供: テストの構築と分析を行う技術的な作業を資金提供するため、政府機関(例:NIST, US AI Safety Institute)へのリソースの増強。
  • 公共インフラ: 学術界や政府が、フロンティアシステムを研究・テストするための独立した能力を開発できるよう、「国家研究クラウド」を構築すること。

国家安全保障と高リスク能力

Anthropicは、国家安全保障を、第三者テストが極めて重要となる主要な領域として特定しています。具体的には、システムが生物兵器の製造を加速させたり、複雑なサイバー攻撃を実行したりする能力など、国家安全保障を損なう可能性のある能力についてテストを行うべきです。そのような能力が発見された場合、Anthropicは、広く展開されているモデルからその能力を削除するか、あるいは「顧客を知る(KYC)」体制を導入するといった緩和策を提案しています。

オープンソースモデルと規制の虜(Regulatory Capture)への対応

公開されたモデル

Anthropicはオープンソース研究の価値を認めていますが、モデルの能力が向上するにつれて、フルオープンな公開文化が社会的な安全性と衝突する可能性があると示唆しています。彼らは、モデルが公開される場合、悪用を可能にするファインチューニングに対して耐性を持つ必要があると提案しています。第三者テストは、不適切な悪用を定義し、それらの基準を、プロプライエタリなモデルとオープンウェイト・モデルの両方に一貫して適用するための、唯一の正当な方法として提示されています。

規制の虜(Regulatory Capture)の緩和

十分なリソースを持つAI企業が、規制を利用して競争を回避し、他社を抑制するために規制を使用することを防ぐため、Anthropicは、大企業に依存しない独立したテスト能力の構築を提唱しています。高コストなコンプライアンス・コンソーシアムではなく、測定と第三者能力に焦点を当てることで、このポリシーは、小規模な開発者にとっても公平な競争環境を維持することを目指しています。

Anthropicによる支援のコミットメント

この体制を構築するため、Anthropicは以下を約束します:

  • 自社のResponsible Scaling Policy (RSP) を通じて、テスト体制のプロトタイプを作成すること。
  • 契約業者や政府パートナーを通じて、第三者による評価を実施すること。
  • リスクと緩和策を明確にするため、フロンティア・レッドチーミングを拡大すること。
  • NISTや国家研究インフラの開発のための政府資金提供を提唱すること。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch