Anthropic と Accenture が先端 AI 用の埋め込み評価で提携

Anthropic は Accenture と提携し、「埋め込み評価(embedded evaluation)」を実施しています。これは、独立した評価者が AI 企業内部に常駐し、安全上の約束の検証やモデル開発の評価を行うプロセスです。この提携は、外部の専門家が訓練プロセスや内部意思決定に従業員レベルのアクセスを持つことで、AI の安全性の検証可能性を高めることを目的としています。

埋め込み評価モデル

埋め込み評価は、従来の外部評価とは異なり、独立した評価者に従業員と同等のアクセス権を付与します。この内部視点により、評価者は以下のことが可能になります。

  • モデル開発の監視: 訓練フェーズ中にモデルがどのように構築されていくかを観察する。

  • 内部ガバナンスの監査: モデルの構築および展開を規定する意思決定を追跡する。

  • 従業員との直接対話: ブラインドスポットを特定し、運用上の安全性を評価するために、従業員と直接やり取りする。

  • 公開報告: イベントを報告し、モデルに関連するリスクと利点について、一般により正確な情報を提供する。

Anthropic は、これらの評価者が検証を行う一方で、モデルの安全性に対する最終責任は AI 開発者に残ると述べています。

提携の範囲と投資

この提携は、Accenture の専門 AI ビジネスである Faculty が主導しています。業務範囲には、モデルの評価および赤チーム作業、アライメント評価、モデルの安全対策のテストが含まれます。Accenture がさまざまな業界や政府での AI の展開経験を活かし、これらの評価における安全性アプローチを強化する予定です。

Anthropic と Accenture は、今後 5 年間でそれぞれ少なくとも 10 億ドルをこの分野の能力強化に投資する予定です。

資金調達と標準化の課題

現在、埋め込み評価者に対する情報アクセスや報告に関する明確な基準がなく、資金調達の仕組みも確立されていないため、現在の取り組みは以下の通りです。

  • 直接資金提供: この取り組みの重要性と緊急性から、Anthropic が Accenture の業務を直接資金提供します。

  • 代替資金のパイロット: Anthropic は METR およびその他の非営利評価機関と協議中で、自らの独立した資金で埋め込み評価のパイロットを実施する予定です。

  • 長期的な目標: Anthropic は、6 月に発表した「先端 AI フレームワーク」で提案されているように、将来的には資金をプール化されたものや政府の資金源から調達することを提唱しています。

エコシステムと非排他的性

この提携は非排他的です。Anthropic は今後数週間以内に、さらに多くの評価機関と提携する予定です。同様に、Accenture も他の AI 開発者と同様の役割で協力します。目的は、先端 AI 分野が成熟するにつれて、共通の基準に基づいて運営される評価者エコシステムを構築することです。

Sources