Anthropic: AIシステムの評価における課題

AIシステムの堅牢で信頼できる評価方法を開発することは極めて困難であり、AIガバナンスの有効性は、モデルの能力と安全性を意味のある形で測定できる能力に直接依存しています。Anthropicの研究によれば、既存の多くの評価スイートは、データの汚染、実装の複雑さ、および人間による評価の主観性により、パフォーマンスの正確な指標として機能する能力に限界があります。

多肢選択式評価の限界

標準的な多肢選択式テストは、精度メトリクスを通じてモデルのパフォーマンスを定量化するために頻繁に使用されますが、いくつかの失敗モードに陥りやすい傾向があります。Massive Multitask Language Understanding (MMLU) ベンチマークを例に挙げると、Anthropicは4つの主要な課題を特定しました。

  • データ汚染: MMLUは広く使用されているため、モデルがトレーニング中にテスト問題を遭遇する可能性が高く、「カンニング」につながります。
  • フォーマットの感度: フォーマットのわずかな変更(例: "(A)" を "[A]" に変更する)により、精度が約5%変動することがあります。
  • 一貫性のない実装: 異なる研究室が、few-shot learning や chain-of-thought reasoning といった異なる手法を使用するため、研究室間での比較が信頼できなくなります。
  • 品質の問題: 一部の MMLU の例はラベル付けが誤っていたり、回答不能であったりします。

社会的バイアスの測定はさらに複雑です。Bias Benchmark for QA (BBQ) を実装する際、Anthropicは、モデルが「バイアス・スコア」0を達成しても、それが誤解を招く可能性があることを見出しました。場合によっては、モデルが単に質問に全く回答していないだけで、技術的にはバイアスがないものの、役に立たない出力結果となっていることがあります。

第三者評価フレームワークの課題

第三者フレームワークは、独立かつ中立的な評価を提供することを目指していますが、スケーラビリティとモデル固有のニュアンスへの対応に苦慮することがよくあります。

Bottom-Up フレームワーク (BIG-bench)

BIG-bench は、数百人の著作者から評価項目を収集していますが、インストールに必要な多大なエンジニアリング作業、スケーリング効率の低さ、および特定の特定の実装(BBQ-lite など)におけるバグの存在により、Anthropicにとって扱いづらいものであることが判明しました。

Top-Down フレームワーク (HELM)

Stanford の Holistic Evaluation of Language Models (HELM) は、専門家がキュレーションしたタスクを使用します。これによりAI研究室のエンジニアリング負担は軽減されますが、他の問題が生じます。

  • フォーマットの不一致: HELM は Claude モデルが学習用に使用する特定の "Human/Assistant" フォーマットを使用していないため、不自然な応答を引き起こし、誤解を招くパフォーマンス・メトリクスにつながります。
  • 遅いイテレーション: ボランティアによる取り組みであるため、HELM の新しいモデルを評価するためのターンアラウンドタイムは数ヶ月かかることがあり、AIモデルの急速な進化に遅れをとります。

人間による評価の主観性と複雑さ

AIシステムはオープンエンドな対話のために設計されているため、人間による評価は必要不可欠ですが、本質的に主観的であり、コストもかかります。

クラウドワーカーによる A/B テスト

Anthropic は、人間がモデルの応答を役立ちやすさと無害性の観点からランク付けする A/B テストを使用しています。しかし、この手法には主に3つの限界があります。

  1. リソースの集約性: 第三者プラットフォーム、カスタムインターフェース、およびクラウドワーカーを雇用するための倫理的課題に関連する高いコスト。
  2. 評価者のばらつき: 結果は、評価者の創造性、モチベーション、および欠陥を見つける能力に基づいて変動します。
  3. 役立ちやすさと無害性の緊張関係: モデルは、単に回答を拒否することで「無害性」を達成できる可能性があり、その結果、有用性と安全性の間でトレードオフが生じます。

国家安全保障における Red Teaming

フロンティア・リスク(例:化学、生物、放射性、および核のリスク)に対するモデルの評価には、専門知識が必要です。このプロセスは現在「科学というよりも芸術」の状態であり、以下のような特定のハードルに直面しています。

  • 専門知識: リスクは複雑であり、敏感な、現実世界のシナリオに依存します。
  • 情報のサイロ化: セキュリティ・クリアランスの必要性が、レッドチームのメンバーが、脅威を軽減するために必要なAI開発者と重要な詳細を共有することを妨げる可能性があります。
  • 法的リスク: レッドチーミングにおける制御された情報の出力は、法的な影響を及ぼす可能性があります。

モデル生成による評価と第三者監査

「Ouroboros」効果

AI を用いて AI の評価を生成することは、数ヶ月ではなく数分で結果を得ることを可能にします。Constitutional AI (CAI) のように、モデルベースのレッドチーミングが人間にとってより無害なモデルを生み出した例に見られるように、有望な側面もありますが、モデル自身の社会的バイアスや捏造(fabrication)を引き継ぐリスクがあります。

第三者監査

Alignment Research Center (ARC) のような組織による監査は、深い、独立したリスク評価を提供します。しかし、監査人の誠実性(詳細の共有を制限する)と、開発者がプロンプト・エンジニアリングやファインチューニングの専門知識を通じて監査人にモデルの性能限界に到達させることを支援する能力との間に、緊張関係が存在します。

AI 評価のための政策提言

AI 測定の科学を向上させるために、Anthropic は以下の政策アクションを提案しています。

  • 再現可能な科学への資金提供: 政府は、低品質な評価の量よりも、高品質で再現可能な方法論への資金提供を優先すべきです。
  • 実装サポート: 資金は、既存のベンチマーク(BIG-bench など)のインストールが容易なソフトウェアパッケージや、標準化された動的ベンチマークの作成に向けて提供されるべきです。
  • 機関の権限強化: National Institute of Standards and Technology (NIST) のような機関への資金提供を増やし、公的な "AI safety leaderboards" を維持することで、安全性のパフォーマンスをインセンティブとして与えるべきです。
  • 法的セーフハーバー: 責任ある開示プロトコルとともに、研究室、研究室、政府、および第三者が、法的 repercussions と法的な影響を伴わずに、国家安全保障上のリスクを評価するためにモデルを評価することを可能にする法的保護(セーフハーバー)の構築が必要です。

Sources

関連