Anthropic Frontier Threats Red Teaming for AI Safety

Overview

Anthropicは、バイオセキュリティやサイバーセキュリティなど、国家安全保障にリスクをもたらす可能性のあるAI能力を特定し、軽減するための「フロンティア脅威レッドチーミング」アプローチを導入しました。この敵対的テストフレームワークは、一般的なクラウドソースによるレッドチーミングを超え、専門家が主導する特化した評価へと移行することで、悪意のあるアクターによって悪用される可能性のある潜在的なモデル能力を明らかにすることを目的としています。

Methodology for Frontier Threats Red Teaming

フロンティア脅威レッドチーミングには、潜在的なモデル能力を明らかにするために、専門知識と時間への集中的な投資が必要です。Anthropicのプロセスには、以下の主要な構成要素が含まれます:

  • Expert Collaboration: 脅威モデルを定義するために、数十年の経験を持つドメインエキスパートと提携することから始まります。これらのモデルは、どのような情報が危険であるか、その情報がどのように組み合わさって危害を及ぼすか、そして情報が危険となるために必要な正確性と頻度を特定します。
  • Intensive Probing: 分野の専門家およびLLMの専門家は、能力を調査するためにモデルとの対話に多大な時間(100時間以上)を費やします。これには、安全フィルターを回避するためにモデルを「jailbreak」する方法を学習することが含まれます。
  • Automated Evaluations: 主な目標は、専門家の知識に基づいた新しい自動評価およびツールを開発し、テストプロセスを再現可能かつスケーラブルにすることです。
  • Secure Infrastructure: 明らかになった情報は非常に機密性が高いため、この作業は信頼できる第三者とのパートナーシップと強力な情報セキュリティ保護を通じて行われます。

Findings from Biosecurity Red Teaming

Anthropicは、生物学的リスクに焦点を当てたテストプロジェクトを実施しました。公開されている信頼性と安全性のモニタリングを使用せず、安全なインターフェースを使用して、バイオセキュリティの専門家と共に150時間以上を費やしました。

Key Risks Identified

  • Expert-Level Knowledge: フロンティアモデルは、時として専門家レベルの、洗練された、正確で詳細な知識を生成することがあります。この能力は、モデルの規模が大きくなるにつれて増大します。
  • Acceleration of Harm: 緩和策のないLLMは、検索エンジンのみを使用する場合と比較して、悪意のあるアクターによる生物学の悪用能力を加速させる可能性があります。これにより、本来であれば不可能であったタスクが可能になります。現在、これらの影響は小さいものの、急速に拡大しています。
  • Near-Term Timeline: Anthropicは、緩和策が講じられない場合、これらの生物学的リスクは5年後ではなく、今後2〜3年以内に現実のものとなる可能性があると推定しています。

Implemented Mitigations

Anthropicは、これらのリスクを大幅に軽減できることを発見しました:

  • Training Process Adjustments: Constitutional AIで使用されるようなトレーニングプロセスにおける変更は、モデルが有害な生物学的利用と無害な利用をより適切に区別するのに役立ちます。
  • Classifier-Based Filters: これらのフィルターは、悪意のあるアクターが危害を及ぼすために必要な、連鎖的な専門家レベルの情報を取得することを困難にします。これらの緩和策は、現在Anthropicの公開されているフロンティアモデルに導入されています。

Future Research and Industry Implications

Anthropicは、現在のフロンティアモデルの状態が業界への「警告ショット」を提供していると主張しています。同社は、以下の将来の方向性に焦点を当てています:

  • Comparative Speedup Analysis: 次世代、ツール使用、およびマルチモーダルモデルにおいて、従来の検索エンジンと比較してLLMが危害の生成に向けて提供するスピードアップを測定します。
  • Open-Weight Model Risks: Anthropicは、十分に能力のあるベースモデルの重みから、オープンに利用可能な、十分に能力のあるベースモデルを適応させた、より小さな、ファインチューニングされたモデルから、悪意のあるアクターが有害な生物学的能力を抽出できる可能性があると警告しています。
  • Collaborative Disclosure: Anthropicは、リスクと緩和策を他の研究室や政府機関に報告するための開示プロセスを確立しています。
  • Third-Party Evaluation: 同社は、機密情報に対する適切な保護策を講じた上で、国家安全保障評価を実施するための、公平な第三者機関の創設を提唱しています。

Scaling the Research Agenda

Anthropicは、将来の能力を検討するために実験を行い、スケーラブルな評価を構築するために、フロンティア脅威レッドチーミングチームを拡張しています。このフレームワークは、モデルの欺瞞(deception)などの他の長期的なリスクに対しても、回避すべき将来の能力を識別し、その能力が現れる前にアライメント技術を構築することで、適用されることを意図しています。

Sources

関連