Anthropic Frontier Red Team Progress Report

AnthropicのFrontier Red Teamは、AIモデルがサイバーセキュリティおよび生物学におけるデュアルユース(軍民両用)能力において、急速な進歩を示す「早期警告」の兆候を見せていることを観察しました。モデルはサイバー分野で学部生レベルのスキルに到達またはそれを超えつつあり、一部の生物学的領域では専門家レベルの知識を有していますが、現時点では国家安全保障に対して実質的に高まったリスクをもたらすために必要な閾値には達していません。

Rapid Advancement in Cybersecurity Capabilities

サイバー領域におけるAI能力は、わずか1年以内に基礎レベルから学部生レベルの習熟度に移行しました。この進歩は、Capture The Flag (CTF) エクササイズや公開ベンチマークにおけるパフォーマンスによって証明されています。

  • CTF Performance: Claudeは1年足らずの間に、Intercode CTFチャレンジ(高校生向けに設計)の解決率が25%未満であった状態から、ほぼすべてを解決できる状態へと進歩しました。
  • Cybench Benchmark: Claude 3.7 Sonnetは、5回の試行以内でCybenchチャレンジの約3分の1を解決しており、これは前年のフロンティアモデルの成功率5%から大幅な増加となっています。
  • Task Diversity: リモートサーバーの脆弱性の発見と悪用("pwn")、Webアプリケーション("web")、および暗号プロトコル("crypto")を含む、複数のカテゴリにわたって改善が見られます。

これらの進歩にもかかわらず、Claudeはバイナリ実行ファイルの逆コンパイル(reverse engineering)や、支援なしでネットワーク環境内での偵察および悪用を行うことにおいては、依然として人間の専門家には及びません。

Network-Scale Cyber Operations

Carnegie Mellon Universityとの協力により、Anthropicは、約50台のホストで構成される現実的なサイバーレンジでモデルをテストしました。モデルはまだこれらの環境で自律的に成功することはできませんが、Incalmoのような専門的なソフトウェアツールを備えた場合、個人を特定できる情報の大量窃取(Equifaxの流出事件に類似)を再現することが可能です。このインフラストラクチャにより、Anthropicは自律的な能力が向上する瞬間を監視することができます。

Progress and Gaps in Biosecurity Knowledge

Claudeは、生物学的理解において急速な進歩を示しており、世界クラスのウイルス学の専門家を下回る状態から、1年以内にVCT評価(ウイルス学タスクのトラブルシューティング)においてその基準を快適に超えるレベルへと移行しました。

Biological Expertise vs. Practical Risk

生物学的能力は、タスクによってばらつきがあります。

  • Strengths: Claude 3.7 Sonnetは、生物学プロトコルの理解やDNAおよびタンパク質配列の操作において人間の専門家レベルに近づいており、クローニングのワークフローにおいては人間の専門家レベルを超えています。
  • Weaknesses: モデルは、科学的な図表の解釈においては、依然として人間の専門家よりも劣っています。

兵器化のリスクに関しては、小規模な制御下での研究により、最新のモデルはインターネットのみにアクセスできる初心者と比較して、ある程度の能力向上(uplift)を提供しますが、結果として得えられた計画には、現実世界での失敗につながる重大なミスが含まれていました。専門家によるレッドチーミングの結果、計画における重大な失敗の数は、現時点では、悪意のある初心者が攻撃をエンドツーエンドで実行することを可能にするには高すぎると結論付けられました。

Strategic Partnerships and Safety Frameworks

Anthropicは、能力の閾値に基づいてセキュリティレベルを引き上げるResponsible Scaling Policy (RSP) を活用しています。これらのリスクを検証するため、ラボはいくつかの外部パートナーシップを採用しています。

  • AI Safety/Security Institutes: モデルは、米国および英国のAI Safety Institutes (AISI) によるデプロイ前のテストを受けており、これがClaude 3.7 SonnetのAI Safety Level (ASL) の決定に役立ちました。
  • National Nuclear Security Administration (NNSA): Anthropicは、核および放射性リスクに関する知識を評価するため、米国エネルギー省のNNSAと提携し、機密環境下でClaudeを評価しました。

Future Outlook and Risk Mitigation

Anthropicは、リスクをより早期に検知するため、より頻繁で自動化された評価へと規模を拡大しています。ラボは、モデルが「extended thinking」において向上するにつれ、Incalmoのような外部ツールキットの必要性が減少する可能性がある(モデルが「out of the box」でより高い能力を持つようになるため)と指摘しています。

現在の生物学的研究に基づくと、Anthropicは、自社のモデルがAI Safety Level 3 (ASL-3) のセーフガードが必要となる能力の閾値に近づいていると考えており、これに伴い、必要なセキュリティ対策への投資を増やしています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch