AnthropicのLLMとバイオリスク:AIを活用した生物的脅威の評価

TL;DR

Anthropicは、Claude Opus 4にAIセーフティレベル3(ASL-3)の保護機能を導入し、化学・生物・放射性・核兵器の開発を支援しないようにしました。また、大規模言語モデル(LLM)が生物的リスクを拡大する可能性と、そのリスクを軽減するための対策について包括的な分析を公開しました。


ASL-3保護機能の重要性

Anthropicは、Claude Opus 4をリリースする際にASL-3保護機能を有効化しました。性能の向上により、基礎的なSTEM背景を持つ個人がCBRN兵器を開発しようとした場合、モデルがその支援を可能にする可能性を完全に排除できなくなったためです。これらの保護機能は、生物兵器化に関する手順、設計、詳細な知識を求めるクエリをブロックすることに焦点を当てています。

"私たちの評価においてモデル性能を向上させた結果、最も先進的なモデルが、基礎的なSTEM背景を持つ人々がこうした兵器の開発を試みた場合に、その能力を高める可能性を確信して排除できなくなった。その潜在的な結果を考慮し、私たちの評価と対応するセーフティ対策の主要な焦点は、生物兵器に集中した。" – Anthropic, LLMs and biorisk

LLMと生物兵器の交差点

AIが現代の情報伝達手段となる

歴史的に、テロ組織は印刷されたマニュアルからインターネット検索へと武器製造の手順を求める手段を移行してきました。Anthropicは、AIが次の段階になると主張しています。それは、矛盾するインターネットコンテンツをフィルタリングし、リアルタイムのガイダンスを提供し、実行可能なプロトコルを生成できる会話型アシスタントです。

生物学的リスクの特異性

  • 高インパクトの結果 – 有効なウイルス攻撃は、大多数の従来兵器とは異なり、世界中に広がる可能性がある。
  • 物質的障壁の低下 – 核酸合成のコスト、標準化された試薬キット、手頃な価格のPCR装置の価格が低下し、専門的なサプライチェーンの必要性が減少した。AIは、残存する情報的障壁をさらに弱体化させる。

モデルの知識と専門家の知識の違い

LLMは、科学論文、教科書、オンラインディスカッションを含む広範なコーパスで訓練されており、幅広い生物学的知識ベースを備えています。Anthropicの内部評価では、Claudeの専門ベンチマークにおけるパフォーマンスが、専門家レベルの基準に達しているか、あるいはそれを上回っていることが示されています。

ビロロジートラブルシューティングベンチマーク(VCT)

1年以内に、Claudeは世界クラスの専門家を下回る水準から、SecureBioが設計したビロロジートラブルシューティング(VCT)評価において、快適にそれを上回る水準まで向上しました。

Claude VCTパフォーマンス

図1. VCTにおけるClaudeのパフォーマンス。専門家レベルのスコアへの急速な上昇を示している。

同様の傾向は、複数の分子生物学ベンチマークで確認されており、LLMが専門家と匹敵する広さと深さの知識を獲得できることを示しています。

実用的な向上効果の証拠

Anthropicは、参加者が2日間で生物兵器の調達計画を策定する制御実験を実施しました。

  • 対照群:標準的なインターネットリソースのみにアクセス。
  • 治療群:同じリソースに加え、Claude 4(研究のために一時的に保護機能を無効化)を提供。

バイオ防衛専門家による評価結果では、Claudeを活用した参加者の全体的なスコアが高く、重大な失敗も少なかったです。

アップリフト試験の原始スコア アップリフト試験の重大な失敗数

図2.(上段)アップリフト試験の原始スコア;(下段)重大な失敗数。Claudeを活用したグループは著しく優れた結果を示した。

Anthropicは、テキストベースのアップリフト試験は現実のラボ作業の完全な代理ではないと指摘していますが、非専門家が優れたガイダンスを得る可能性のある道筋を示していると述べています。

ラボレベルの実験

2024年に実施された小規模なウェットラボパイロット(n = 8)では、Claudeを使用するグループとインターネットのみにアクセスするグループを、基本的な生物学プロトコルの実施において比較しました。統計的に有意な向上は観察されませんでしたが、両グループとも予想以上に良好な結果を出しており、実践的なラボ知識が想定よりも大きな障壁ではない可能性を示唆しています。

Anthropicは現在、Frontier Model ForumおよびSentinel Bioと共同で、より大規模なウェットラボ研究を実施しており、以下の点を体系的に評価しています。

  1. 非専門家が現実的なラボタスクにおいて示すベースラインパフォーマンス。
  2. AIアシスタンスを提供した際の段階的な向上効果。

拡大された試験により、実践的知識の役割とAI駆動リスクの規模が明確になるでしょう。

リスク低減戦略

情報共有と公私連携

Anthropicは、バイオ防衛専門家、米国AI標準・イノベーションセンター(CAISI)、英国AIセキュリティ研究所との継続的な協議を重視しています。透明性のある責任あるスケーリング政策の推進と、危険な能力評価の公開を提唱しています。

自動化されたデプロイメント保護

  • コンスティチューショナル・クラスファイアは、リアルタイムで入出力を監視し、有害な情報の狭い範囲をブロックします。
  • ASL-3保護は、予防措置として現在、Claude Opus 4ファミリーにのみ適用されています(詳細なASL-3レポートを参照)。
  • セーフガードチームは、プラットフォームの活動を継続的に監視し、悪用のパターンを検出し、是正措置を実施できます。

国家政策との整合性

Anthropicは、米国のAIアクションプランがバイオセキュリティに焦点を当てており、核酸合成のスクリーニング強化やCAISI主導のセキュリティ評価が含まれていることに歓迎の意を示しています。政府と業界の連携した取り組みが、AIを活用したバイオリスクに対するレジリエンスを構築するために不可欠であると描いています。


関連するAnthropicの研究

  • Emerging multi-agent systems – システム的な失敗を引き起こす行動的傾向。詳細を見る
  • Worker retraining programs – David Roodmanとの共同執筆による証拠レビュー。詳細を見る
  • Claudeの数学的能力 – リーマン予想の下限に関する進展。詳細を見る

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch