OpenAI 生物学的脅威評価:早期警戒システムの構築
OpenAI は、AI モデルが生物学的脅威の作成リスクを実質的に高める可能性があるときに検出するための「トリップワイヤー」となる新しい評価手法を開発しました。この研究は、GPT-4 へのアクセスが、インターネット上で既に入手可能な情報を超えて、悪意ある行為者に危険な情報を提供するかどうかを判断することを目的としています。
研究デザインと方法論
AI がバイオリスク情報へのアクセスに与える影響を評価するため、OpenAI は 100 名の人間参加者を対象に、2 つのコホートに分けた研究を実施しました:50 名の生物学専門家(プロのウェットラボ経験を持つ博士号取得者)と、50 名の学生レベルの参加者(少なくとも大学レベルの生物学コースを1つ修了)です。
実験グループ
参加者は各コホート内でランダムに以下の 2 つのグループのいずれかに割り当てられました:
- Control Group(コントロールグループ): インターネットのみへのアクセス。
- Treatment Group(トリートメントグループ): GPT-4 とインターネットの両方へのアクセス。
評価範囲
参加者は、生物学的脅威作成プロセスの 5 段階をカバーするタスクを完了するよう求められました:
- 発想
- 取得
- 増幅
- 形成
- 放出
パフォーマンス指標
Gryphon Scientific の専門評価者は、客観的なルーブリックを用いて、1〜10 のスケールで 3 つの主要指標に対する回答を採点しました:
- Accuracy(正確性): 参加者がタスク完了に必要なすべての重要ステップを含んでいるかどうか。
- Completeness(完全性): 参加者が暗黙の情報や必要な詳細をすべて含んでいるかどうか。
- Innovation(革新性): 参加者が DNA 合成スクリーニングのガードレール回避など、新しいアプローチを考案したかどうか。
さらに、研究では 所要時間 と 自己評価された難易度 も追跡しました。
主な結果
GPT-4 へのアクセスはタスクパフォーマンスにわずかな改善をもたらしましたが、統計的に有意な差は見られませんでした。
パフォーマンス向上
- Accuracy(正確性): 専門家はインターネットのみのベースラインと比較して平均スコアが 0.88 上昇し、学生は 0.25 上昇しました。
- Completeness(完全性): 専門家は 0.82 の上昇、学生は 0.41 の上昇が見られました。
注目すべき観察結果
- Bridging the Gap(ギャップの埋め合わせ): 増幅および形成タスクにおいて、言語モデルへのアクセスにより学生のパフォーマンスが専門家のベースラインレベルにまで上がりました。
- Information Availability(情報の入手容易性): 本研究は、生物学的脅威作成のためのステップバイステップの手法を含む危険なコンテンツが、標準的なインターネット検索ですでに比較的容易に見つかることを確認しました。
- Physical Bottlenecks(物理的ボトルネック): OpenAI は、情報へのアクセスだけでは脅威の作成は不十分であり、ウェットラボへのアクセスや微生物学・ウイルス学の専門知識といった物理的制約が主なボトルネックであると指摘しました。
方法論的洞察とセキュリティ
OpenAI は、評価がモデルの全能力範囲を引き出すことを保証するために、特定の設計原則を実装しました:
- Human-in-the-Loop(ヒューマン・イン・ザ・ループ): 本研究は自動ベンチマークではなく人間の参加者を使用しました。人間はプロンプトを調整し、誤りを修正してモデルから情報をより効果的に抽出できるためです。
- Capability Elicitation(能力引き出し): 参加者は LLM の使用ベストプラクティスと失敗モード回避の訓練を受けました。専門家には、生物学的にリスクのある質問に対して拒否せずに応答するカスタムの研究限定版 GPT-4 が提供されました。
- Security Protocols(セキュリティプロトコル): Gryphon Scientific が実施したトレーニングでは、デュアルユース研究(DURC)と情報ハザードの生成を防止するための厳格な機密保持が取り上げられました。
バイオリスク評価の今後の方向性
OpenAI は、AI モデルに対する効果的な安全閾値を設定する際のいくつかの課題を特定しました:
- Defining "Tripwires"(「トリップワイヤー」の定義): 現在、情報アクセスの増加がどの程度リスクの実質的な増加を意味するかについて明確な基準がありません。
- Statistical Analysis(統計的分析): OpenAI は、リスク評価においては偽陰性(リスクの見逃し)の方が偽陽性よりもコストが高いため、従来の p ハッキングの最小化よりもリスク捕捉を優先する統計手法が必要であると提案しています。