OpenAI、バイオロジーにおける将来のAIリスクに備える
OpenAIは、最先端AIモデルに関連する生物学的リスクを軽減するための包括的な戦略を発表しました。これらのモデルがバイオロジーにおいて「High」レベルの能力に近づくにつれ(OpenAIのPreparedness Frameworkで定義)、同社はAIの悪用による生物兵器の作成や生物学的脅威の再現を防止しつつ、正当な科学的発見を支援し続けるために、多層防御システムを導入しています。
予防的緩和と専門家協力
OpenAIは、生物学的リスクに対して予防優先のアプローチを採用し、脅威が発生する前に有害な能力へのアクセスを制限することに焦点を当てています。この戦略は、外部の領域専門家や政府機関との協力に大きく依存し、脆弱性を特定しシステムを強化します。
- 専門家相談: OpenAIは、生物安全保障、生物兵器、バイオテロの専門家や学術研究者と協力し、脅威モデル、能力評価、使用ポリシーの策定に取り組んでいます。
- 政府パートナーシップ: 同社は米国CAISIおよび英国AISIと提携し、Los Alamos National Laboratoryと協力してAIのウェットラボでの役割を研究しています。
- 検証: 生物学の博士号や修士号を持つ人間トレーナーが評価データの作成と検証に使用され、安全性評価の正確性が確保されています。
生物学的リスクに対する技術的安全対策
AIの生物兵器化の悪用を防止するため、OpenAIは製品全体にわたっていくつかの技術的制御を導入しています:
モデル訓練と応答フィルタリング
OpenAIは、明示的に有害なリクエストや生物兵器化を可能にするリクエストを拒否するようにモデルを訓練しています。遺伝子工学、免疫学、ウイルス学などの二重用途リクエストに対しては、モデルはModel Specに従い、実行可能なステップバイステップの指示やウェットラボのトラブルシューティングガイダンスの提供を避けます。目的は、専門家向けに高レベルの洞察を提供しつつ、初心者がシステムを悪用できる詳細情報は控えることです。
検出と執行
- 常時モニタリング: システム全体のモニタがリスクのある、または疑わしいバイオ関連活動を検出します。リクエストが安全でないとフラグ付けされた場合、応答はブロックされ、自動レビューがトリガーされ、人間によるレビューに進むことがあります。
- ポリシー執行: OpenAIは、製品の使用による危害を禁じています。悪用はアカウント停止につながり、重大なケースでは法執行機関への通報が行われます。
レッドチーミングとセキュリティ制御
- エンドツーエンドのレッドチーミング: OpenAIは、生物学領域の専門家と経験豊富なレッドチームメンバーを組み合わせ、洗練された敵対者をシミュレートし、安全システムのギャップを特定します。
- 重み保護: 防御層を重ねたアプローチでモデルの重みの流出を防止し、アクセス制御、インフラのハードニング、外部流出制御、モニタリングを組み合わせ、Insider-Riskプログラムで支援します。
将来のバイオセキュリティイニシアチブ
OpenAIは、個別モデルの保護だけでは不十分であり、より広範な生物学的防御エコシステムを提唱しています。
バイオディフェンスと審査済みアクセス
7月に、OpenAIは政府研究者やNGOと共にバイオディフェンスサミットを開催し、最先端モデルが対策や新規治療法の開発をどのように加速できるかを検討します。さらに、同社は審査済み機関がより高度なモデルにアクセスできるプロトコルを開発し、生物科学の進展を支援します。
システム的生物学的防御
OpenAIは、公共部門と民間部門がAIモデル以外の生物学的防御を強化するために協力すべきだと提案しています。具体的には:
- 核酸合成スクリーニングの強化。
- 新規病原体に対するより堅牢な早期検出システム。
- バイオ脅威に対するインフラのハードニング。
- 長期的なレジリエンスを確保するためのバイオセキュリティイノベーションやミッション志向スタートアップへの投資。