OpenAI Astra: 重大なサイバー能力への対応
OpenAIは、次世代のAstraモデルに関する内部評価において、エージェント型コーディングおよびサイバーセキュリティにおける大幅な進歩が確認されたと発表しました。これらの結果を受け、OpenAIは、Astraが同社のPreparedness Frameworkで定義されている「Critical(重大)」なサイバー能力の閾値に達した可能性を否定できないとの結論に至りました。
重大なサイバーセキュリティの閾値の定義
モデルが「Critical」なサイバーセキュリティの閾値に達したと分類されるのは、人間の介入なしに以下の事項を実行できる場合です:
- 多くの堅牢な実世界の重要システムにおいて、あらゆる深刻度レベルの機能的なゼロデイ脆弱性攻撃(zero-day exploits)を特定し、開発すること。
- 高レベルの目標のみに基づき、堅牢なターゲットに対するサイバー攻撃のためのエンドツーエンドの新しい戦略を考案し、実行すること。
評価は現在も継続中ですが、Astraの予備的な結果は、この「Critical」レベルを否定できないほど強力なパフォーマンスを示しています。OpenAIは、AstraがHugging Faceへの攻撃に関与したわけではないことを明示的に述べています。
セキュリティ管理と緩和策
これらの能力に関連するリスクを管理するため、OpenAIはセーフガードとセキュリティ管理の堅牢性テストを拡大しています。同社は、より高い能力を持つモデルに対して、いくつかの内部セキュリティ対策を実装しています:
- Infrastructure Protections: 隔離されたテスト環境の実装、ネットワークおよびツールのアクセス制限、モデルの重み(weights)の暗号化と保護の強化、およびサンドボックス内での実行。
- Activity Pauses: これらの強化されたセキュリティ要件を満たさないAstraに関連する内部活動は、現在一時停止されています。
- Universal Monitoring: トレーニングおよび評価を含む、Astraのすべてのエージェント型アプリケーションにおける、リスクの高い行動や不整合(misalignment)の監視の実装。これらのモニターは、モデルのChain of Thoughtを分析して、セキュリティレスポンスをトリガーし、高リスクな活動を中断させます。
- External Collaboration: OpenAIは、政府機関や選定されたAI安全性組織と協力して、モデルの能力をテストします。
- Third-Party Guidance: 同社は、サードパーティのテストパートナーに対し、高リスクな評価やワークロードが安全に実行されるよう、推奨されるセキュリティ管理を提供します。
文脈とPreparedness Framework
2023年12月に公開されたOpenAIのPreparedness Frameworkは、生物学、化学、サイバーセキュリティ、AIの自己改善など、さまざまな領域における能力の進歩を特定するためのガイドとして機能します。GPT-5.6-Solを含む以前のモデルは、フロンティア・サイバー能力において「High(高い)」閾値(「Critical」ではなく)として評価・判定されました。
この対応は、2025年6月の、生物学における高い能力の閾値に近づいたモデルに関する発表と同様のプロトコルに従っています。そこでは、OpenAIは能力を責任を持って展開するために、セーフガードを強化し、テストを拡大しました。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch