Google DeepMind フロンティア安全フレームワークの更新
有害な操作のための新しいクリティカル能力レベル
Google DeepMind は有害な操作に特化したクリティカル能力レベル(CCL)を導入しました。このCCLは、AIモデルが操作的な能力を持ち、高リスクな状況で信念や行動を体系的かつ大幅に変えるために悪用される可能性がある場合に発動し、規模の大きな深刻な被害をもたらす恐れがあります。この追加は、生成AIにおける操作を駆動するメカニズムに関する研究に基づいています。
ミスアラインメントとAI研究リスクへの対処
更新されたフレームワークは、ミスアラインメントしたAIモデルがオペレーターの指示、変更、または運用停止の能力を妨げるシナリオに対応するために範囲を拡大します。
ミスアラインメントへのアプローチにおける主な変更点は以下の通りです:
- インストゥルメンタル・リースニングからの転換: フレームワークは、インストゥルメンタル・リースニングCCL(欺瞞的思考に対する警告レベル)に中心を置く探索的アプローチから、AI研究開発を不安定なレベルまで加速させ得るモデルに焦点を当てたプロトコルへと移行します。
- リスク統合: フレームワークは、モデルの無指向的行動の可能性やこれらのモデルを展開プロセスに統合することから生じるミスアラインメントリスクを考慮するようになりました。
- 拡張された安全性ケースレビュー: 安全性ケースレビュー(リスクが管理可能なレベルに低減されたことを示す詳細な分析)は、外部リリースだけでなく、先進的な機械学習研究開発CCLに達した大規模な内部展開にも求められるようになりました。
リスク評価とガバナンスの洗練
Google DeepMind は、最も厳格なガバナンスが必要な重要な脅威をより的確に特定できるように、クリティカル能力レベル(CCL)の定義を明確化しました。標準的な安全・セキュリティ対策はモデル開発全体に適用されますが、CCLは高度な緩和策を発動させるトリガーとして機能します。
リスク評価プロセスには以下が含まれます:
- 体系的なリスク識別。
- モデル能力の包括的分析。
- リスク受容性の明示的な判断。
トラッキング可能な能力レベル(FSF 3.1)の導入
2026年4月17日現在、Google DeepMind は特定領域でトラッキング可能な能力レベル(TCL)を導入しました。TCLは、CCLで定義されたものほど極端でない潜在的リスクを特定・評価するよう設計されており、開発サイクルの早い段階でリスクを発見し緩和することが可能になります。
エビデンスに基づく安全へのコミットメント
フロンティア安全フレームワークは、ステークホルダーからの意見、新たな研究、実装から得られた教訓に基づいて進化するよう設計されています。Google DeepMind は、フレームワークが変革的AIの恩恵を実現しつつ、能力が汎用人工知能(AGI)へと進む過程での害を最小化することを目指すと述べています。