OpenAI の安全実践
OpenAIはリリース前に実証的なモデルのレッドチーミングとテストを実施しています。このプロセスはPreparedness Frameworkによって管理され、リスク閾値を設定します。新しいモデルが「Medium」リスク閾値を超えた場合、安全対策が実施され、緩和後のスコアが再び「Medium」に戻るまでリリースされません。
GPT-4oのリリースに際し、70人以上の外部専門家がレッドチーミングに参加し、以前のチェックポイントの弱点を特定しました。その結果が後続のチェックポイントの評価に活かされました。
整合性と安全性研究
安全性の向上は、モデルの知能向上(事実誤認や有害な出力の削減)と、実践的な整合性、安全システム、トレーニング後の研究への的確な投資の組み合わせによって推進されます。主な焦点領域は以下です。
- Fine-tuning data: 人間が生成したデータの品質向上。
- Model Specifications: モデルが従う指示の精緻化。
- Robustness: ジャイルブレイクなどの攻撃に対するシステムの耐性を高める研究の実施と公開。
監視と濫用防止
OpenAIはAPIとChatGPT全体で安全リスクや濫用を監視するために幅広いツールを活用しています。専用のモデレーションモデルの使用や、GPT-4を用いたコンテンツポリシーの自動策定・モデレーション判断の自動化が含まれ、これにより人間のモデレーターが目にする有害コンテンツの量が減少します。
業界全体の安全性向上のため、OpenAIはMicrosoftと共同で、国家主体による技術濫用に関する調査結果を公開しました。
ライフサイクルと専門的安全焦点
OpenAIはプレトレーニングからデプロイまで、モデルライフサイクル全体にわたって安全対策を実施しています。これにはプレトレーニングデータの安全性への投資、システムレベルの振る舞い制御、堅牢な監視インフラの整備が含まれます。
特に優先度の高い安全領域は以下です。
子ども安全
OpenAIはChatGPTとDALL·Eにデフォルトのガードレールを組み込み、子どもへの危害を軽減しています。2023年には、ThornのSaferと提携し、ユーザーが画像ツールに子ども性的虐待素材(CSAM)をアップロードしようとした際に、National Center for Missing and Exploited Childrenへ検出・報告する仕組みを導入しました。
選挙の完全性
濫用防止と透明性確保のため、OpenAIはDALL·E 3画像を識別するツールを導入し、C2PAメタデータを組み込んでメディアの出所をユーザーが判別できるようにしました。さらに、ChatGPTは米国および欧州の公式投票情報源へユーザーを誘導し、同社は米国上院の「Protect Elections from Deceptive AI Act」を支持しています。
影響評価とセキュリティ
OpenAIはAIに伴うリスク(化学、生物、放射線、核(CBRN)リスクを含む)を測定する影響評価を実施しています。また、言語モデルがさまざまな職業や産業に与える影響の範囲を研究し、影響作戦に対する言語モデルの意味合いを分析しています。
知的財産とデータを保護するためのセキュリティ対策は以下です。
- API-based deployment: APIを通じたアクセス制御によりポリシー実施を可能にする。
- Infrastructure security: トレーニング環境やアルゴリズムの機密情報へのアクセスを必要最小限に制限する。
- Cybersecurity programs: 社内外のペネトレーションテスト、バグバウンティプログラム、サードパーティ研究者向けのCybersecurity Grant Programの実施。
- Future controls: GPU向け機密コンピューティングやAI駆動のサイバー防御の検討。
ガバナンスと政府パートナーシップ
OpenAIは世界中の政府と提携し、AI安全ポリシーに関する情報提供、学びの共有、サードパーティ保証のパイロットを行っています。
社内では、安全に関する意思決定は運用体制で管理されます。横断的なSafety Advisory Groupが機能レポートをレビューし提言を行い、会社のリーダーシップが最終決定を下し、取締役会が監督します。
将来の進化
OpenAIは次世代のフロンティアモデルに向かうにあたり、実践を進化させる必要があると認識しています。具体的には、洗練された国家主体の攻撃に耐えるセキュリティ体制の強化や、主要リリース前の安全テストに追加の時間を割くことが含まれます。
Sources
- OriginalOpenAI safety practices