OpenAI の AI 安全へのアプローチ
OpenAI は、強力な AI システムが安全で広く有益であることを保証するために、多層的な安全フレームワークを活用しています。このアプローチは、厳格な事前展開テスト、反復的な実世界展開、継続的なアラインメント研究を組み合わせてリスクを軽減し、モデルの挙動を改善します。
事前展開テストとアラインメント
OpenAI は、新しいシステムをリリースする前に厳格なテストを実施し、外部の専門家からフィードバックを得ています。組織は、人間のフィードバックを用いた強化学習(RLHF)などの手法を用いて、モデルの挙動とアラインメントを改善します。
GPT-4 に関しては、OpenAI は公開リリース前にモデルをより安全かつアラインメントされたものにするため、組織全体で 6 カ月以上取り組みました。
反復的展開と実世界学習
OpenAI は、ラボベースのテストには限界があり、技術のすべての有益な利用や悪用を予測できないと考えています。これに対処するために、反復的な展開戦略が採用されています。
- 段階的リリース: 新しい AI システムは、十分な安全策を講じた上で、徐々に拡大するユーザーグループへ慎重にリリースされます。
- 悪用の監視: モデルをサービスや API を通じて提供することで、OpenAI は悪用を監視し対処でき、理論ではなく実世界のデータに基づく緩和策を構築できます。
- 社会的調整: 反復的な展開により、社会やステークホルダーは AI の開発に対して重要な意見を持ち、技術がより効果的に受け入れられる時間を確保できます。
子どもの安全とコンテンツモデレーション
子どもの保護は OpenAI の安全対策の重要な焦点です。組織は、ヘイトスピーチ、嫌がらせ、暴力、成人向けコンテンツの生成に対して厳格な利用ポリシーを維持しています。
GPT-4 の主要な安全指標は次のとおりです:
- 禁止コンテンツ: GPT-4 は、GPT-3.5 と比べて禁止コンテンツへのリクエストに応答する可能性が 82% 低くなっています。
- 子ども安全ツール: OpenAI は Thorn の Safer を使用して、画像ツールにアップロードされた児童性的虐待資料(CSAM)を検出・レビュー・報告し、National Center for Missing and Exploited Children に送ります。
- 年齢要件: ユーザーは 18 歳以上、または保護者の承認がある場合は 13 歳以上である必要があります。
OpenAI はまた、Khan Academy などのパートナーと協力し、学生や教師向けの AI アシスタントなど、特定のユースケースに合わせた安全緩和策を開発しています。
プライバシーとデータ取り扱い
OpenAI の大規模言語モデルは、公開されているコンテンツ、ライセンスされたコンテンツ、そして人間のレビュアーが生成したライセンスコンテンツを含む広範なコーパスで訓練されています。データはモデルをより有用にするために使用され、サービスの販売、広告、個人のプロファイル作成のためには使用されません。
個人を保護するために、OpenAI は以下の戦略を採用しています:
- 個人情報の除去: 可能な限り、トレーニングデータセットから個人情報を除去します。
- 拒否の明示: モデルは、個人のプライベート情報に関するリクエストを拒否するようにファインチューニングされています。
- 削除リクエスト: 組織は、個人からの自身の個人情報の削除要請に対応します。
事実精度と幻覚
OpenAI は、大規模言語モデルがパターンに基づいて次の語句を予測するため、事実誤認が生じることを認識しています。精度向上のため、OpenAI は誤った ChatGPT の出力に対するユーザーフィードバックを主要なデータ源として活用しています。
この反復的な改善プロセスに基づき、GPT-4 は GPT-3.5 と比べて事実に基づくコンテンツを生成する可能性が 40% 高くなっています。
グローバルガバナンスと継続的研究
OpenAI は、企業が「手抜きを」して先行しようとすることを防ぐ規模で AI 開発を効果的に統治するために、グローバルガバナンスが必要であると考えています。OpenAI は、厳格な安全評価が規制として採用されるよう、政府と積極的に協議しています。
組織は、AI の安全性と能力の向上は同時に行うべきだと主張しています。より高度なモデルは指示に従いやすく、制御もしやすいためです。OpenAI は AI システムが進化するにつれて安全対策を強化し続け、将来のモデルに対しては追加の安全作業が 6 カ月以上かかる可能性があります。
Sources
- OriginalOur approach to AI safety