OpenAI 言語モデルの安全性と悪用に関する教訓

OpenAIは、AIシステムの実際の運用が、隔離された研究では得られない重要な安全性と悪用の洞察を提供することを判断しました。主な教訓は、APIベースの悪用は、当初の理論的な懸念とは異なる形で現れることが多く、アライメントのような基本的な安全性研究が、AIシステムの商業的有用性を直接向上させるということです。

リスク軽減のための反復的なデプロイメント戦略

OpenAIは、責任あるデプロイメントのための単一の「特効薬」は存在しないため、リスクを軽減しながら利益を最大化するために、継続的な反復アプローチを採用しています。この戦略は、大規模な集団に拡大する前に、小規模なスケールで学習することに焦点を当てています。

このデプロイメントライフサイクルの主な構成要素は以下の通りです:

  • Pre-deployment Analysis: レッドチーミングツールや安全性評価(例:InstructGPTの安全性低下のチェック)を活用すること。
  • Gradual Rollout: GPT-3やInstructGPTシリーズのようなモデルの初期ユーザー層を制限するために、プライベートベータ版から開始すること。
  • Pilot Studies: 安全な使用条件を決定するために、少数の顧客とともに、長文コンテンツ生成などの新しいユースケースをテストすること。
  • Usage Monitoring: モデルがどのように使用されているかを可視化するために、トークン割り当て、レート制限、およびユースケースのレビューを実装すること。
  • Retrospective Reviews: 主要なデプロイメントと安全性インシデントの詳細な分析を行うこと。

さらなる被害を軽減するために、OpenAIは、事前学習データのキュレーション、指示に従うためのファインチューニング、および有害な出力をスクリーニングするためのツールの作成を含む、開発パイプライン全体に介入を統合しています。

言語モデルの悪用のパターン

OpenAIは当初、影響力工作や、誤解を招く政治的コンテンツやマルウェアの生成といった高レベルのリスクに重点を置いていましたが、現実世界のデータは、より広範な悪用のスペクトラムを示しています。

OpenAIは、予期せなかった、あるいは予想よりも蔓延している目的でGPT-3を悪用しようとする数百の主体を検出し、阻止してきました。 「in the wild」での悪用の例は以下の通りです:

  • 疑わしい医療製品のスパムプロモーション。
  • 人種差別的なファンタジーのロールプレイング。

注目すべきは、OpenAIが、長文の影響力工作を抑制するために当初意図されていた出力長のリミット設定が、ポリシー違反にほとんど効果がなかったことを発見したことです。組織は現在、誤解を招く情報を増幅させるために設計された短文コンテンツが、長文コンテンツよりも大きなリスクをもたらす可能性があると考えています。

リスクと影響の測定における課題

既存のアカデミックなベンチマークは、生産環境で遭遇する安全性と悪用のリスクを反映できないことがよくあります。OpenAIは、アカデミックなデータセットにおけるいくつかの制限を特定しました。これには、過度に狭い焦点(例:のみを測定する職業的ジェンダーバイアス)、AI使用の生成的な次元の測定の失敗、および現実世界のユースケースとはスタイルが異なるプロンプトが含まれることが挙げられます。

これらのギャップを埋めるために、OpenAIは以下を開発しています:

  • New Evaluation Metrics: モデルの出力における毒性を測定するための、特定の評価指標。
  • In-house Classifiers: ヘイトスピーチ、暴力、ハラスメント、自傷行為、およびエロティックなコンテンツに関するポリシーに違反するコンテンツを検出するためのツール。

これらの分類器は、事前学習データのフィルタリングと、データセットへの介入の効果を測定するために使用されます。さらに、OpenAIはモデルの経済的影響を研究しており、コピーライティングや要約において顕著な生産性向上を認めていますが、労働市場への純粋な効果は依然として不明です。

安全性と商業的有用性のシナジージー

安全性研究はしばしば直接的な商業的利益をもたらし、アライメントと有用性の間にシナジージーを生み出します。

このシナジージーの証拠は以下の通りです:

  • InstructGPT Preference: 開発者は、ベースのGPT-3モデルよりもInstructGPTモデルを圧倒的に好んで使用します。これは、InstructGPTがユーザーの意図に従うようにファインチューニングされており、有害または不正確な出力を生成する可能性が低いためです。このアライメント作業は、もともと長期的な安全性目標によって動機付けられており、商業的なものではありませんでした。
  • Reduced Friction: アライメントされたモデルは、複雑な「prompt engineering」の必要性を減らし、モデルのコンテキストウィンドウ内のスペースを節約します。
  • Truthfulness: インターネットから情報を取得してより真実味のある回答を生成するための研究は、安全性と製品のユーザーへの価値の両方を向上させます。
  • Operational Benefits: スパムを防止するために設計されたレート制限は、顧客の費用管理にも役立ちます。

これらのシナジージーがある一方で、OpenAIは、安全性と有用性がトレードオフの関係になる可能性があることを認めています。例えば、より強力なシステムは、より長い評価期間を必要とし、それが利益の機会を遅らせる可能性があります。

外部との協力と研究

OpenAIは、AIの安全性に関するすべての答えを一つの組織が持っているわけではないことを強調しています。エコシステムを改善するために、彼らは以下の取り組みを行っています:

  • API Access: APIのウェイティングリストを終了し、より多くの個人が最新のシステムと対わり、理解するための機会を提供すること。
  • Subsidized Credits: バイアスと悪用の防止に向けた外部研究者に対し、APIクレジットを助成すること。
  • Labor Market Research: Codexファミリーのモデルの経済的影響に関する研究アジェンダを公開し、これらの効果を研究するための外部協力者を募ること。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch