GPT-2 6ヶ月後のフォローアップ

OpenAIは、2019年2月の124Mモデルと2019年5月の355Mモデルから始まる段階的なリリースプロセスを経て、774MパラメータのGPT-2バージョンをリリースしました。このリリースは、説得力のある合成ディスインフォメーション(偽情報)の生成といった、オープンな研究の利点と悪用のリスクとのバランスを取るための、より広範な取り組みの一環です。

モデルのリリースと悪用に関する主な教訓

OpenAIのGPT-2における経験は、大規模な生成モデルの展開における3つの主要な課題を浮き彫りにしています:

1. 調整の難しさ

複数の組織が15億パラメータ以上のモデルをトレーニングする能力を持っていますが、そのようなモデルの公開は限られています。OpenAIは、これらのシステムの独占的な性質と、組織間の明確なコミュニケーションチャネルの欠如により、出版規範に関する組織間の調整が困難であると指摘しています。

2. 人間の合成テキストへの感受性

合成テキストは、人間を欺く能力をますます高めています。コーネル大学の研究によれば、テスト対象の集団の72%がGPT-2の合成テキストサンプルを信頼できると判断しましたが、これはニューヨーク・タイムズの実際の記事の83%と比較して低い数値でした。さらに、アレンAI研究所(AI2)とワシントン大学の研究では、「GROVER」システムが人間が書いたプロパガンダよりも説得力のあるニュースを生成できることが判明しました。

3. テキスト検出の複雑さ

AI生成テキストの検出は、重大な技術的課題です。実世界のシナリオで効果を発揮するためには、検出器は非常に少ない誤検知を伴いながら、99.9%から99.99%の精度を実現する必要があります。現在のMLベースの手法は、通常、90%台前半から中盤の精度しか達成できず、この精度はモデルがファインチューニングされるとさらに低下します。OpenAIは、統計的な検出は、悪用に対抗するために、人間の判断とメタデータによって補完される必要があると結論付けています。

研究パートナーシップと安全性分析

フルサイズの1558Mパラメータモデルの潜在的なリリースに向けて、OpenAIは4つの研究機関と提携し、774Mおよび1558Mモデルを分析しました:

  • Cornell University: デジタルディスインフォメーションに対する人間の感受性を研究しています。
  • The Middlebury Institute of International Studies (CTEC): テロリストや過激主義者による潜在的な悪用を調査しています。
  • The University of Oregon: モデル内部のバイアスを分析するための「bias probes」を開発しています。
  • The University of Texas at Austin: ドメイン特化型のファインチューニング後の出力の統計的な検出可能性と、モデル間での検出転移について研究しています。

今後のリリース戦略

OpenAIの現在の計画は、数ヶ月以内に1558Mパラメータモデルをリリースすることですが、このタイムラインは研究パートナーからの知見や774Mモデルの使用状況の観察に依存しています。OpenAIは、強力な生成モデルに固有の課題が時間の経過とともに増大することが予想されるため、責任あるAI出版の基盤として、段階的なリリースとパートナーシップに基づくモデル共有の組み合わせを推奨しています。

Sources