GPT-2 1.5B リリースノート
OpenAIは、段階的リリース計画における最終かつ最大のモデルであるGPT-2の15億パラメータバージョンをリリースしました。このリリースには、合成テキストの検出ツール開発を容易にするモデルの重みとコードが含まれています。
GPT-2出力の人間による認識
人間は、1.5Bモデルの出力を小さいバージョンよりも説得力があると感じますが、774Mモデルと比較すると信頼性の向上はわずかです。コーネル大学が実施した調査では、1.5Bモデルは10点満点中6.91点の信頼性スコアを獲得し、774Mモデルは6.72点、355Mモデルは6.07点でした。
悪用と合成プロパガンダの可能性
GPT-2は、特定のイデオロギーに対する合成プロパガンダを生成するためにファインチューニングすることができます。ミドルベリー国際研究所のテロリズム、過激派、およびテロ対策センター(CTEC)による研究では、このモデルが白人至上主義、マルクス主義、ジハード主義イスラム教、アナキズムという4つのイデオロギーに対してファインチューニングできることが示されました。
合成テキスト検出の課題
コンテンツベースの合成テキスト検出は、より大きなモデルが分類がより困難な出力を生み出すため、長期的な課題のままです。OpenAIは、RoBERTa-BASE(1.25億パラメータ)とRoBERTa-LARGE(3.55億パラメータ)に基づく検出モデルを開発し、1.5B GPT-2生成テキストに対して約95%の検出率を達成しました。
OpenAIは、この精度ではスタンドアロン検出には不十分であり、メタデータベースのアプローチ、人間の判断、および公共教育と組織り組織り合わせて使用する必要があると指摘しています。また、より大きなモデルの出力でトレーニングすると検出の堅牢性が向上する一方で、モデルサイズが増えるにつれて全体的な分類の難易度が上がることも観察しています。
悪用の証拠
現在のところ、GPT-2の広範な悪用の強い証拠はありません。フィッシングやスパムなどの大量低収益操作の可能性については議論されていますが、OpenAIはこのモデルがコード、ドキュメント、またはその他の悪意のあるインスタンスを書くために使用されている証拠を見ていません。
バイアス分析と基準
言語モデルは固有にバイアスを含みます。これに対処するため、OpenAIは以下の2つの主要な戦略を実施しています:
- モデルカード: GitHub上にモデルカードを公開し、言語モデルの固有の問題を記録します。
- 定性的評価: 性別、人種、宗教のバイアスに関する社内プローブを実施し、モデルカードに情報を提供します。
OpenAIは、これらのプローブが包括的ではないことを強調し、AI研究コミュニティが標準化されたバイアス分析フレームワークに協力する必要性を指摘しています。
責任ある出版の規範
GPT-2のリリースは、段階的リリースプロセスのテストケースとして機能しました。OpenAIは、AIパートナーシップの『機械学習のための責任ある出版規範』プロジェクトへの参加を通じて、機械学習のための責任ある出版規範の確立に取り組み続けています。
Sources
- OriginalGPT-2: 1.5B release