OpenAI AIテキスト分類器リリース(2023年1月)
TL;DR
OpenAIは2023年1月31日に、AIが生成した英語コンテンツを検出するための無料で公開されたAIテキスト分類器を開始しましたが、ツールには制限があります:AI生成テキストのうち正しくフラグを立てられるのはわずか26%で、人間が書いたテキストに対しては9%の偽陽性率があり、後に低精度のため撤回されました。
分類器の機能
この分類器は、人間が書いた文章とAIが書いた文章を区別するようにファインチューニングされた言語モデルです。同じプロンプトに対して人間とOpenAIや他のプロバイダーのさまざまな言語モデルが回答したペアデータセットで訓練されました。ウェブデモでは、OpenAIは偽陽性を低く抑えるために高い信頼閾値を設定し、モデルが非常に確信している場合にのみテキストを「AI生成の可能性が高い」とラベル付けします。
報告された性能
- True positive rate(真陽性率): 英語のAI生成テキストのチャレンジセットで26%。
- False positive rate(偽陽性率): 人間が書いたテキストの9%が誤ってAI生成とラベル付けされます。
- Length dependence(長さ依存性): 入力が長くなるほど精度が向上しますが、1,000文字未満のテキストでは特に信頼性が低くなります。
- Comparison to prior work(先行研究との比較): 新しいモデルは、GPT‑2出力データセットと共にリリースされたOpenAIの以前の検出器よりもはるかに信頼性が高いです。
主な制限事項
- Not a decision‑making tool(意思決定ツールではない): この分類器は補助的なシグナルとしてのみ使用すべきで、最終的な判定としては使用すべきではありません。
- Short text weakness(短文の弱点): 1,000文字未満の入力は予測が極めて信頼できません。
- Language and domain scope(言語とドメインの範囲): 英語のみを対象に校正されており、他の言語やコードに対しては性能が低いです。
- Predictable content(予測可能なコンテンツ): 決定論的なテキスト(例:素数のリストなど)は区別できません。
- Adversarial editing(対抗的編集): 人間による編集で検出を回避でき、継続的な攻撃は再学習に追いつかない可能性があります。
- Calibration issues(校正の問題): 訓練分布外では、モデルが誤った予測に対して過度に自信を持つことがあります。
訓練データと手法
OpenAIは、事前学習コーパスやInstructGPTに提出された人間のデモンストレーションから抽出した人間が書いた抜粋のデータセットを構築しました。各抜粋はプロンプトと応答に分割されました。各プロンプトに対して、OpenAI自身のモデルや他組織のモデルを含む複数の言語モデルで応答が生成されました。その後、分類器はこれらの人間‑AIペアでファインチューニングされました。
想定される使用ケースとアウトリーチ
OpenAIは、以下のような潜在的な活用例を挙げています:
- 人間の対話になりすました自動化された偽情報キャンペーンの検出。
- AIツールを使用してエッセイを作成する学術的不正行為の特定。
- AIチャットボットが人間の対話者として誤認されることの防止。
同ラボは、ChatGPTの使用に関する教育者向けの予備的リソースも公開し、教師、管理者、学生、保護者からのフィードバックを公開フォームで募集しています。OpenAIは、分類器がテキスト、音声、映像コンテンツの出所検証技術を開発する広範な取り組みの一部であることを強調しています。
現在の状況
2023年7月20日現在、AIテキスト分類器は低精度のためオフラインにされました。OpenAIは、より効果的な出所検証手法の研究を進めており、コンテンツがAI生成かどうかをユーザーが判断できるツールの提供に引き続き取り組むと述べています。
Authors: Jan Hendrik Kirchner, Lama Ahmad, Scott Aaronson, Jan Leike