コンテンツモデレーションへのGPT-4の活用

OpenAIは、コンテンツモデレーションを自動化および洗練させるためにGPT-4を活用しており、コンテンツポリシーの開発とカスタマイズに要する時間を数ヶ月から数時間へと短縮しています。このアプローチにより、人間のモデレーターの役割は、手動のコンテンツフィルタリングから、高度なポリシーの洗練や複雑なエッジケースへの対応へとシフトしています。

GPT-4によるポリシー開発の加速

GPT-4は、ポリシーガイドラインのラベル付けとテストを自動化することで、コンテンツモデレーション分類器の迅速な作成とデプロイを可能にします。コンテンツの手動による低速な選別に頼る代わりに、ポリシーの専門家はLLMとの反復的なループを使用してルールを洗練させます:

  1. ゴールデンセットの作成: ポリシーの専門家が少数の例を特定し、書面化されたポリシーに従ってラベルを付けます。
  2. モデルによるラベル付け: GPT-4がポリシーを読み取り、人間の回答を見ることなく、同じデータセットにラベルを割り当てます。
  3. 不一致の分析: 専門家がGPT-4の判断と人間のラベルとの違いを調査します。GPT-4にラベルの背後にある理由を提示させることで、専門家はポリシー定義の曖昧さを特定し、さらなる明確化を行うことができます。

このサイクルはポリシーの品質が満足のいくものになるまで繰り返され、その時点で洗練されたポリシーは大規模展開のための分類器へと変換されます。

モデル蒸留によるモデレーションのスケールアップ

膨大なデータ量を効率的に管理するために、OpenAIはGPT-4の予測を使用して、より小さく効率的なモデルをファインチューニングします。これにより、リアルタイムのコンテンツモデレーションに求められる規模と速度で動作しながら、GPT-4の高度な推論能力を維持することが可能になります。

将来の機能強化とリスク検出

OpenAIは、モデレーション予測の品質向上と新しいリスクの発見のために、いくつかの技術的手法を検討しています:

  • 推論の改善: Chain-of-thought(思考の連鎖)推論と自己批判を取り入れ、予測精度を向上させる。

  • プロアクティブなリスク特定: 危害に関する高度な記述に基づいて、潜在的に有害なコンテンツを特定するためにモデルを使用する(Constitutional AIに触発された手法)。これらの知見は、既存のポリシーの更新や、全く新しいリスク領域のためのポリシー作成に使用されます。

Human-in-the-Loopとバイアス緩和

AIの学習バイアスに関連するリスクを軽減するために、モデレーションプロセスにおける人間の監視は引き続き極めて重要です。言語モデルの判断は予期せぬバイアスに対して脆弱である可能性があるため、OpenAIは出力を監視、検証、および洗練させるためのHuman-in-the-loopシステムを維持しています。この戦略により、人的リソースを反復的なフィルタリング作業から解放し、継続的なポリシー改善に必要な複雑なエッジケースへと振り向けることが可能になります。

Sources