ChatGPTの学習方法とユーザーのプライバシー保護
OpenAIは、公開データ、パートナーシップ、ユーザー生成コンテンツを組み合わせてChatGPTを学習させ、個人情報をマスクするためにOpenAIプライバシーフィルタを使用し、モデル改善からのオプトアウトを可能にする細かなコントロールをユーザーに提供しています。
モデル学習のためのデータソース
ChatGPTは、一般的な世界知識を構築し、信頼性と安全性を向上させるために多様な情報源で学習されます。これらの情報源は以下を含みます:
- 公開情報: OpenAIは、公開ブログ記事やオンラインディスカッションフォーラムなど、インターネット上で自由にアクセスできるコンテンツを使用します。
- パートナーシップ: 戦略的パートナーシップを通じて取得したデータ。
- ユーザーおよび研究者の貢献: ユーザー、契約者、研究者が提供または生成した情報。
OpenAIプライバシーフィルタによる個人情報の削減
個人に関するプライベート情報がモデルに学習されるのを防ぐため、OpenAIはトレーニング前にデータセットに対して保護策を適用します。このプロセスの主要なツールは OpenAIプライバシーフィルタ で、テキスト内の個人情報を特定しマスクします。
OpenAIは、内部評価においてプライバシーフィルタが他の類似ツールよりも個人情報の除去において効果的であることを示していると述べています。このフィルタはトレーニングパイプラインの複数の段階に組み込まれ、公開データセットとユーザー会話の両方に適用されます(ユーザーが「Improve the model for everyone」設定を有効にしている場合)。
ChatGPTにおけるユーザープライバシーコントロール
モデル学習のオプトアウト
ユーザーは Settings > Data Controls(設定 > データコントロール)で「Improve the model for everyone」設定を無効にできます。この設定をオフにすると、新しい会話はチャット履歴に保存されますが、ChatGPTの学習には使用されません。
一時チャット
一時チャットはセッションベースのプライバシーモードを提供します。これらの会話は:
- チャット履歴に表示されません。
- メモリが作成されません。
- OpenAIのモデル改善に使用されません。
- 安全目的で30日間保持され、その後削除されます。
メモリ管理
メモリ機能により、ChatGPTはセッション間で特定の詳細を記憶できます。これは完全にオプションであり、ユーザーは特定のメモリを確認、編集、削除できるほか、機能自体を無効にして過去のやり取りの保存や参照を防ぐことができます。
アカウントとデータ管理
ユーザーはプライバシーリクエストポータルにアクセスしてプライバシーリクエストを提出したり、ChatGPTデータをエクスポートしたり、アカウントを完全に削除したりできます。OpenAIは、レビューや使用を望まない機密情報をChatGPTに共有しないようユーザーに助言しています。
プライバシーと安全性のバランス
OpenAIは、プライバシー保護と危害リスクへの対処は同時に行われるべきだと主張しています。同社は、既存のプライバシー保護策を維持しつつ、暴力の信頼できる脅威を検出・対応するシステムの開発を継続しています。モデル能力が向上するにつれ、OpenAIは保護策の強化と、ユーザーが自分の情報の使用方法をより明確かつ実用的に決定できる手段の提供にコミットしています。