OpenAI AIシステムの行動とガバナンスフレームワーク
OpenAIは、ChatGPTの行動がどのように形成されるかを明確にし、よりカスタマイズ可能で公共の意見を反映したガバナンスモデルへ移行するためのフレームワークを実装しています。この転換は、バイアスを減らし、権力の過度な集中を防ぎ、AIシステムが多様な人間の価値観に合致することを目的としています。
AI行動を形作る二段階プロセス
ChatGPTの行動は明示的にプログラムされているわけではなく、事前学習とファインチューニングという二段階のトレーニングプロセスを通じて学習されます。
事前学習
最初の段階では、モデルはインターネット上の幅広いテキストを含む大規模データセットで訓練されます。モデルは文中の次の単語を予測することを学び、これにより文法、世界の事実、推論能力を獲得します。しかし、この段階ではソースデータに存在するバイアスにもさらされます。
ファインチューニング
システムの行動を絞り込むために、OpenAIは人間のレビュアーが作成した限定的なデータセットでモデルをファインチューニングする第二段階を使用します。レビュアーは特定のガイドラインに従い、さまざまな入力例に対するモデル出力を評価します。そのフィードバックからモデルは一般化し、幅広いユーザー入力に応答できるようになります。このプロセスは、OpenAIとレビュアーが毎週会合を開き、指針を明確にしモデル性能を向上させる反復的なものです。
バイアスとポリシーの透明性への取り組み
OpenAIは、トレーニングプロセスで生じるバイアスを「機能ではなくバグ」とみなし、複数の透明性と研究イニシアチブを通じてそれらの削減に取り組んでいます。
- ガイドライン開示: OpenAIは政治的・論争的トピックに関するガイドラインの一部を共有し、レビュアーが特定の政治団体を支持しないよう明示的に指示しています。
- レビュアーの人口統計: 同社はレビュアーの集計された人口統計情報を共有し、バイアスの潜在的な原因を特定・緩和する取り組みを進めています。
- 技術研究: OpenAIは、憲法AIやルールベースの報酬といった外部の進展を取り入れ、より制御可能なファインチューニングプロセスの研究を行っています。
- 指示の改善: ラボは、論争的な人物やテーマ、バイアスの落とし穴に関してレビュアーへの指示をより明確にしています。
将来のフレームワーク:AIガバナンスの三つの構成要素
AIの利益と影響が広く行き渡るように、OpenAIは三つの主要な構成要素に基づく戦略を策定しています。
1. デフォルト行動の改善
OpenAIは、顕著なバイアスと微細なバイアスの両方を減らすことで、AIシステムを「箱から出したまま」有用にすることを目指しています。これには、システムの正確性を向上させて「でっち上げ」を防止し、拒否メカニズムを洗練させて出力を拒否すべき時と許可すべき時を正しく識別できるようにすることが含まれます。
2. 広範な範囲内でのユーザーカスタマイズ
OpenAIは、ユーザーが個々の価値観に合わせてChatGPTの行動をカスタマイズできるようアップグレードを開発しています。悪意ある利用や、既存の信念を盲目的に増幅する「媚びるAI」の作成を防ぐため、これらのカスタマイズは社会が定めた範囲内で行われます。
3. デフォルトとハードバウンドに関する公共の意見
権力の集中を防ぐため、OpenAIはAIシステムを規定するルールに関して公共の意見を募集する試みをパイロットしています。現在および計画中のイニシアチブは以下です。
- レッドチーミング: 技術の限界をテストするために外部からの意見を求める。
- コンテキスト別入力: 教育など特定分野におけるAIの役割についてフィードバックを募集する。
- 広範なガバナンス: システムの行動、展開ポリシー、透かしなどの開示メカニズムに関する公共の意見を検討する。
- サードパーティ監査: 外部組織と提携し、安全性とポリシーの取り組みについて監査を実施する。