OpenAI 集団アラインメントとモデル仕様の更新

OpenAI は、公共の好みを Model Spec(デフォルトの AI 挙動を規定するガイドラインの集合)に統合するための集団アラインメント研究イニシアチブを開始しました。この取り組みは、単一の機関が理想的な挙動を定義するのに頼るのではなく、幅広い世界的価値観や優先事項を反映させることで、AGI が人類に利益をもたらすことを保証することを目的としています。

モデル仕様への公共入力の統合

OpenAI は、19 カ国から 1,000 人以上の参加者から意見を収集することで Model Spec を更新しました。このプロセスは、グローバルな好みを自動化と人間主導のレビュー・ループを組み合わせて実行可能なガイドラインに変換することを含みました。多くの参加者の好みは既存の Spec と一致しましたが、一部の相違は表現の明確化やコア原則への変更提案につながりました。

フィードバック収集プロセス

Spec 文書を直接レビューするのではなく、参加者は理想的な挙動が主観的になりがちな価値感受性領域の事前選択されたプロンプトと応答をレビューしました。

  • Methodology(手法): 参加者は各プロンプトに対して 4 つの可能な完了案(異なる現実的意見を含む 3 つと GPT-4o が生成した 1 つ)を順位付けしました。
  • Scope(範囲): 参加者はそれぞれ 5 から 20 のプロンプトをレビューし、順位付け、根拠、事前作成されたルーブリックに対するスコアを提供しました。
  • Demographics(人口統計): プールには米国、メキシコ、南アフリカ、オランダ、チリ、英国、インド、ケニア、日本など、19 カ国(元は 50 カ国以上)からの参加者が含まれました。

好みをガイドラインに変換する

OpenAI は、生データを Model Spec の提案に変換するために 2 つの補完的なループを採用しました。

  1. Fully-Automated Loop(完全自動ループ): 推論モデルが参加者と Model Spec Ranker(MSR、現在の Spec に従って応答を順位付けするモデル)との間の意見不一致パターンを特定し、群衆との整合性を高める変更を自動的に提案しました。
  2. Human-First Loop(人間優先ループ): 研究者が人間の好みを総合的にレビューし更新案を提案し、推論モデルで検証して、群衆の根拠が変更の意図を支持しているかを判断しました。

OpenAI は、人間優先ループが間接的な自殺意図などのニュアンスを捉えた一方で、自動ループはスケーラビリティが高いことを指摘しました。

採用と却下

Model Spec への提案変更は内部レビューの対象となり、群衆の好みは安全ポリシー、プラットフォームリスク、展開制約と比較検討されます。

採用されなかった変更

高い公共関心があった 2 つの領域は、安全性と研究上の懸念から Spec の更新に至りませんでした。

  • Tailored Political Content(個別化された政治コンテンツ): 多くの参加者がよりパーソナライズされた政治コンテンツを求めましたが、OpenAI は大規模な個別政治ターゲティングのリスクからこれを辞退しました。
  • Erotica for Consenting Adults(合意した成人向けエロティカ): 群衆の大多数がエロティカの有効化を支持しましたが、OpenAI は安全に展開できるようになるまでさらなる研究と製品開発が必要と述べました。

技術的制限と今後の方向性

OpenAI はこの初期段階の実験におけるいくつかの制限を認めています。

  • Selection Bias(選択バイアス): 参加者プールは世界人口に比べて小規模で、英語を読む参加者に限定されました。
  • Model Spec Ranker (MSR) Bias(Model Spec Ranker のバイアス): Spec が不十分に定義されているため、MSR のルール解釈は自身の学習データに影響され、解釈バイアスが生じる可能性があります。
  • Legitimacy and Validation(正当性と検証): プロセスの自動化部分は人間が解釈しにくく、最終提案は参加者に直接再検証されていません。
  • Trade-off Analysis(トレードオフ分析): 参加者は行動を単独で評価し、競合する原則間のトレードオフ(例:エロティカ vs. 子どもの安全)を考慮しませんでした。

結論

この集団アラインメントプロセスは、AI のデフォルトに多様な人間価値を引き出し統合するエンドツーエンドシステムの第一段階を示しています。OpenAI は HuggingFace に公共入力データセットを公開し、AI エコシステムにおけるさらなる研究を促進しています。今後は、より多くの視点を取り入れ、異なる価値体系を反映した複数のデフォルトセットを定義できるようプロセスのスケーリングに注力します。

Sources