OpenAI 弱から強への一般化研究

OpenAIはスーパーアラインメントの新たな研究方向を提示し、GPT-2レベルのモデルを用いてより大きなモデル(GPT-4)を監督し、GPT-3.5に近い性能レベルの能力を引き出すことができることを実証しました。この研究は重要で、深層学習の一般化特性を活用して、弱い監督者で強力なモデルを制御できることを示唆しており、将来の超人的AIシステムを整合させるために必要なステップです。

スーパーアラインメント問題

将来のAIシステムはすぐに超知能に到達する可能性があり、これは人間よりはるかに賢いAIです。スーパーアラインメントの核心的課題は、人間が「弱い監督者」として、はるかに能力の高いAIシステムを確実に導き、制御する必要があることです。

従来のアラインメント手法、例えば人間のフィードバックからの強化学習(RLHF)は、人間の監督に依存しています。しかし、これらの手法は超人的モデルに対してはスケールしにくい可能性があります。なぜなら、人間は数百万行に及ぶ新規かつ潜在的に危険なコンピュータコードの生成など、極めて複雑な行動を確実に監督できないからです。

実験設定:小規模から大規模モデルへの監督

スーパーアラインメント問題を実証的に研究するために、OpenAIの研究者は代理的な類推を用いました。すなわち、より大きく、より能力の高いモデルを、より小さく、能力の低いモデルで監督するという方法です。

中心的な疑問は、強力な事前学習モデルが、単に弱い監督者のエラーを模倣するのではなく、弱い監督者の根底にある意図に従って一般化できるかどうかでした。強力なモデルは潜在的な知識を持っているため、より小さなモデルからの監督信号を用いてその知識を引き出すことが目標でした。

主な結果と所見

OpenAIは、いくつかの設定で一般化を大幅に改善できることを発見しました。強力なモデルがより自信を持つよう促す手法(必要に応じて弱い監督者と自信を持って意見が異なることを含む)を用いることで、NLPタスクにおいてGPT-2レベルの監督だけでGPT-4の能力の多くを回復させることができました。得られたモデルの性能は通常、GPT-3とGPT-3.5の間に位置しました。

  • 困難な問題への一般化: 弱い監督者が失敗した難しい問題に対しても、強力なモデルは正しく一般化しました。
  • 代替アプローチ: 研究者は、スモールから中間、そして大規模モデルへのブートストラップや最適な早期停止など、他の手法でも「生命の兆し」を観測しました。
  • 制限事項: この手法は概念実証であり、現在のところChatGPTの好みデータには適用できません。

AIアラインメントへの示唆

結果は、単純な人間の監督(RLHFのような)は超人的モデルに対してはスケールしにくいかもしれませんが、弱から強への一般化を大幅に改善することは実現可能であることを示唆しています。

しかし、研究者は潜在的な類推の違いに注意しています。将来の超人的モデルは、人間のエラーを模倣する方が、現在の強力なモデルが現在の弱いモデルのエラーを模倣するよりも容易かもしれません。これにより、将来のアラインメントは現在の代理実験が示すよりも困難になる可能性があります。

コミュニティリソースと助成金

この分野の研究を加速するために、OpenAIは弱から強への一般化実験を支援するオープンソースコードを公開し、超人的AIアラインメントに焦点を当てる大学院生、学者、その他の研究者向けに1,000万ドルの助成金プログラムを開始しました。

Sources