OpenAI Superalignment Fast Grants
OpenAIは、超知能AIシステムの安全性とアライメント(整列)を確保することを目的とした技術研究を支援するため、1,000万ドルの助成金プログラムを開始しました。この取り組みは、人間の知能をはるかに超える能力を持つAIシステムを、人間がいかにして制御し、信頼できるかという極めて重要な課題に対処するものです。
超知能AIアライメントの課題
超知能AIシステムのアライメントは、現在のアライメントとは根本的に異なる技術的課題を提示します。現在のシステムは通常、人間のフィードバックからの強化学習(RLHF)を用いてアライメントされていますが、この手法は人間の監督に依存しており、AIの能力が人間の理解を超えるようになると、その監督は不十分になります。
超知能AIシステムは、人間が完全には評価できない複雑で創造的な行動を示す可能性があります。例えば、OpenAIは、もし超知能モデルが100万行もの高度に複雑なコードを生成した場合、人間の査読者がそのコードの実行が安全か危険かを確実に判断することは不可能であると指摘しています。したがって、中心となる技術的課題は、人間が自分たちよりも著しく賢いシステムに対して、いかにして制御と信頼を維持できるかを決定することです。
Superalignment Fast Grants プログラムの詳細
Eric Schmidtとのパートナーシップにより、OpenAIは学術研究室、非営利団体、および個人の研究者に1,000万ドルの資金を提供します。このプログラムは、経験豊富なアライメント研究者と、この分野への新規参入者の両方を惹きつけるように設計されています。
助成ティアと資格
- General Grants: 個人研究者、非営利団体、および学術研究室向けに、10万ドルから200万ドルの助成金が用意されています。
- OpenAI Superalignment Fellowship: 大学院生を対象とした1年間のフェローシップで、7万5,000ドルの奨学金と、7万5,000ドルの計算リソースおよび研究資金(合計15万ドル)が提供されます。
- 経験要件: 申請にあたってAIアライメントの事前経験は必要ありません。
優先的な研究方向
OpenAIは、アライメントと安全性におけるブレイクスルーを求めているいくつかの主要な技術領域を特定しています。
Weak-to-Strong Generalization
この研究は、強力なモデルがいかにして「弱い」監督者(人間)の監督から汎化できるかに焦点を当てています。目標は、超知能モデルが、能力の低い実体から提供されるフィードバックからどのように学習するかを理解し、制御することです。
Interpretability
Interpretability(解釈可能性)研究は、AIモデルの内部メカニズムを理解することを目的としています。この研究の主な応用例は、モデルの誠実さを検証するための「AI嘘発見器」のようなツールの開発です。
Scalable Oversight
Scalable oversight(スケーラブルな監視)は、特に人間の個人の能力を超える複雑なタスクを実行する場合に、他のAIシステムの出力を評価するためにAIシステムを使用して人間のオペレーターを支援することを含みます。
その他の研究領域
OpenAIは、以下に関する研究への資金提供にも関心を持っています:
- Honesty
- Chain-of-thought faithfulness
- Adversarial robustness
- Evaluations and testbeds
Sources
- OriginalSuperalignment Fast Grants