OpenAI ビデオ事前学習 (VPT) for Minecraft
OpenAI は Video PreTraining (VPT) という半教師あり模倣学習手法を開発し、ラベルなしの人間ビデオを見ることでニューラルネットワークが環境での行動を学習できるようにしました。この手法を Minecraft に適用することで、OpenAI はエージェントがこれまで強化学習だけでは不可能だった、ダイヤモンドツールの作成などの複雑で長期的な行動を習得できることを示しました。
Video PreTraining (VPT) の方法論
インターネット上に存在する膨大なラベルなしビデオデータを活用するために、OpenAI は VPT パイプラインを導入しました。インターネットビデオを使用する際の主な課題は、プレイヤーが行った正確なキー入力やマウス操作(アクションラベル)の記録がないことです。
Inverse Dynamics Model (IDM)
OpenAI は Inverse Dynamics Model (IDM) を訓練することでアクションラベリング問題を解決しました。プロセスは以下の通りです:
- Contractor Data Collection: 人間の契約者から小規模なデータセットを収集し、ビデオと対応するアクションラベル(キー入力とマウス操作)を記録しました。
- IDM Training: IDM はビデオの各ステップで取られたアクションを予測するように訓練されます。標準的な行動模倣とは異なり、IDM は過去と未来のフレームの両方を利用してアクションを推測できます。
- Large-Scale Labeling: 訓練が完了した IDM は、ラベルなしのオンラインビデオの大規模データセットにラベル付けを行い、合成アクションラベル付きデータセットを作成します。
- Behavioral Cloning: その後、基礎モデルはこの IDM ラベル付きデータを用いて行動模倣により訓練されます。
VPT 基礎モデルのゼロショット能力
VPT 基礎モデルは IDM ラベル付きオンラインビデオ 70,000 時間で訓練されました。ネイティブな人間インターフェース(マウスとキーボードで 20Hz のフレームレート)を使用し、モデルは複数の「ゼロショット」能力を達成しました。つまり、追加のファインチューニングなしで事前学習後にこれらのタスクを実行できるということです:
- Early Game Sequence: モデルは木を切り倒し、板を作り、作業台を建設できます。このシーケンスは熟練した人間で約 50 秒、または 1,000 回の連続アクションが必要です。
- General Survival Skills: モデルは泳ぎ、動物を狩って食料を得、食事をすることを学習しました。
- Advanced Movement: モデルは「柱ジャンプ」をマスターしました。これは、連続してジャンプしながら自分の下にブロックを置いて上昇する動作です。
ファインチューニングと性能スケーリング
OpenAI は VPT モデルの専門化能力を、行動模倣 (BC) と強化学習 (RL) を通じてテストしました。
行動模倣ファインチューニング
契約者が家を建てる小規模データセット(1 ワールドあたり 10 分のプレイ)で基礎モデルをファインチューニングすることで、モデルは初期ゲームスキルが大幅に向上し、木製・石製ツールの作成、村のチェストの略奪、簡易シェルターの構築といった能力を拡張しました。
データスケーリング仮説
OpenAI は、契約者データを用いて IDM を訓練する方が、同じデータを直接 BC 基礎モデルの訓練に使用するよりも効果的であると仮定しました。これを検証するため、1 時間から 70,000 時間までのデータ規模でモデルを訓練しました。その結果、基礎モデルのデータ量が増えるにつれて作成能力が全般的に向上し、石ツールの作成は最大規模のデータでのみ現れました。
強化学習 (RL) ファインチューニング
RL と組み合わせることで、VPT モデルは強力な行動事前知識として機能します。ランダム初期化から訓練された標準的な RL ポリシーは、丸太や棒をほとんど集められなかったのに対し、RL でファインチューニングされた VPT モデルは 10 分エピソードの 2.5% でダイヤモンドのピッケルを作成することに成功しました。
ダイヤモンドツールの作成は、熟練した人間でも通常 20 分以上(約 24,000 回のアクション)かかるタスクです。これは、ネイティブな人間インターフェースを用いてコンピュータエージェントが Minecraft でこの能力を達成した初めての事例です。
汎用コンピュータ利用エージェントへの示唆
OpenAI は、VPT がインターネットビデオから行動事前知識を学習する道筋を提供し、単なる表現的事前知識を超えることを示すと結論付けました。Minecraft はオープンエンドで汎用的なマウスとキーボードのインターフェースを使用しているため、これらの結果は人間と同様にコンピュータを利用できる汎用エージェントの開発可能性を示唆しています。