OpenAI Universe
OpenAI Universe は、人間がコンピュータを使うのと同じように、スクリーンピクセルを観察し、仮想キーボードとマウスを操作することで AI エージェントを訓練するために設計されたプラットフォームです。多様なソフトウェア環境における幅広いタスクの repertoire を提供することにより、OpenAI は「狭義の AI」を超えて汎用知能へと進むことを目指しています。ここで、単一のエージェントは過去の経験を適用して、未知で困難な新しい環境をマスターすることができます。
Universe Infrastructure and Technical Design
Universe は、エージェントがリモートデスクトップを操作できる共通インターフェースを利用しています。システムはエージェントを VNC クライアントに変換し、環境の VNC サーバーとやり取りして視覚データと入力コマンドを交換します。
Performance and Scalability
高スループットのトレーニングをサポートするため、OpenAI は Go で書かれたバッチ指向の VNC クライアントを開発し、Python の共有ライブラリとしてロードしました。このアーキテクチャにより、単一の Python プロセスで 60 フレーム/秒で最大 20 の環境を並列に駆動できます。システムは常に 100ms のレイテンシを維持しており、その大半はサーバーサイド エンコーディングに起因しています。
Key Infrastructure Properties
- Generality: エージェントは、エミュレータやプログラムの内部コードへのアクセスを必要とせず、ゲーム、ターミナル、ウェブブラウザ、CAD ソフトウェア、スプレッドシートなどの既存のコンピュータプログラムとやり取りできます。
- Human-Centric Interface: インターフェースは人間の相互作用(ピクセル/キーボード/マウス)を模倣しているため、人間のパフォーマンスがベースラインとなります。人間のデモンストレーションは VNC トラフィックとして記録され、強化学習(RL)に切り替える前にエージェントを初期化するための行動クローンに使用できます。
- Standardization: VNC の使用により、オペレーティングシステム間での広範な互換性が得られ、Amazon Mechanical Turk などのサービスを介してデモンストレーションを収集するための JavaScript ベースの VNC 実装を使用できます。
- Observability: 環境の共有デスクトップに VNC クライアントを接続することで、トレーニングをリアルタイムでデバッグできます。
Supported Environments
Universe の各環境は、ピクセル/入力用の VNC サーバーと、報酬信号および制御メッセージ用の WebSocket サーバーを含む Docker イメージとしてパッケージ化されています。
Atari Games
Universe には、Arcade Learning Environment からの Atari 2600 ゲームが含まれています。これらは Docker イメージ内で非同期に実行され、エージェントに実際のネットワーク条件に対処させます。ローカルクラウドネットワークでは、観測遅延 20ms、アクション遅延 10ms で 60 FPS を達成します;パブリックインターネットでは、観測遅延 80ms、アクション遅延 30ms で 20 FPS に低下します。
Flash Games
OpenAI はプラットフォームをスケールさせるために、報酬関数を持つ 100 個を含む 1,000 個の Flash ゲームを統合しました。これらのゲームは成功基準のための標準化されたメモリ構造を欠いているため、OpenAI は畳み込みニューラルネットワークベースの OCR モデルを開発しました。このモデルは VNC セルフループから画面上のスコアを解析し、RL の報酬信号を提供します。
Browser Tasks
Universe は、ピクセルと入力を使ってウェブをナビゲートし、メール管理や教育レッスンの完了などのタスクに向かうことを可能にします。
- Mini World of Bits: シンプルなボタン クリックから複雑なシミュレートされたメール返信までの 80 の環境からなるベンチマークで、ブラウザ相互作用の MNIST のアナログとして設計されています。
- Real-world Tasks: エージェントは、ライブサービスへのスパムを避けるためにウェブサイトのキャッシュ録画を使用したフライト予約の検索など、現実的なタスクで訓練されています。
Validation and Performance Results
「現実世界の荒れ具合」のような変動レイテンシにもかかわらずインフラストラクチャが学習をサポートできることを確認するため、OpenAI はいくつかの検証実験を行いました。
Universe Pong
gym-core.PongDeterministic-v3 環境を使用して、OpenAI は変動レイテンシがあるにもかかわらずエージェントが正確な反応を学習できることを検証しました。1 時間トレーニングしたスターター エージェントは、+21 中 +17 のスコアを達成し、同じバージョンのゲームでの人間(環境の高速性により平均 -11)を大幅に上回りました。
Network Latency Analysis
パブリックインターネット上では、エージェントの平均反応時間は約 150ms(観測到着 110ms、計算 10ms、アクション効果 30ms)です。これは平均人間の反応時間 250ms よりも速いです。ローカルネットワークではこれが 80ms に低下し、単一のマシン内では 40ms になります。
Future Directions and Community Integration
OpenAI は、ImageNet がコンピュータビジョンを加速させたように、Universe が一般的な問題解決能力の触媒となることを意図しています。今後の計画には以下が含まれます:
- Transfer Learning Benchmark: エージェントがタスク間での一般化能力を向上させているかを測定する予定のリリース。
- Expanded Integrations: エミュレータを介した Android アプリ、Unity ゲーム、HTML5 ゲーム、および Microsoft の Project Malmo の統合を計画しています。
- Community Contributions: OpenAI は、より多くのソフトウェアをパッケージ化する許可およびエージェントの初期化用の公開データセットを構築するための人間のデモンストレーションを求めています。
Sources
- OriginalUniverse