Agora-1: マルチエージェント・ワールドモデルの先駆者

「ワールドモデル」という概念は、長らくAI研究の礎石となってきました。エージェントが環境をシミュレートし、将来の状態を予測するための手段を提供するためです。しかし、これまでは、ほとんどのワールドモデルが単一の能動的な参加者に限定されていました。OdysseyチームによるAgora-1のリリースは、同じシミュレートされた環境内で複数の人間またはAIエージェントがリアルタイムで相互作用することをサポートできる、初のマルチエージェント・ワールドモデルを導入するという、重要な転換点となります。

クラシックなゲームである GoldenEye をテストの場として使用することで、Odysseyは、ワールドモデルが学習されたゲームエンジンとして機能し、参加者間で共有された状態を維持しながら、生成されたピクセルを各プレイヤーに同時にストリーミングできることを実証しました。この進歩は、ロボティクス、防衛、教育、そして基盤モデルの開発に新たな扉を開きます。

アーキテクチャ:シミュレーションとレンダリングの分離

複数のプレイヤーに対して一貫した共有体験を実現するために、Agora-1は従来のアプローチとは一線を画しています。MultiverseやSolarisのような初期のモデルは、エージェントの状態やシーケンスを結合することでマルチエージェントの相互作用を扱おうとしましたが、これらの手法は、特にプレイヤーが互いを見失ったときに、スケーラビリティと一貫性に苦戦することがよくありました。

Agora-1は、シミュレーションのダイナミクスを視覚的なレンダリングから分離することで、この問題を解決します。システムは、2つの異なる関数を学習します:

  1. 共有ワールド状態の学習: モデルはゲーム(例:GoldenEye)の内部状態に基づいて学習し、プレイヤーの行動に応じてワールド状態がどのように進化するかを学習します。これには、ヘルス、位置、およびその他の重要なゲームプレイ変数の追跡が含まれます。
  2. 視覚的レンダリングの学習: Diffusion Transformer (DiT) ベースのワールドモデルが、共有されたゲーム状態を条件として視覚的な出力をレンダリングします。プロンプトや画像に依存する従来のモデルとは異なり、Agora-1は学習された状態に基づいて直接ビューをレンダリングします。

この分離は現代のゲームエンジンに似ていますが、重要な違いがあります。シミュレーションとレンダリングの両方が完全に学習されたシステムであるという点です。ハードコードされたルールはありません。モデルは、データから直接世界の「物理学」と「ビジュアル」を学習します。

基盤ワールドモデルへのスケーリング

Odysseyは、Agora-1を、より一般的な基盤ワールドモデルへの踏み台として捉えています。内部状態の表現をスケーリングすることで、チームは、異なるルールや環境にわたって汎用化できるシミュレーションを作成し、最終的にはユーザーの相互作用に基づいて完全に新しい体験を生成できると考えています。

マルチエージェント強化学習 (MARL)

Agora-1の最も有望ななアプリケーションの一つは、強化学習の領域にあります。従来のワールドモデルは、エージェントのトレーニングを単一参加者のシナリオに限定していました。Agora-1は、この制限を排除し、相互作用空間の組み合わせ的な成長を可能にします。これにより、エージェントは、受動的なデータセットではめったに捉えられない、協調的な動きや争奪される目的物といった、複雑な創発的行動を体験し、学習することが可能になります。

想像上のマルチエージェント・トレーニング

既存のゲームをシミュレートするだけでなく、Agora-1は生成的なシミュレーターとして機能することができます。これらの「想像上の」世界の中で完全にトレーニングされたポリシーは、ゲームやシミュレーションの元のソースコードに一度もアクセスすることなく、未知の環境やパートナーに対して汎用化できる可能性があります。

批判的な視点と課題

技術的な達成は重要ですが、コミュニティは、これらのモデルの実用的な適用と限界について、いくつかの重要な点を指摘しています。

「ゲームエンジン」論争

一部の批判者は、GenAIをゲームエンジンの代替として使用することは非効率的であると主張しています。あるユーザーが指摘したように、Agora-1のデモにおける入力レスポンスの低さを挙げ、モデルに実際のエンジンロジックをハンドルするのではなく、従来のエンジンに組み込むスクリプトやアセットを作成するために生成AIを使用する方が、より実用的である可能性があると述べています。

現実世界への汎用化

ゲームエンジンの内部状態から学習することと、その知識を現実世界のロボティクスに適用することの間には、大きな隔たりがあります。コミュニティのメンバーが指摘したように、人間は物理的な世界と相互作用することで環境との相互作用を効率的に学習します。対して、Agora-1は、現在は比較的静的な環境において、相互作用がゲーム開発者によって事前に定義されている環境で動作しています。

"内部ワールド状態を学習することで、現実のロボティクスに転移可能にする必要があります。トレーニング中にはゲームエンジンの内部状態をクエリエリテーション(照会)することはできないからです。"

倫理的および安全性の懸念

これらのモデルが軍事的な文脈で適用される可能性も強調されています。戦闘映像に基づいてモデルをトレーニングし、それらを現実の生活におけるシナリオリオに配備することは、戦争の自動化とシミュレーション技術の「悪夢のような」適用の可能性について、倫理的な懸念を提起します。

ゲームの枠を超えて

批判はありますが、Agora-1のアーキテクチャは、レトロゲームの枠を遥かに超えた意味を持っています。例えば、協調ロボティクスにおいて、複数のロボットが共有スペースと相互作用について共同で推論することが必要です。学習されたマルチエージェント・ワールドモデルは、、従来の、ハードコードされたシミュレーションよりも、共有の物理的環境においてロボットが行動を協調するための、必要なフレームワークを提供できる可能性があります。Agora-1を、ワールドモデルの失敗を暴くために敵対的ポリシーを使用する PROWL などのフレームワークと組み合わせることで、Odysseyは、オープンエンドなシミュレートされた世界の中で高度な知能をトレーニングするための基盤を構築しています。

Sources