Agora-1: 引領多智能體世界模型 (Multi-Agent World Model)

Agora-1: 引領多智能體世界模型 (Multi-Agent World Model)\n\n「世界模型」的概念長期以來一直是 AI 研究的基石,為智能體提供了一種模擬環境並預測未來狀態的方法。然而,直到現在,大多數世界模型都僅限於單一主動參與者。Odyssey 團隊發布的 Agora-1 標誌著一個重大的轉變,它引入了第一個能夠支持多個人類或 AI 智能體在同一個模擬環境中進行實時互動的多智能體世界模型。\n\n通過使用經典遊戲 GoldenEye 作為測試場,Odyssey 展示了世界模型可以作為一個學習到的遊戲引擎,在參與者之間維持共享狀態,並同時向每位玩家串流生成的像素。這一進步為機器人技術、國防、教育以及基礎模型的開發開啟了新的大門。\n\n## 架構:將模擬與渲染解耦\n\n為了給多位玩家實現一致的共享體驗,Agora-1 背離了以往的方法。早期的模型如 Multiverse 和 Solaris 嘗試通過串聯智能體狀態或序列來處理多智能體互動,但這些方法在擴展性和一致性方面往往面臨挑戰——特別是在玩家失去彼此視線時。\n\nAgora-1 通過將模擬動態與視覺渲染解耦來解決這個問題。該系統學習兩個不同的功能:\n\n1. 學習共享世界狀態: 模型是在遊戲(例如 GoldenEye)的內部狀態上進行訓練的,學習世界狀態如何根據玩家行為而演變。這包括追蹤生命值、位置和其他關鍵的遊戲玩法變量。\n2. 學習視覺渲染: 一個基於 Diffusion Transformer (DiT) 的世界模型以共享的遊戲狀態為條件來渲染視覺輸出。與依賴提示詞或圖像的傳統模型不同,Agora-1 直接根據學習到的狀態來渲染視圖。\n\n這種分離與現代遊戲引擎類似,但有一個關鍵區別:模擬和渲染都是完全學習到的系統。沒有硬編碼的規則;模型直接從數據中學習世界的「物理學」和「視覺效果」。\n\n## 向基礎世界模型擴展\n\nOdyssey 將 Agora-1 視為邁向更通用的基礎世界模型的墊腳石。通過擴展內部狀態表示,團隊相信他們可以創建在不同規則和環境中具有泛化能力的模擬,最終根據用戶互動生成全新的體驗。\n\n### 多智能體強化學習 (MARL)\n\nAgora-1 最具前景的應用之一是在強化學習領域。傳統世界模型將智能體的訓練限制在單一參與者場景中。Agora-1 移除了這一限制,允許互動空間的組合式增長。這使得智能體能夠體驗並從複雜的湧現行為中學習——例如協調運動和爭奪目標——這些行為在被動數據集中很少被捕捉到。\n\n### 想像中的多智能體訓練\n\n除了僅僅模擬現有遊戲外,Agora-1 還可以作為一個生成式模擬器。完全在這些「想像」的世界中訓練的策略可能會最終泛化到未見過的環境或夥伴,而無需訪問遊戲或模擬的原始源代碼。\n\n## 批判性觀點與挑戰\n\n雖然技術成就顯著,但社群對這些模型的實際應用和局限性提出了幾個重要的觀點。\n\n### 「遊戲引擎」爭論\n\n一些批評者認為,使用 GenAI 作為遊戲引擎的替代品是低效的。正如一位用戶所指出的,使用生成式 AI 來創建插件到傳統引擎中的腳本和資產可能比依賴模型來處理實際的引擎邏輯更為實用,並引用了 Agora-1 演示中的輸入響應性差的問題。\n\n### 向現實世界的泛化\n\n學習從遊戲引擎的內部狀態到將該知識應用於現實世界的機器人技術之間存在著巨大的鴻溝。正如社群成員所指出的,人類學習環境互動的效率很高,因為他們與物理世界互動,而 Agora-1 目前在一個相對靜態的環境中運行,其中的互動是預先定義的遊戲開發者所定義的。\n\n> "對於要轉移到現實生活中的機器人技術,需要學習內部世界狀態,因為你無法在訓練中查詢遊戲引擎的內部細節。"\n\n### 倫理與安全擔憂\n\n這些模型被應用於軍事背景的可能性也已被強調。能夠在戰鬥畫面中訓練模型並將其部署在於現實生活場景中,這引向了關於戰爭自動化和模擬技術「噩夢式」應用的倫理擔憂。\n\n## 超越遊戲\n\n儘管存在批評,Agora-1 的架構具有遠遠超出復古遊戲的影響。例如,在協作機器人技術中,多個機器人必須共同推理關於共享空間和互動。一個學習到的多智能體世界模型可以為機器人提供必要的框架,使機器人在共享的物理環境中協調其行動比傳統的、硬編碼的模擬更有效率。通過結合 Agora-1 與 PROWL 等框架——該框架使用對抗性策略來揭示世界模型的失敗——Odyssey 正在為在開放式、模擬世界的中訓練進階階層級智能(Advanced Intelligence)建立基礎。

Sources