SIMA 2:一個在虛擬 3D 世界中與你一起玩耍、推理與學習的代理人

SIMA 2 從遵循指令演變為互動推理

Google DeepMind 推出了 SIMA 2,一個結合 Gemini 模型的通用 AI 代理人,從基本的指令執行者轉變為互動式遊戲夥伴。與前代不同,SIMA 2 能夠對高層次目標進行推理,與使用者對話以描述其預期的行動,並透過自我導向的遊玩隨時間提升自身表現。

結合 Gemini 以實現高階推理

SIMA 2 使用 Gemini 模型作為核心架構,使其能超越原始 SIMA 的 600 種語言遵循技能。此整合讓代理人能在複雜的 3D 環境中,透過虛擬鍵盤與滑鼠感知、理解並執行以目標為導向的行動,而不需要存取底層的遊戲機制。

關鍵的技術推進包括:

  • 目標導向執行:代理人能理解高層次使用者目標,並執行達成目標所需的複雜推理。
  • 透明溝通:在結合人類示範影片與 Gemini 生成標籤的混合訓練下,SIMA 2 能詳細說明其完成任務的具體步驟。
  • 協作互動:互動模型已從簡單的指令回應轉變為與使用者共同推理任務的合作夥伴關係。

跨未見環境的泛化

與第一版相比,SIMA 2 展示出顯著提升的泛化能力與可靠性,在各種任務上表現更接近人類水平。它能在不同遊戲之間轉移學習概念——例如將「採礦」概念從一個遊戲套用到另一個遊戲的「收割」上。

代理人的泛化能力包括:

  • 複雜任務處理:能理解並完成冗長且細緻的指令。
  • 多模態理解:支援多模態提示、不同語言與表情符號。
  • 零樣本適應性:SIMA 2 能在未受訓練的遊戲中運作,例如維京生存遊戲 ASKA 與研究實作 MineDojo(Minecraft)。
  • 合成世界適應:與 Genie 3(可根據文字或圖像即時生成 3D 模擬世界的模型)結合時,SIMA 2 能在全新想像的環境中定位自身並執行有意義的行動,即使從未遭遇過此類環境。

可擴展的自我改進循環

SIMA 2 引入了多任務自我改進的能力,使代理人能在新世界中發展技能,而無需額外的人類生成資料。這透過迭代改進的良性循環得以實現:

  1. 初始指導:Gemini 為代理人的行為提供初始任務與預估獎勵。
  2. 經驗儲存:此資訊被存入自生成經驗的資料庫。
  3. 迭代訓練:代理人利用這些經驗訓練後續世代,使其能在無需人工介入的情況下克服先前失敗的任務。

此流程已擴展至新創建的 Genie 環境,標誌著在多樣且生成的世界中訓練通用代理人的里程碑。

目前的限制與未來方向

儘管取得了進展,SIMA 2 仍是一項研究計畫,面臨多項未解挑戰:

  • 長時程任務:代理人在需要大量多步驟推理與目標驗證的極度複雜任務上仍顯吃力。
  • 記憶限制:為維持低延遲互動,SIMA 2 使用有限的上下文窗口,導致對互動的記憶相對較短。
  • 低階控制:在複雜 3D 場景中實現穩健的視覺理解,並透過鍵盤與滑鼠執行精確的低階動作仍具挑戰性。

對通用具身智慧的意涵

SIMA 2 作為通往通用、行動導向 AI 路徑的驗證。透過將多樣的多世界資料與 Gemini 的推理能力結合,Google DeepMind 旨在為未來的實體世界 AI 助手打造基礎構件。虛擬環境中學習的技能——導航、工具使用與協作執行——被視為機器人實體化智慧的必要前置條件。

SIMA 2 目前以有限的研究預覽形式提供給少數學者與遊戲開發者。

Sources