DeepMind 宣布與 Fenris Creations 合作,在 EVE Universe 中開發通用型遊戲代理人

TL;DR

DeepMind 宣布與 Fenris Creations 建立研究合作夥伴關係,旨在開發能在持續性的 EVE Online 宇宙中運行的通用型 AI 代理人,目標是實現持續學習、長期記憶和多代理人規劃等能力,以解鎖全新的遊戲玩法並為更廣泛的 AI 研究提供資訊。

以遊戲作為 AI 突破的催化劑

DeepMind 的 AI 研究歷來將遊戲作為測試平台。從透過原始像素學習 49 款 Atari 2600 遊戲的 Deep Q-Network (DQN) (Nature, 2015) 開始,該實驗室進步到 AlphaGo (2016)、AlphaGo Zero、AlphaZero、MuZero 和 AlphaStar,每一款都展示了日益通用的強化學習方法。在遊戲中的成功直接轉化為非遊戲領域,最著名的例子是 AlphaFold,它利用源自遊戲的技術解決了蛋白質結構預測問題,並榮獲 2024 年諾貝爾化學獎。

從精通遊戲到理解遊戲:SIMA 議程

DeepMind 的下一個研究問題是,AI 是否能在不接觸內部 API 或原始碼的情況下,像人類玩家一樣「理解」任何遊戲世界。Scalable Instructable Multiworld Agent (SIMA) 系列透過以下方式解決此問題:

  • 觀察遊戲畫面,就像玩家一樣。
  • 解讀自然語言指令。
  • 透過標準的鍵盤和滑鼠輸入來控制遊戲。

基於 Gemini 系列前沿模型構建的 SIMA 2 展示了在 No Man's SkyValheimHydroneer 等 3D 環境中的即時推理、對話和人類水平的遊戲表現。一個真正的通用型遊戲代理人將能實現能理解遊戲世界的 AI 夥伴,以及能超越腳本行為進行適應的 NPC,以及能容忍持續代碼變動的強大 QA 測試。

Fenris Creations 合作夥伴關係:一個活生生的實驗室

Fenris Creations 是 EVE Universe 背後的獨立工作室,為測試這些能力提供了獨特且不斷演進的沙盒環境。EVE Online 的持續性、玩家驅動的經濟和多規模衝突呈現了四個與 DeepMind 前沿 AI 目標一致的核心挑戰:

  1. 持續學習 – 在一個每天都在變化的世界中,獲取新技能同時保留先前的知識。
  2. 長期記憶 – 儲存並檢索跨越遠超目前模型上下文窗口的時間尺度資訊。
  3. 長程規劃 – 做出跨越數週、數月或數年的決策。
  4. 複雜的多代理人動態 – 在大規模規模下處理合作、競爭、談判和湧現的社會行為。

該合作夥伴關係涵蓋三個 EVE 環境:

  • EVE Online – 一個大規模、單一分片 (single-shard) 的持續性宇宙,用於研究星系級別的策略。
  • EVE Vanguard – 一個第一人稱、節奏快速的戰術層,將地面行動與更廣闊的宇宙連接起來。
  • EVE Frontier – 一個開放、可編程的沙盒,具有「Smart Assemblies」功能,讓世界的規則可以演進,測試代理人的適應能力以應對新機制。

早期成果與路線圖

合作的一個具體成果是 Aura Guidance 系統,該系統使用 Gemini 來向 EVE Online 的新飛行員提供社群生成的幫助內容。研究路線圖分階段進行:

  1. 離線沙盒 – 一個安全的 EVE Online 副本,用於初始代理人訓練和安全性測試。
  2. EVE Frontier 實驗 – 共同開發能在開放式設定中與人類共存的代理人。
  3. 實時集成 – 一旦代理人展示出成熟的能力,它們可能會被引入 EVE Online 和 EVE Vanguard,以豐富玩家體驗。

對 AI 與遊戲的影響

如果成功,該合作夥伴關係可以:

  • 提供能理解自然語言、記得過去的互動並進行長程規劃的 AI 夥伴。

  • 實現動態、具備適應性的 NPC,它們能對湧現的玩家行為做出反應,而不需手動腳本。

  • 為持續學習演算法提供測試平台,使其能擴展到現實世界的複雜度。

  • 將從持續性虛擬經濟中的洞察轉化為現實世界的領域,例如金融、物流和協作機器人技術。

結論

DeepMind 與 Fenris Creations 的合作標誌著從 AI 「精通」遊戲到 AI 「理解」並與複雜、持續性的虛擬世界「共同演進」的戰略轉向。透過在 EVE Universe 中解決持續學習、長期記憶和多代理人 dynamics 著手,該合作夥伴關係旨在創造突破性的遊戲玩法體驗,並為更廣泛的科學挑戰產生可轉移的 AI 知識。

Sources

相關