Jev 玩 Pokémon Red – AI 遊戲實況演示與社群見解
快速摘要
Jev 是一個 AI 決策模型,能夠在直播中遊玩整個 Pokémon Red 遊戲。它展示了低成本、快速的動作選擇能力,同時也揭露了諸如在門口循環徘徊以及戰鬥決策不佳等顯著的失敗模式。
Jev 的功能
- 遊戲實況:該演示直播 Pokémon Red,預設靜音;使用者可以取消靜音以收聽遊戲音效。
- 決策面板:右側面板列出了 AI 的每一項決策及其對應的機率(勝算)。
- 引導導航:AI 遵循預先計算的指南,告知其下一步該去哪裡,類似於人類的攻略。
- 開源:程式碼可在 GitHub (https://github.com/christianmat/jev-pokemon) 上取得,即時應用程式託管於 https://jev-pokemon.vercel.app/。
系統運作方式
- 狀態提取 – 遊戲狀態從模擬器記憶體中讀取(一種「記憶體駭客」技術),提供關於位置、物品欄和戰鬥狀態的精確資訊。
- 決策模型 – 一個輕量級語言模型(稱為 Jev)接收當前狀態的文字描述以及可能採取的動作列表(例如:「向北移動」、「選擇選單選項」)。
- 機率評分 – 模型會回傳動作的機率分佈;機率最高的動作會被發送為按鍵指令。
- 引導覆蓋層 – 一個獨立的指南模組提供高階路徑點(例如:「前往 Pewter City」),限制動作空間並防止漫無目的地遊蕩。
- 循環偵測 – 系統會記錄每一項決策;當相同的狀態再次出現時,模型可能會重複動作,導致觀察到的循環現象。
"右側面板顯示了每一項決策以及 Jev 的勝算。" – 專案說明
社群觀察
強項亮點
- 速度與成本:評論者指出 AI 的決策速度快且貨幣成本低(38 小時的遊戲時間約為 $1.65 美元)。
- 透明度:即時決策面板讓觀察者能看到模型的信心程度,這在許多 AI 遊戲演示中相當罕見。
- 概念驗證:完成遊戲(或達到四天王)證明了緊湊的決策引擎可以處理完整的 RPG 循環。
"做得好!看到它玩完整個遊戲真是太酷了。我這週花了自己的 fable 預算來建構類似的東西,但只玩到了 Brock 那裡。" – hummusFiend
弱點與失敗模式
- 循環行為:使用者回報 AI 在 Rocket Hideout 等地點卡住數分鐘,反覆開啟同一扇門。
- 受限的選擇:決策集受到指南的嚴格限制,當 AI 無法偏離預先寫好的路徑時,會顯得「笨拙」。
- 次優的戰鬥策略:AI 有時會做出糟糕的舉動,例如教導 Charizard 使用非傷害技能 Counter,而不是火屬性攻擊。
- 缺乏視覺能力:系統依賴記憶體讀取而非原始像素輸入,限制了其應用於其他遊戲的通用性。
"我希望 Jev 能接收影像,這樣我們就能將其通用化應用於任何遊戲,而無需使用記憶體駭客技術。" – avaer
架構問題
- 角色移動控制:「Jev calls」計數器僅在選單或戰鬥提示時增加,這表明有另一個獨立的腳本處理低階移動,而 Jev 負責決定高階動作。
- 目標來源:指南似乎提供了高階目標(例如:「到達 Pokémon Center」),但產生這些目標的確切機制並未在演示中公開。
- 更大模型的潛力:一些評論者好奇像 Fable 這樣更大的模型是否能取代指南,並同時處理高階規劃與低階執行。
"查看 gh 儲存庫中的圖表,看起來這完全是 Jev 在運作。有沒有人使用像 Fable 這樣的大型模型來處理高階目標的例子?" – lwarfield
為何這很重要
- 「系統一」AI 的基準:像 Pokémon Red 這樣的遊戲提供了一個受控環境,用於測試快速、反射式的決策制定,而無需視覺轉文字管線的延遲。
- 混合 AI 管線:該專案展示了一種有前景的拆分方式——使用高階規劃器(可能是大型 LLM)來設定目標,並使用輕量級決策引擎進行快速執行。
- 具成本效益的研究:展示了以不到兩美元的成本完成完整遊戲的運行,顯示大規模的 AI 遊戲實驗可以在無需龐大運算預算的情況下進行。
開放性問題與未來方向
- 基於視覺的輸入:將記憶體駭客替換為影像轉文字模型,可以擴大其對現代遊戲的適用性。
- 動態目標生成:整合大型 LLM 來即時生成和調整目標,可能會減少對手工編寫指南的依賴。
- 循環緩解:實作狀態歷史感知或強化學習風格的懲罰機制,可以防止無止盡的開門循環。
- 多人遊戲考量:正如社群成員所指出的,在線上遊戲中部署此類代理程式會引發反作弊和公平性問題。
總結:Jev 的 Pokémon Red 即時實況證明了緊湊的決策模型能以低成本導航複雜的 RPG,但該演示也凸顯了在超越受限、易循環行為方面,需要更好的狀態感知、視覺整合與更高階的規劃能力。
Sources
相關
- Dispatch
- 專案
- Dispatch
- 專案
- Dispatch