JevがプレイするPokémon Red – ライブAIゲームプレイデモとコミュニティの洞察
クイックテイク
AI駆動の意思決定モデルであるJevは、Pokémon Redの全編をライブストリームでプレイ可能です。安価かつ迅速なアクション選択を実証する一方で、ドアでのループや最適ではない戦闘選択といった顕著な失敗モードも明らかにしています。
Jevの仕組み
- ライブゲームプレイ: デモではPokémon Redがストリーミングされ、デフォルトで音声はミュートされています。ユーザーはミュートを解除してゲーム音を聞くことができます。
- 意思決定パネル: 右側のパネルには、AIのすべての決定と各選択肢に割り当てられた確率(オッズ)がリスト表示されます。
- ガイド付きナビゲーション: AIは、人間がプレイする攻略本のように、次にどこへ行くべきかを指示する事前計算されたガイドに従います。
- オープンソース: コードはGitHub (https://github.com/christianmat/jev-pokemon) で公開されており、ライブアプリは https://jev-pokemon.vercel.app/ でホストされています。
システムの動作原理
- 状態抽出 – ゲームの状態はエミュレータのメモリから読み取られ("memhack")、場所、インベントリ、戦闘状況に関する正確な情報を提供します。
- 意思決定モデル – 軽量な言語モデル(Jevと呼称)が、現在の状態のテキスト記述と可能なアクションのリスト(例:「北へ移動」、「メニューオプションを選択」)を受け取ります。
- 確率スコアリング – モデルはアクションに対する確率分布を返し、最も確率の高いアクションがボタン押下として送信されます。
- ガイダンスオーバーレイ – 別個のガイドモジュールが高レベルのウェイポイント(例:「ニビシティへ行く」)を提供し、アクション空間を制限して無意味な彷徨いを防ぎます。
- ループ検出 – システムは各決定をログに記録します。同じ状態が繰り返されると、モデルがアクションを繰り返す可能性があり、観測されるループにつながります。
"右側のパネルには、すべての決定とJevのオッズが表示されています。" – プロジェクトの説明
コミュニティの観察
強調された強み
- 速度とコスト: コメンテーターは、AIの迅速な決定レートと低い金銭的コスト(38時間のプレイで約1.65ドル)を指摘しています。
- 透明性: ライブ意思決定パネルにより、観察者はモデルの確信度を確認できます。これは多くのAIゲームデモでは珍しいことです。
- 概念実証: ゲームをクリアする(または四天王に到達する)ことは、コンパクトな意思決定エンジンが完全なRPGループを処理できることを示しています。
"素晴らしい仕事です!ゲーム全体をプレイするのを見るのはとてもクールです。今週、似たようなものを作るためにfableの予算を使いましたが、タケシまでしか進められませんでした。" – hummusFiend
弱点と失敗モード
- ループ動作: ユーザーは、AIがロケット団アジトのような場所で、同じドアを繰り返し開け続けるなど、数分間立ち往生することを報告しました。
- レールに乗った選択: 意思決定セットはガイドによって厳しく制限されており、事前に書かれたパスから逸脱できないため、AIが「愚か」に見えることがあります。
- 最適ではない戦闘戦術: AIは、リザードンに炎タイプの攻撃ではなくダメージを与えない技であるカウンターを覚えさせるなど、下手な動きをすることがあります。
- 視覚の欠如: システムは生のピクセル入力ではなくメモリ読み取りに依存しているため、他のゲームへの汎用性が制限されています。
"Jevが画像を取り込んでくれれば、memhackなしでどんなゲームでも汎用的にこれができるのに。" – avaer
アーキテクチャに関する疑問
- キャラクター移動の制御: "Jev calls"カウンターはメニューや戦闘のプロンプトでのみ増加するため、別のスクリプトが低レベルの移動を処理し、Jevが高レベルのアクションを決定していることが示唆されます。
- 目標のソース: ガイドが高レベルの目標(例:「ポケモンセンターに到達する」)を提供しているようですが、これらの目標を生成するための正確なメカニズムはデモでは公開されていません。
- より大きなモデルの可能性: 一部のコメンテーターは、Fableのようなより大きなモデルがガイドに取って代わり、高レベルの計画と低レベルの実行の両方を処理できるのではないかと疑問を呈しています。
"ghリポジトリの図を見ると、これは完全にJevだけで構成されているようです。Fableのような大きなモデルが高レベルの目標を処理している例はありますか?" – lwarfield
なぜこれが重要なのか
- 「システム1」AIのベンチマーク: Pokémon Redのようなゲームは、視覚からテキストへのパイプラインの遅延なしに、高速で反射的な意思決定をテストするための制御された環境を提供します。
- ハイブリッドAIパイプライン: このプロジェクトは、高レベルのプランナー(潜在的には大規模なLLM)を目標に使用し、軽量な意思決定エンジンを迅速な実行に使用するという有望な分割を示しています。
- 費用対効果の高い研究: 2ドル未満でフルゲームの実行を実証することは、大規模な計算予算なしで広範なAIゲームプレイ実験を実行できることを示しています。
未解決の疑問と今後の方向性
- 視覚ベースの入力: メモリハックを画像からテキストへのモデルに置き換えることで、現代のゲームへの適用範囲が広がる可能性があります。
- 動的な目標生成: 大規模なLLMを統合してその場で目標を生成・適応させることで、手作りのガイドへの依存を減らせるかもしれません。
- ループの緩和: 状態履歴の認識や強強化学習スタイルのペナルティを実装することで、終わりのないドアのループを防げる可能性があります。
- マルチプレイヤーの考慮事項: コミュニティメンバーが指摘したように、オンラインゲームにこのようなエージェントを導入することは、チート対策や公平性の懸念を引き起こします。
結論: JevのPokémon Redのライブ実行は、コンパクトな意思決定モデルが低コストで複雑なRPGをナビゲートできることを証明していますが、このデモは、レールに乗ったループしやすい動作を超えていくためには、より優れた状態認識、視覚統合、および高レベルの計画が必要であることも浮き彫りにしています。
Sources
関連
- Dispatch
- プロジェクト
- Dispatch
- プロジェクト
- Dispatch