JackHopkins/factorio-learning-environment

A non-saturating, open-ended environment for evaluating LLMs in Factorio

解決する課題

このプロジェクトは、ゲーム Factorio 内で大規模言語モデル (LLM) エージェントを開発およびテストするための標準化されたフレームワークを提供します。高度なフロンティアモデルでさえも困難であり続けるような、挑戦的でオープンエンドの評価ベンチマークを作成することを目指しており、AIエージェントがすべてのタスクを簡単に解決してしまうベンチマークの「飽和」を防ぎます。

仕組み

エージェントは、REPL (Read-Eval-Print-Loop) パターンに基づくコード合成アプローチを使用してゲーム環境と対話します。プロセスは次の3つのステップで構成されます:

  1. 観察: エージェントは、前のプログラムの出力ストリーム (stdout/stderr) を読み取り、世界の状態を理解します。
  2. 行動: エージェントは、ゲーム内で特定の行動を実行するための Python プログラムを記述します。
  3. フィードバック: 環境がプログラムを実行し、ゲームの状態と名前空間を更新し、出力ストリームをエージェントに返します。

対象者

LLM エージェントに取り組む AI 研究者および開発者、特に長期的な計画、リソース管理、オープンエンドの評価ベンチマークに焦点を当てている人々。

ハイライト

  • コード合成インターフェース: エージェントは単純なテキストコマンドではなく、Python プログラミングを通じてゲームを制御します。
  • 評価フレームワーク: 評価軌道と実験を実行するための組み込みツールが含まれています。
  • 拡張可能なアーキテクチャ: データ管理用の Model Context Protocol (MCP) や PostgreSQL などのオプション機能をサポートしています。
  • 統合クラスタ管理: 環境に必要な Factorio ゲームクラスタを管理するための CLI ツール (fle cluster start) を提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト