JackHopkins/factorio-learning-environment
A non-saturating, open-ended environment for evaluating LLMs in Factorio
解決する課題
このプロジェクトは、ゲーム Factorio 内で大規模言語モデル (LLM) エージェントを開発およびテストするための標準化されたフレームワークを提供します。高度なフロンティアモデルでさえも困難であり続けるような、挑戦的でオープンエンドの評価ベンチマークを作成することを目指しており、AIエージェントがすべてのタスクを簡単に解決してしまうベンチマークの「飽和」を防ぎます。
仕組み
エージェントは、REPL (Read-Eval-Print-Loop) パターンに基づくコード合成アプローチを使用してゲーム環境と対話します。プロセスは次の3つのステップで構成されます:
- 観察: エージェントは、前のプログラムの出力ストリーム (stdout/stderr) を読み取り、世界の状態を理解します。
- 行動: エージェントは、ゲーム内で特定の行動を実行するための Python プログラムを記述します。
- フィードバック: 環境がプログラムを実行し、ゲームの状態と名前空間を更新し、出力ストリームをエージェントに返します。
対象者
LLM エージェントに取り組む AI 研究者および開発者、特に長期的な計画、リソース管理、オープンエンドの評価ベンチマークに焦点を当てている人々。
ハイライト
- コード合成インターフェース: エージェントは単純なテキストコマンドではなく、Python プログラミングを通じてゲームを制御します。
- 評価フレームワーク: 評価軌道と実験を実行するための組み込みツールが含まれています。
- 拡張可能なアーキテクチャ: データ管理用の Model Context Protocol (MCP) や PostgreSQL などのオプション機能をサポートしています。
- 統合クラスタ管理: 環境に必要な Factorio ゲームクラスタを管理するための CLI ツール (
fle cluster start) を提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト