JackHopkins/factorio-learning-environment

A non-saturating, open-ended environment for evaluating LLMs in Factorio

解决的问题

本项目提供了一个标准化的框架,用于在游戏 Factorio 中开发和测试大型语言模型 (LLM) 智能体。其目标是创建具有挑战性、开放式的评估基准,即使是先进的前沿模型也难以轻易解决,以防止 AI 智能体能轻松解决所有任务而导致基准测试“饱和”。

运作方式

智能体使用基于 REPL (Read-Eval-Print-Loop) 模式的代码合成方法与游戏环境交互。过程分为三个步骤:

  1. 观察:智能体读取先前程序的输出流 (stdout/stderr) 以了解世界状态。
  2. 行动:智能体编写 Python 程序以在游戏中执行特定行动。
  3. 反馈:环境运行程序,更新游戏状态与命名空间,并将输出流返回给智能体。

适用对象

从事 LLM 智能体相关工作的 AI 研究人员与开发者,特别是专注于长期规划、资源管理及开放式评估基准的人员。

亮点

  • 代码合成接口:智能体通过 Python 编程控制游戏,而非简单的文本指令。
  • 评估框架:包含用于运行评估轨迹与实验的内置工具。
  • 可扩展架构:支持如 Model Context Protocol (MCP) 与 PostgreSQL 等用于数据管理的可选功能。
  • 集成集群管理:提供 CLI 工具 (fle cluster start) 来管理环境所需的 Factorio 游戏集群。

相关

  • 项目
  • 项目
  • 项目
  • 项目