JackHopkins/factorio-learning-environment

A non-saturating, open-ended environment for evaluating LLMs in Factorio

解決的問題

本專案提供了一個標準化的框架,用於在遊戲 Factorio 中開發和測試大型語言模型 (LLM) 智能體。其目標是建立具挑戰性、開放式的評估基準,即使是先進的前沿模型也難以輕易解決,以防止 AI 智能體能輕鬆解決所有任務而導致基準測試「飽和」。

運作方式

智能體使用基於 REPL (Read-Eval-Print-Loop) 模式的程式碼合成方法與遊戲環境互動。過程分為三個步驟:

  1. 觀察:智能體讀取先前程式的輸出流 (stdout/stderr) 以了解世界狀態。
  2. 行動:智能體編寫 Python 程式以在遊戲中執行特定行動。
  3. 回饋:環境執行程式,更新遊戲狀態與命名空間,並將輸出流回傳給智能體。

適用對象

從事 LLM 智能體相關工作的 AI 研究人員與開發者,特別是專注於長期規劃、資源管理及開放式評估基準的人員。

亮點

  • 程式碼合成介面:智能體透過 Python 程式設計控制遊戲,而非簡單的文字指令。
  • 評估框架:包含用於執行評估軌跡與實驗的內建工具。
  • 可擴展架構:支援如 Model Context Protocol (MCP) 與 PostgreSQL 等用於資料管理的選用功能。
  • 整合叢集管理:提供 CLI 工具 (fle cluster start) 來管理環境所需的 Factorio 遊戲叢集。

相關

  • 專案
  • 專案
  • 專案
  • 專案