JackHopkins/factorio-learning-environment
A non-saturating, open-ended environment for evaluating LLMs in Factorio
해결하는 문제
이 프로젝트는 게임 Factorio 내에서 대형 언어 모델 (LLM) 에이전트를 개발하고 테스트하기 위한 표준화된 프레임워크를 제공합니다. 고급 프론티어 모델조차도 여전히 어려운 도전적이고 개방형 평가 벤치마크를 생성하여 AI 에이전트가 모든 작업을 쉽게 해결할 수 있는 벤치마크의 "포화" 현상을 방지하는 것을 목표로 합니다.
작동 방식
에이전트는 REPL (Read-Eval-Print-Loop) 패턴을 기반으로 한 코드 합성 접근 방식을 사용하여 게임 환경과 상호 작용합니다. 이 프로세스는 세 단계를 따릅니다:
- 관찰: 에이전트는 이전 프로그램의 출력 스트림(stdout/stderr)을 읽어 세계의 상태를 파악합니다.
- 행동: 에이전트는 게임 내에서 특정 행동을 실행하기 위해 Python 프로그램을 작성합니다.
- 피드백: 환경은 프로그램을 실행하고, 게임 상태와 네임스페이스를 업데이트하며, 출력 스트림을 에이전트에게 반환합니다.
대상 독자
LLM 에이전트 관련 AI 연구원 및 개발자, 특히 장기 계획, 리소스 관리 및 개방형 평가 벤치마크에 중점을 두는 사람들.
주요 특징
- 코드 합성 인터페이스: 에이전트는 단순한 텍스트 명령 대신 Python 프로그래밍을 통해 게임을 제어합니다.
- 평가 프레임워크: 평가 궤적과 실험을 실행하기 위한 내장 도구가 포함되어 있습니다.
- 확장 가능한 아키텍처: 데이터 관리를 위한 Model Context Protocol (MCP) 및 PostgreSQL과 같은 선택적 기능을 지원합니다.
- 통합 클러스터 관리: 환경에 필요한 Factorio 게임 클러스터를 관리하기 위한 CLI 도구(
fle cluster start)를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트