TextArena/TextArena

A Collection of Competitive Text-Based Games for Language Model Evaluation and Reinforcement Learning

解決的問題

TextArena 提供了一種標準化的方法,使用文字遊戲對大型語言模型(LLMs)進行基準測試與訓練。它解決了在不依賴傳統視覺介面的情況下,測試模型推理、策略制定與多玩家互動能力的需求。

工作原理

該框架採用類似 OpenAI Gym 的介面,可與各種強化學習(RL)與語言模型框架整合。它提供了一個包含 100 多個遊戲的套件(包括單人、雙人與多人遊戲),其中代理——僅需一個接收字串觀測並返回字串動作的 call 函數——可進行競爭或解謎。

適用對象

專為關注 LLM 訓練、評估以及模型推理能力的 AI 研究人員與開發者設計,尤其適合對多智能體強化學習與心智理論感興趣的使用者。

主要亮點

  • 超過 100 個用於基準測試與訓練的文字遊戲。
  • 類似 OpenAI Gym 的介面,便於與 RL 框架整合。
  • 支援單人、雙人與多人遊戲環境。
  • 透過簡單的字串輸入/輸出介面,相容多種 LLM 代理。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案