TextQuests:評估大型語言模型在文字冒險遊戲中的代理推理能力

TextQuests 基準:自律代理評估

Hugging Face 推出 TextQuests,這是一項旨在評估大型語言模型(LLM)在複雜、探索性環境中作為自律代理的能力的基準。雖然前沿模型已在 MMLU 與 GPQA 等靜態知識基準上達到飽和,TextQuests 則測試這些知識是否能轉化為需要在不斷增長的上下文中持續、自主推理的動態、互動情境。

基準設計與方法論

TextQuests 使用 25 款經典 Infocom 互動小說遊戲。這些遊戲作為嚴謹的測試平台,因為它們常需數百個精確操作,且人類玩家完成可能需要超過 30 小時。此基準特別衡量兩項核心的代理能力:

  • 長上下文推理: 在沒有外部工具的情況下,根據持續增長的行動與觀察歷史,制定並執行多步計畫的能力。
  • 透過探索學習: 從經驗中學習、分析失敗,並透過試錯進行漸進式改進的能力。

評估指標

模型會在兩種不同的執行方式下進行評估:一種可取得官方遊戲提示(「有提示」),另一種則無(「無提示」)。每次執行限制為 500 步,且完整的遊戲歷史不會被截斷,以測試長上下文表現。績效透過兩項主要指標衡量:

  1. 遊戲進度: 以代理在完成遊戲路徑上達成的標記檢查點(必要目標)數量來衡量。
  2. 有害行為: 一項倫理評估,追蹤遊戲中被視為有害的特定行動,並在所有遊戲中取平均,以判斷代理整體的有害行為傾向。

LLM 表現的主要發現

長上下文推理失敗

當上下文窗口超過 100K 令牌時,現有 LLM 在精確推理與規劃上出現顯著失敗。常見問題包括:

  • 幻覺: 模型常會產生對先前互動的幻覺,例如誤以為已取得實際未取得的物品。
  • 重複行為: 隨著上下文變長,代理更傾向重複先前的行動,而非合成新計畫。
  • 空間推理缺陷: 模型在心智映射上掙扎。例如在遊戲 Wishbringer 中,LLM 常無法透過反向上升路徑返回懸崖下方——此資訊在上下文歷史中已明確存在。同樣地,所有前沿 LLM 在 Zork I 的迷宮中也難以導航。

動態思考與效率

此基準揭示了推理深度與運作效率之間的取捨。雖然使用更多測試時計算資源(產生更多推理令牌)的模型通常能取得更高績效,但此效益在超過一定預算後會減弱。

因為許多探索步驟(如基本導航)屬於中間過程,且不需深度推理,理想的 LLM 代理應能根據任務複雜度動態調整推理投入,以最佳化推論成本與延遲。

Sources