TextQuests:評估大型語言模型在文字冒險遊戲中的代理推理能力
TextQuests 基準:自律代理評估
Hugging Face 推出 TextQuests,這是一項旨在評估大型語言模型(LLM)在複雜、探索性環境中作為自律代理的能力的基準。雖然前沿模型已在 MMLU 與 GPQA 等靜態知識基準上達到飽和,TextQuests 則測試這些知識是否能轉化為需要在不斷增長的上下文中持續、自主推理的動態、互動情境。
基準設計與方法論
TextQuests 使用 25 款經典 Infocom 互動小說遊戲。這些遊戲作為嚴謹的測試平台,因為它們常需數百個精確操作,且人類玩家完成可能需要超過 30 小時。此基準特別衡量兩項核心的代理能力:
- 長上下文推理: 在沒有外部工具的情況下,根據持續增長的行動與觀察歷史,制定並執行多步計畫的能力。
- 透過探索學習: 從經驗中學習、分析失敗,並透過試錯進行漸進式改進的能力。
評估指標
模型會在兩種不同的執行方式下進行評估:一種可取得官方遊戲提示(「有提示」),另一種則無(「無提示」)。每次執行限制為 500 步,且完整的遊戲歷史不會被截斷,以測試長上下文表現。績效透過兩項主要指標衡量:
- 遊戲進度: 以代理在完成遊戲路徑上達成的標記檢查點(必要目標)數量來衡量。
- 有害行為: 一項倫理評估,追蹤遊戲中被視為有害的特定行動,並在所有遊戲中取平均,以判斷代理整體的有害行為傾向。
LLM 表現的主要發現
長上下文推理失敗
當上下文窗口超過 100K 令牌時,現有 LLM 在精確推理與規劃上出現顯著失敗。常見問題包括:
- 幻覺: 模型常會產生對先前互動的幻覺,例如誤以為已取得實際未取得的物品。
- 重複行為: 隨著上下文變長,代理更傾向重複先前的行動,而非合成新計畫。
- 空間推理缺陷: 模型在心智映射上掙扎。例如在遊戲 Wishbringer 中,LLM 常無法透過反向上升路徑返回懸崖下方——此資訊在上下文歷史中已明確存在。同樣地,所有前沿 LLM 在 Zork I 的迷宮中也難以導航。
動態思考與效率
此基準揭示了推理深度與運作效率之間的取捨。雖然使用更多測試時計算資源(產生更多推理令牌)的模型通常能取得更高績效,但此效益在超過一定預算後會減弱。
因為許多探索步驟(如基本導航)屬於中間過程,且不需深度推理,理想的 LLM 代理應能根據任務複雜度動態調整推理投入,以最佳化推論成本與延遲。