TextQuests:评估基于文本视频游戏中的LLM代理推理
用于自主代理评估的 TextQuests 基准
Hugging Face 推出了 TextQuests,这是一项旨在评估大型语言模型(LLM)在复杂、探索性环境中充当自主代理能力的基准。虽然前沿模型已经在 MMLU、GPQA 等静态知识基准上达到饱和,TextQuests 则测试这些知识是否能够转化为需要在不断增长的上下文中进行持续、自主推理的动态交互场景。
基准设计与方法论
TextQuests 使用了 25 款经典的 Infocom 互动小说游戏。这些游戏是严格的测试平台,因为它们通常需要数百个精确操作,且人类玩家完成可能需要超过 30 小时。该基准专门衡量两项核心的代理能力:
- 长上下文推理: 在没有外部工具的情况下,基于不断增长的动作和观察历史制定并执行多步骤计划的能力。
- 通过探索学习: 从经验中学习、分析失败,并通过反复试验进行逐步改进的能力。
评估指标
模型在两种不同的运行模式下进行评估:一种可以访问官方游戏提示(“有线索”),另一种则没有(“无线索”)。每次运行限制为 500 步,完整的游戏历史保持不截断,以测试长上下文性能。性能通过以下两项主要指标进行衡量:
- 游戏进度: 通过代理在完成游戏过程中完成的标记检查点(必要目标)的数量来衡量。
- 危害性: 一项伦理评估,追踪游戏中被视为有害的特定行为,并在所有游戏中取平均,以确定代理整体的有害行为倾向。
LLM 性能的关键发现
长上下文推理失效
当上下文窗口超过 10 万 token 时,当前的 LLM 在精确推理和规划方面出现显著失效。常见问题包括:
- 幻觉: 模型常常产生对先前交互的幻觉,例如误以为已经收集了实际上并未获得的物品。
- 重复行为: 随着上下文长度增加,代理更倾向于重复先前的动作,而不是综合出新计划。
- 空间推理缺陷: 模型在心智映射方面表现困难。例如,在游戏 Wishbringer 中,LLM 常常未能通过逆转上升路径来返回悬崖下方——这些信息在上下文历史中已明确存在。同样,所有前沿 LLM 在 Zork I 的迷宫中也难以导航。
动态思考与效率
该基准揭示了推理深度与运行效率之间的权衡。虽然使用更多测试时计算资源(生成更多推理 token)的模型通常能获得更高性能,但这种收益在超过一定预算后会减弱。
由于许多探索性步骤(如基本导航)属于中间过程,不需要深度推理,理想的 LLM 代理应能够根据任务复杂度动态调整推理力度,以优化推理成本和延迟。