Stanford CS329A: AI Agent 中的规划与多步推理

概述

AI Agent 中的多步推理需要将推理(规划要做什么)、行动(通过工具或搜索执行步骤)和搜索(根据反馈优化轨迹)进行凝聚式集成。核心挑战在于超越简单的顺序生成,鼓励模型在寻找正确解决方案的过程中实现多样化、探索性和高效性。

Language Agent Tree Search (LATS)

LATS 通过将 Monte Carlo Tree Search (MCTS) 应用于语言模型轨迹,统一了推理、行动和规划。它将线性的思维链过程转化为基于树的搜索,以优化通往最终答案的路径。

LATS 框架

LATS 通过六个不同的阶段运行:

  1. Selection(选择):使用应用于树的置信上限算法 (UCT) 选择一个节点进行扩展,以平衡对新路径的探索与对已知高价值路径的利用。
  2. Expansion(扩展):模型从选定的节点采样多个潜在动作。
  3. Evaluation(评估):每个生成的决策状态通过 LLM-as-a-Judge(提示模型给出 0-1 分数)和 self-consistency score(特定动作被采样的频率)的加权平均值进行评分。
  4. Simulation(模拟):模型贪婪地扩展得分最高的决策状态,直到达到终止状态(成功或失败)或达到计算预算。
  5. Backpropagation(反向传播):轨迹的结果被用于更新通往该结果的所有状态的价值。
  6. Reflection(反思):模型分析轨迹以确定成功或失败的原因,然后将其附加到上下文中以改进未来的搜索。

性能与权衡

LATS 在 HotPotQA(多跳推理)和 WebShop(实际电子商务任务)上展示了强大的结果,在无需微调的情况下达到了接近人类专家的性能。然而,由于树的重复扩展和反向传播,该方法引入了显著的推理成本。此外,LATS 目前无法处理不可逆的动作(例如,金融交易),在这些场景下,试错搜索是不可手行的。

SPRINT: 并行化推理轨迹

SPRINT 解决了前沿模型(如 DeepSeek-R1 或 Gemini)中顺序“思考”效率低下的问题,在这些模型中,较长的推理链通常与更高的准确率相关,但会增加延迟和成本。

并行规划与执行

SPRINT 基于这样一个观察:许多推理步骤是相互独立的,可以并行执行。该框架使用一种后训练/微调方法,教导模型同时担任 planner(规划者)和 executor(执行者):

  • Data Creation(数据创建):来自 DeepSeek-R1 等模型的推理轨迹通过 GPT-4o 进行标注,以识别规划步骤和执行步骤。然后,这些步骤被组织成有向无环图 (DAG) 以识别哪些步骤可以并发运行。
  • Fine-tuning(微调):模型在这些重新格式化的轨迹上进行监督微调 (SFT),教导它为并行计划(例如,“Plan 1” 和 “Plan 2”)及其对应的执行输出特定标签。
  • Inference(推理):在测试时,模型生成多个独立的计划;这些计划随后被并行执行(例如,通过多个 Python 工具调用),并在模型进入下一个规划阶段之前,将结果同步回上下文中。

关键发现

  • Efficiency(效率):SPRINT 显著减少了达到答案所需的顺序 token 数量,在某些任务上将顺序 token 计数减少了约 40%。
  • Accuracy(准确率):与仅追求效率的目标相反,结构化的并行思考过程实际上提高了在 MATH, Countdown, 和 GPQA Diamond 等基准测试上的准确率。
  • Generalization(泛化性):在 MATH 数据上训练的模型将其并行思考能力泛化到了领域外任务,无需进一步训练。

SWiRL: 合成多步强化学习

SWiRL 专注于教导模型使用工具并进行跨多步推理,而无需在强化学习 (RL) 过程中实时执行工具所带来的开销和不稳定性。

SWiRL 方法论

SWiRL 将数据收集与模型优化分离:

  1. Offline Synthetic Generation(离线合成生成):模型迭代地生成多步轨迹(推理 $\rightarrow$ 工具调用 $\rightarrow$ 环境响应)。
  2. Process Labeling(过程标注):LLM-as-a-Judge 为每个单独的步骤分配奖励,其依据是所提议的动作/查询的质量,而无需考虑工具的实际输出。
  3. Multi-Step RL(多步强化学习):使用 RL 训练模型,以优化在给定先前上下文的情况下执行单个动作的预期奖励。至关重要的是,训练期间并不执行工具;模型仅仅因为基于预先收集的离线数据提出了一个“好”的动作而获得奖励。

数据过滤与泛化

  • Process vs. Outcome Filtering(过程与结果过滤):研究人员发现,process-filtered data(保留被 LLM 判定为“好”的步骤)在训练方面比 outcome-filtered data(仅保留具有正确最终答案的轨迹)更有效。这表明,学习正确的中间推理过程比单纯模仿正确的最终结果更有价值。
  • Cross-Domain Transfer(跨领域迁移):SWiRL 展示了卓越的泛化能力。在 GSM8K(使用计算器工具)上训练的模型,其在 HotPotQA(使用搜索工具)上的表现有所提升,并在反之亦然。这表明模型正在学习多步工具调用和推理的通用元技能,而非仅仅学习特定工具的 API。
  • RL vs. SFT:多步强化学习 (RL) 显著优于监督微调 (SFT),因为 RL 允许模型从模仿数据中存在的错误轨迹中探索并脱离出来。

Sources