GRASP:面向更长视野的世界模型梯度规划

BAIR 已经推出了 GRASP(Gradient RelAxed Stochastic Planner),这是一种新的基于梯度的规划器,旨在使在学习到的世界模型上进行长视野规划变得实用。GRASP 通过将轨迹提升到虚拟状态以实现并行优化、在状态迭代中注入随机性以进行探索,并将梯度重新塑形为依赖于稳定的动作雅可比矩阵而非脆弱的状态输入梯度,从而解决了长时规划的脆弱性。

世界模型中长视野规划的挑战

虽然大型世界模型可以充当通用模拟器,但将它们用于控制和规划往往很脆弱。长视野规划通常因以下三个主要因素而失败:

  • 条件不良的计算图: 对模型进行反复自我应用(时间反向传播)进行求导会导致梯度爆炸或消失。雅可比矩阵的条件数随时间视野 $T$ 指数级增长。
  • 非贪婪的景观: 长期任务常常需要非贪婪行为(例如,为了绕过障碍而先远离目标)。随着视野的增长,优化空间扩大,陷入局部最小值的可能性增加。
  • 状态输入梯度的敏感性: 在基于深度学习的世界模型中,对状态输入的梯度 ($D_s F_\theta$) 往往不可靠。由于世界模型在低维数据流形上进行训练,它们容易受到“对抗性”示例的影响——对状态的微小扰动就能欺骗模型预测出期望的结果,使得优化景观变得“黏滞”且不可靠。

GRASP 的技术方法

GRASP 通过将配点(collocation)规划与特定的梯度重塑和探索策略相结合,克服了上述失败。

1. 提升动力学约束(配点)

与串行展开 $s_{t+1} = F_\theta(s_t, a_t)$ 不同,GRASP 将动力学视为软约束。它同时对动作和状态进行惩罚函数的优化:

$$\min_{\mathbf{s},\mathbf{a}} \mathcal{L}(\mathbf{s}, \mathbf{a}) = \sum_{t=0}^{T-1} \big|F_\theta(s_t,a_t) - s_{t+1}\big|_2^2, \quad \text{with } s_0 \text{ fixed and } s_T=g$$

这种“提升”形式带来了两个主要改进:所有 $T$ 项可以在时间维度上并行计算,且梯度信号不再需要通过深度 $T$ 步的组合进行反向传播。

2. 通过停止梯度进行梯度重塑

为避免状态雅可比的对抗性敏感性,GRASP 确保优化仅依赖于动作雅可比 ($D_a F_\theta$),后者通常维度更低且训练更密集。

GRASP 实现了 停止梯度动力学损失,即阻断梯度流向世界模型的状态输入。为防止系统坍缩到平凡的最小值,GRASP 添加了 密集目标塑形 项:

$$\mathcal{L}(\mathbf{s},\mathbf{a}) = \mathcal{L}{\text{dyn}}^{\text{sg}}(\mathbf{s},\mathbf{a}) + \gamma \mathcal{L}{\text{goal}}^{\text{sg}}(\mathbf{s},\mathbf{a})$$

该目标在可行的动力学约束与指向目标的一致信号之间取得平衡,而不依赖脆弱的状态梯度。

3. 用于探索的状态迭代随机性

为在长视野规划的非凸景观中导航,GRASP 在优化过程中直接向虚拟状态更新注入高斯噪声:

$$s_t \leftarrow s_t - \eta_s \nabla_{s_t}\mathcal{L} + \sigma_{\text{state}} \xi, \qquad \xi\sim\mathcal{N}(0,I)$$

通过对状态而非动作加噪,规划器能够在提升空间的不同基底之间“跳跃”,同时保持对动作的引导更新。

4. 周期性同步

由于提升的停止梯度目标是近似的,GRASP 每隔 $K_{\text{sync}}$ 次迭代会执行一次“同步”阶段。它使用当前动作从 $s_0$ 展开,并在原始串行损失上进行少量小梯度步,以确保计划仍然基于真实轨迹。

性能与结果

GRASP 在 Push‑T 环境中相较于基线规划器(如交叉熵方法(CEM)和标准梯度下降(GD))展示了显著的成功率提升和计算速度加快。随着视野 $H$ 的增大,GRASP 能保持更高的成功率和更低的中位成功时间。

Horizon CEM GD LatCo GRASP
H=40 61.4% / 35.3s 51.0% / 18.0s 15.0% / 598.0s 59.0% / 8.5s
H=50 30.2% / 96.2s 37.6% / 76.3s 4.2% / 1114.7s 43.4% / 15.2s
H=60 7.2% / 83.1s 16.4% / 146.5s 26.2% / 49.1s
H=70 7.8% / 156.1s 12.0% / 103.1s 0.0% / — 16.0% / 79.9s
H=80 2.8% / 132.2s 6.4% / 161.3s 0.0% / — 10.4% / 58.9s

(成功率 % / 中位成功时间)

未来方向

研究人员提出了若干扩展 GRASP 的路径,包括将其应用于基于扩散的世界模型、开发更复杂的噪声策略,以及将规划器集成到闭环系统或强化学习策略学习中,以实现自适应的长视野规划。


SUMMARY: BAIR 引入了 GRASP,这是一种基于梯度的规划器,通过将轨迹提升到虚拟状态并将梯度限制在动作上,从而规避对抗性的状态输入敏感性,实现了在学习到的世界模型中稳健的长视野规划。

TITLE: GRASP:面向更长视野的世界模型梯度规划

Sources