GRASP:針對較長視野的世界模型之梯度規劃
BAIR 已推出 GRASP(Gradient RelAxed Stochastic Planner),一種新型的梯度式規劃器,旨在使學習的世界模型在長視野規劃上變得實用。GRASP 透過將軌跡提升至虛擬狀態以進行平行優化、在狀態迭代中注入隨機性以促進探索,並重新塑造梯度,使其依賴穩定的動作雅可比而非脆弱的狀態輸入梯度,從而解決長期規劃的脆弱性。
世界模型中長視野規劃的挑戰
雖然大型世界模型可以作為通用模擬器,但將其用於控制與規劃時常常脆弱。長視野規劃通常因以下三個主要因素失敗:
- 條件不良的計算圖:對模型反覆自身應用(時間反向傳播)進行微分會導致梯度爆炸或消失。雅可比矩陣的條件數隨時間視野 $T$ 指數級增長。
- 非貪婪的景觀:長期任務常需要非貪婪行為(例如,為繞過障礙而暫時遠離目標)。隨著視野增長,優化空間擴大,陷入局部極小值的機率提升。
- 狀態輸入梯度敏感性:在深度學習的世界模型中,對狀態輸入的梯度 ($D_s F_\theta$) 常不可靠。由於世界模型在低維資料流形上訓練,容易受到「對抗」樣本的影響,微小的狀態擾動即可欺騙模型預測期望結果,使得優化景觀變得「黏滯」且不可靠。
GRASP 的技術方法
GRASP 透過結合基於配點的規劃與特定的梯度重塑與探索策略,克服上述失效。
1. 提升動力學約束(Collocation)
與其使用序列展開 $s_{t+1} = F_\theta(s_t, a_t)$,GRASP 將動力學視為軟約束。它同時對動作與狀態優化一個懲罰函數:
$$\min_{\mathbf{s},\mathbf{a}} \mathcal{L}(\mathbf{s}, \mathbf{a}) = \sum_{t=0}^{T-1} \big|F_\theta(s_t,a_t) - s_{t+1}\big|_2^2, \quad \text{with } s_0 \text{ fixed and } s_T=g$$
此「提升」的表述帶來兩大改進:所有 $T$ 個項目可於時間上平行計算,且梯度訊號不再需要透過深度 $T$ 步組合的反向傳播。
2. 透過 Stop-Gradients 重新塑造梯度
為避免狀態雅可比的對抗性敏感性,GRASP 確保優化僅依賴於動作雅可比 ($D_a F_\theta$),其通常維度較低且訓練更密集。
GRASP 實作了 stop-gradient 動力學損失,阻斷梯度流入世界模型的狀態輸入。為防止系統崩潰至平凡極小值,GRASP 加入 密集目標塑形 項:
$$\mathcal{L}(\mathbf{s},\mathbf{a}) = \mathcal{L}{\text{dyn}}^{\text{sg}}(\mathbf{s},\mathbf{a}) + \gamma \mathcal{L}{\text{goal}}^{\text{sg}}(\mathbf{s},\mathbf{a})$$
此目標在可行的動力學與指向目標的穩定訊號之間取得平衡,且不依賴脆弱的狀態梯度。
3. 為探索引入狀態迭代隨機性
為在長視野規劃的非凸景觀中導航,GRASP 直接在優化過程中向虛擬狀態更新注入高斯噪聲:
$$s_t \leftarrow s_t - \eta_s \nabla_{s_t}\mathcal{L} + \sigma_{\text{state}} \xi, \qquad \xi\sim\mathcal{N}(0,I)$$
透過對狀態而非動作加噪,規劃器能在提升空間的不同盆地之間「跳躍」,同時保持受指導的動作更新。
4. 定期同步
由於提升的 stop-gradient 目標是一種近似,GRASP 會每 $K_{\text{sync}}$ 次迭代定期執行一次「同步」階段。它從 $s_0$ 以當前動作展開,並在原始序列損失上進行少量小梯度步驟,以確保計畫仍根植於真實軌跡。
效能與結果
GRASP 在 Push‑T 環境中相較於基線規劃器如交叉熵方法 (CEM) 與標準梯度下降 (GD) 展示了成功率與計算速度的顯著提升。隨著視野 $H$ 增大,GRASP 能維持更高的成功率與更低的中位成功時間。
| 視野 | CEM | GD | LatCo | GRASP |
|---|---|---|---|---|
| H=40 | 61.4% / 35.3s | 51.0% / 18.0s | 15.0% / 598.0s | 59.0% / 8.5s |
| H=50 | 30.2% / 96.2s | 37.6% / 76.3s | 4.2% / 1114.7s | 43.4% / 15.2s |
| H=60 | 7.2% / 83.1s | 16.4% / 146.5s | 26.2% / 49.1s | |
| H=70 | 7.8% / 156.1s | 12.0% / 103.1s | 0.0% / — | 16.0% / 79.9s |
| H=80 | 2.8% / 132.2s | 6.4% / 161.3s | 0.0% / — | 10.4% / 58.9s |
(成功率 % / 中位成功時間)
未來方向
研究人員提出了多條擴展 GRASP 的路徑,包括將其應用於擴散式世界模型、開發更複雜的噪聲策略,以及將規劃器整合至閉環系統或強化學習策略學習,以實現自適應的長視野規劃。