传递强化学习:通过分治法扩展离策略强化学习

BAIR 已经提出 Transitive RL (TRL),一种新的强化学习算法,它用“分治”范式取代传统的时间差分(TD)学习。这种方法通过对数而非线性地减少 Bellman 递归的次数,使得离策略强化学习能够扩展到复杂的、长 horizon 任务,从而消除了对 n-step 超参数进行调谐的需要。

离策略强化学习的可扩展性挑战

离策略强化学习在数据采集昂贵的领域中至关重要,例如机器人、医疗保健和对话系统,因为它允许使用任何数据,包括旧经验和人类演示。然而,由于当前价值学习范式的局限性,将离策略强化学习扩展到长 horizon 任务一直很困难:

  • 时间差分(TD)学习: 传统的 Q-learning 依赖于自助法(bootstrapping),其中下一个值 $Q(s', a')$ 的误差会传播到当前值 $Q(s, a)$。这些误差在整个 horizon 上累积,阻碍了可扩展性。
  • 蒙特卡罗(MC)回报: 虽然 n 步 TD 学习(TD-n)以常数因子 $n$ 减少了 Bellman 递归次数,但它并未根本解决误差累积问题。增加 $n$ 以减少偏差往往会导致高方差和次优,需要为每个任务仔细调谐。

分治范式

传递强化学习引入了一种第三种范式,将轨迹划分为两个等长段落,并结合它们的值来更新完整轨迹的值。该方法以对数方式减少 Bellman 递归的次数,避免了纯蒙特卡罗方法的高方差以及 n-step TD 的调谐需求。

应用于目标条件强化学习

TRL 专门针对 目标条件强化学习 实现,其目标是学习一种能够从任意状态到达任何其他状态的策略。此设置基于最短路径距离 $d^*(s, g)$ 的三角不等式提供了一种自然结构:

$$d^(s, g) \le d^(s, w) + d^*(w, g)$$

就稀疏奖励的价值函数 $V$ 而言,这转化为一个“传递” Bellman 更新规则:

$$V(s, g) \leftarrow \begin{cases} \gamma^0 & \text{if } s=g \ \gamma^1 & \text{if } (s, g) \in E \ \max_{w \in S} V(s, w)V(w, g) & \text{otherwise} \end{cases}$$

该规则允许使用两个较小的值 $V(s, w)$ 和 $V(w, g)$ 来更新 $V(s, g)$ 的值,其中 $w$ 是一个最优中点或子目标。

TRL 的实际实现

为了使分治价值学习在具有大状态空间的连续环境中变得实用,TRL 采用了两个关键的技术方案来解决寻找最优子目标 $w$ 的问题:

  1. 受限搜索空间: 而不是搜索整个状态空间,TRL 将 $w$ 的搜索限制在数据集轨迹中位于 $s$ 和 $g$ 之间出现的状态。
  2. 期望回归: 为了防止通常由 $\max$ 算子导致的价值过估计,TRL 通过期望回归使用“软” argmax。算法最小化以下损失:

$$\mathbb{E}[\ell_{2\kappa}(V(s_i, s_j) - \bar{V}(s_i, s_k)\bar{V}(s_k, s_j))]$$

其中 $\bar{V}$ 是目标价值网络,$\ell_{2\kappa}$ 是期望为 $\kappa$ 的期望损失,在采样的轨迹中所有满足 $i \le k \le j$ 的元组 $(s_i, s_k, s_j)$ 上计算。

性能与基准

TRL 在 OGBench 基准上进行了离线目标条件强化学习的评估,特别关注 humanoidmazepuzzle 任务的最难版本,这些任务涉及 1B 规模的数据集以及最多达 3,000 环境步骤 的 horizon。

  • 超过基线的优越性: TRL 在大多数任务的 TD、MC 和准度量学习类别中优于强基线。
  • 消除超参数调谐: TRL 在所有任务上匹配了最佳单独调谐的 n 步 TD 学习(TD-n)的性能,而无需用户指定 $n$ 的值。

未来方向

虽然 TRL 目前假设动态是确定的,但 BAIR 确定了几条未来发展的路径:

  • 泛化: 将 TRL 扩展到目标条件设置之外的常规基于奖励的强化学习任务。
  • 随机性: 调整算法以处理随机环境和部分可观测性,可能使用“随机”三角不等式。
  • 优化: 改进子目标候选选择,超越同一轨迹,并进一步稳定训练。

Sources