全能型(JAT)多用途变压器代理
Hugging Face 宣布了全能型(JAT),这是一个通用代理项目,旨在使用单一网络执行多种视觉与语言以及决策任务。该项目作为 Gato 架构的公开复现,提供了完整的专家强化学习代理集合、专门的训练数据集以及多模态 Transformer 模型。
JAT 数据集与专家策略
JAT 项目提供了首个专为通用代理训练设计的数据集,包含数十万条专家轨迹。这些轨迹是通过在多个多样化环境中训练最先进的专家代理生成的,包括:
- Atari:经典街机游戏。
- BabyAI:简单的导航环境(使用 BabyAI 机器人)。
- Meta-World:机器人操作任务。
- MuJoCo:基于物理的连续控制。
为了实现统一的用户界面,JAT 数据集还整合了来自 Wikipedia、Oscar、OK-VQA 和 Conceptual-Captions 的文本数据。
JAT 代理架构
JAT 基于 EleutherAI 的 GPT-Neo 实现构建。该架构旨在通过交错观察嵌入、动作嵌入和相应奖励来处理序列决策任务。
嵌入与编码机制
JAT 根据数据模态使用不同的编码策略:
- 图像(例如 Atari):通过卷积神经网络(CNN)处理。
- 连续向量:通过线性层处理。
- 离散值:通过线性投影层处理。
- 文本:使用 GPT-2 策略进行分词。
- 通用图像:使用 ViT 类型编码器处理。
预测与损失函数
模型使用因果掩码自回归地预测下一个嵌入,通过将观察向前移动一个时间步,使得代理必须基于先前的观察和动作预测下一个动作。损失针对每种模态分别计算:
- MSE 损失:用于图像和连续值。
- 交叉熵损失:用于离散值。
最终损失是序列中每个元素损失的平均值。
性能结果
JAT 在 157 项训练任务中进行评估,在四个主要领域中相对于专家代理的平均表现为 65.8%。
各领域性能
- BabyAI:达到专家分数的 99.0%,仅在一个任务上未能超过专家的 50%。
- MuJoCo:达到专家分数的 84.8%。
- Meta-World:达到专家分数的 65.5%。
- Atari 57:达到专家分数的 14.1%(相当于人类表现的 37.6%),在 21 款游戏中超越人类表现。
虽然模型在自然语言处理和计算机视觉任务上表现出基础能力,但其主要优势在于能够使用单一网络在这些多样的强化学习领域中模拟专家表现。
观察预测的影响
JAT 项目期间的研究探讨了让代理预测未来观察(除最大化奖励外)是否能提升学习。通过使用加权参数 $\kappa$ 平衡观察损失和动作损失,团队发现 $\kappa = 0.005$ 时存在“最佳点”。
在该特定权重下,学习预测观察提升了代理的学习效率。然而,当 $\kappa$ 过高(例如 0.5)时,预测观察的目标会阻碍学习过程。这表明,如果平衡得当,辅助目标对通用代理是有益的。
未来研究方向
为进一步发展 JAT 代理,Hugging Face 确定了三个主要改进方向:
- 数据质量:通过收集更多来自更广泛专家代理的轨迹来扩展数据集,以降低偏差。
- 离线强化学习:超越基本的行为克隆,使代理能够利用次优轨迹并有可能超越专家。
- 采样策略:实现动态的多任务采样策略,以关注更具挑战性的任务,而非均匀采样。