OpenAI 视频预训练(VPT)用于 Minecraft
OpenAI 开发了视频预训练(Video PreTraining,VPT),这是一种半监督模仿学习方法,能够让神经网络通过观看未标记的人类视频来学习在环境中的行为。将该方法应用于 Minecraft 后,OpenAI 证明了代理可以获得复杂的、长期的行为——例如合成钻石工具——这些在从零开始的强化学习中以前是无法实现的。
视频预训练(VPT)方法论
为了利用互联网上海量的未标记视频数据,OpenAI 引入了 VPT 流水线。使用网络视频的主要挑战在于缺少玩家实际按键和鼠标移动(动作标签)的记录。
逆向动力学模型(IDM)
OpenAI 通过训练逆向动力学模型(Inverse Dynamics Model,IDM)解决了动作标注问题。其工作流程如下:
- 承包商数据收集:从人类承包商处收集了一小部分数据,记录了视频以及对应的动作标签(按键和鼠标移动)。
- IDM 训练:训练 IDM 以预测视频中每一步所采取的动作。不同于标准的行为克隆,IDM 可以利用过去和未来的帧来猜测动作。
- 大规模标注:训练完成后,使用 IDM 为海量未标记的在线视频打上标签,生成合成的动作标注数据集。
- 行为克隆:随后在这些 IDM 标注的数据上对基础模型进行行为克隆训练。
VPT 基础模型的零样本能力
VPT 基础模型在 70,000 小时的 IDM 标注在线视频上进行训练。使用原生的人类交互方式(20 Hz 帧率,鼠标和键盘),模型实现了多项“零样本”能力——即在预训练后无需额外微调即可完成这些任务:
- 早期游戏序列:模型能够砍树、合成木板并制作工作台。熟练玩家完成该序列通常需要约 50 秒或 1,000 次连续操作。
- 通用生存技能:模型学会了游泳、捕猎动物获取食物以及进食。
- 高级移动:模型掌握了“柱子跳跃”,即不断跳起并在自身下方放置方块以向上攀升的技巧。
微调与性能扩展
OpenAI 通过行为克隆(BC)和强化学习(RL)测试了 VPT 模型的专精能力。
行为克隆微调
在一个小规模的承包商建造房屋数据集(每个世界 10 分钟游戏时间)上对基础模型进行微调后,模型在早期游戏技能上显著提升,并扩展了能力,包括合成木制和石制工具、在村庄抢夺箱子以及搭建简易庇护所。
数据规模假设
OpenAI 假设,使用承包商数据训练 IDM 的效果优于直接用同样的数据训练行为克隆基础模型。为验证该假设,他们在 1 小时至 70,000 小时的数据规模上训练模型。结果显示,随着基础模型数据量的增加,合成能力整体提升,石制工具的合成仅在最大数据规模时出现。
强化学习(RL)微调
结合 RL 后,VPT 模型成为强大的行为先验。普通从随机初始化开始的 RL 策略几乎只能收集到原木或树枝,而经过 RL 微调的 VPT 模型在 10 分钟的回合中有 2.5% 能成功合成钻石镐。
合成钻石工具通常需要熟练玩家超过 20 分钟(约 24,000 次操作)。这是首次有计算机代理在 Minecraft 中使用原生人类交互方式实现此能力。
对通用计算机使用代理的意义
OpenAI 认为,VPT 为从互联网视频中学习行为先验提供了一条路径,超越了单纯的表征先验。由于 Minecraft 是开放式的,并使用通用的鼠标键盘交互,OpenAI 暗示这些结果表明有望发展出能够以类似人类方式使用计算机的通用代理。
SUMMARY: OpenAI 引入了视频预训练(VPT),一种半监督模仿学习方法,使代理能够通过在大规模未标记的人类游戏视频上训练,在 Minecraft 中学习复杂行为。
TITLE: OpenAI 视频预训练(VPT)用于 Minecraft