SIMA 2: 一个在虚拟 3D 世界中与你一起玩耍、推理和学习的代理
SIMA 2 从指令跟随发展到交互式推理
Google DeepMind 推出了 SIMA 2,这是一个通用型 AI 代理,集成了 Gemini 模型,使其从基本的指令跟随者过渡到互动游戏伙伴。与其前身不同,SIMA 2 能够围绕高级目标进行推理,与用户对话以描述其预期的行为,并通过自主游戏随时间提升自身性能。
将 Gemini 集成用于高级推理
SIMA 2 将 Gemini 模型作为其核心架构,使其能够超越原始 SIMA 的 600 项语言跟随技能。此集成使代理能够在复杂的 3D 环境中使用虚拟键盘和鼠标感知、理解并执行面向目标的行为,而无需访问底层游戏机制。
推理方面的关键技术进步包括:
- 目标导向执行:代理能够理解用户的高级目标,并执行实现这些目标所需的复杂推理。
- 透明沟通:SIMA 2 在人类演示视频和 Gemini 生成的标签混合数据上进行训练,能够详细说明其完成任务所采取的具体步骤。
- 协作交互:交互模式已从简单的命令-响应转变为代理与用户共同协作的伙伴关系,代理在此过程中会与用户一起对任务进行推理。
在未见环境中的泛化
与第一版相比,SIMA 2 展示了显著提升的泛化能力和可靠性,在广泛的任务中表现得更接近人类水平。它能够在不同游戏之间迁移所学概念——例如,将一种游戏中的“开采”概念应用到另一种游戏中的“收获”。
代理的泛化能力包括:
- 复杂任务处理:能够理解并完成长而细致的指令。
- 多模态理解:支持多模态提示、不同语言和表情符号。
- 零样本适应性:SIMA 2 能够在未经过训练的游戏中运行,例如维京生存游戏 ASKA 和研究实现 MineDojo(Minecraft)。
- 合成世界适应:当与 Genie 3 配对时——Genie 3 是一种能够从文本或图像生成实时 3D 模拟世界的模型——SIMA 2 能够在其从未遇到的全新想象环境中定位自己并采取有意义的行动。
可扩展的自我改进循环
SIMA 2 引入了多任务自我改进的能力,使代理能够在无需额外人类生成数据的情况下在新世界中发展技能。这是通过迭代改进的良性循环实现的:
- 初始指导:Gemini 为代理的行为提供一个初始任务和一个估计奖励。
- 经验银行:此信息被存储在自生成经验的银行中。
- 迭代训练:代理利用此经验训练后续世代,使其能够在无需人类干预的情况下克服先前失败的任务。
此过程已扩展到新创建的 Genie 环境,标志着在多样化生成世界中训练通用代理的一个里程碑。
当前局限性与未来方向
尽管取得了进展,SIMA 2 仍然是一个研究项目,面临几个未解决的挑战:
- 长期任务:代理仍然在需要大量多步推理和目标验证的非常复杂的任务上挣扎。
- 内存限制:为了保持低延迟交互,SIMA 2 使用有限的上下文窗口,导致交互记忆相对较短。
- 低级控制:实现对复杂 3D 场景的稳健视觉理解以及通过键盘和鼠标执行精确的低级操作仍然具有挑战性。
对通用具身智能的启示
SIMA 2 为通往通用型、面向行动的 AI 的道路提供了验证。通过将多样化的多世界数据与 Gemini 的推理能力相结合,Google DeepMind 旨在为未来的物理世界 AI 助手创建一个基本构建块。在虚拟环境中学习的技能——导航、工具使用和协作执行——被视为机器人中智能物理具身化的重要前体。
SIMA 2 目前仅作为有限的研究预览版提供给少数学者和游戏开发者。