Agora-1: 开创多智能体世界模型

“世界模型”的概念长期以来一直是 AI 研究的基石,为智能体提供了模拟环境并预测未来状态的方法。然而,直到现在,大多数世界模型都局限于单个活跃参与者。Odyssey 团队发布的 Agora-1 标志着一个重大转变,它引入了首个多智能体世界模型,能够支持多个用户或 AI 智能体在同一个模拟环境中进行实时交互。

通过使用经典游戏 GoldenEye 作为测试场,Odyssey 展示了世界模型可以作为一个学习到的游戏引擎,在参与者之间维持共享状态,并同时向每个玩家流式传输生成的像素。这一进步为机器人技术、国防、教育以及基础模型的开发开辟了新的大门。

架构:将模拟与渲染解耦

为了给多个玩家实现一致的共享体验,Agora-1 采用了不同于以往的方法。早期的模型如 Multiverse 和 Solaris 试图通过拼接智能体状态或序列来处理多智能体交互,但这些方法在扩展性和一致性方面往往面临困难——特别是在玩家失去彼此视线时。

Agora-1 通过将模拟动力学与视觉渲染解耦来解决这一问题。该系统学习两个不同的函数:

  1. 学习共享世界状态: 模型在游戏的内部状态(例如 GoldenEye)上进行训练,学习世界状态如何响应玩家动作而演变。这包括追踪健康值、位置和其他关键的游戏玩法变量。
  2. 学习视觉渲染: 一个基于 Diffusion Transformer (DiT) 的世界模型以共享的游戏状态为条件来渲染视觉输出。与依赖提示词或图像的传统模型不同,Agora-1 直接根据学习到的状态进行渲染。

这种分离类似于现代游戏引擎,但有一个关键区别:模拟和渲染都是完全学习到的系统。没有硬编码的规则;模型直接从数据中学习世界的“物理”和“视觉”。

向基础世界模型扩展

Odyssey 将 Agora-1 视为迈向更通用的基础世界模型的垫脚石。通过扩展内部状态表示,该团队相信他们可以创建在不同规则和环境之间具有泛化能力的模拟,最终根据用户交互生成全新的体验。

多智能体强化学习 (MARL)

Agora-1 最具前景的应用之一是在强化学习领域。传统的世界模型将智能体的训练限制在单参与者场景中。Agora-1 移除了这一限制,允许交互空间的组合式增长。这使得智能体能够体验并从复杂的涌现行为中学习——例如协调动作和争夺目标——这些行为在被动数据集中很少被捕捉到。

想象中的多智能体训练

除了仅仅模拟现有游戏,Agora-1 还可以作为一个生成式模拟器。完全在这些“想象”的世界中训练出的策略,最终可能在从未接触过游戏或模拟器的原始源代码的情况下,泛化到未见的环境或伙伴。

批判性视角与挑战

虽然技术成就显著,但社区也针对这些模型的实际应用和局限性提出了几个重要观点。

“游戏引擎”之争

一些批评者认为,使用 GenAI 作为游戏引擎的替代品是低效的。正如一位用户所指出的,使用生成式 AI 来创建插件到传统引擎中的脚本和资产,可能比依赖模型来处理实际的引擎逻辑更具实用性,并引用了 Agora-1 演示中输入响应性较差的问题。

泛化到现实世界

从学习游戏引擎的内部状态到将该知识应用于现实世界的机器人技术之间存在着巨大的鸿沟。正如社区成员所指出的,人类学习环境交互非常高效,因为他们与物理世界交互,而 Agora-1 目前运行在一个相对静态的环境中,其中的交互是预先由游戏开发者定义的。

“为了将模型转移到现实生活中的机器人技术,需要学习内部世界状态,因为在训练过程中你无法查询游戏引擎的内部状态。”

伦理与安全担忧

这些模型被应用于军事背景的可能性也被强调了。在战斗视频上训练模型并将其部署在现实场景中,这会引发关于战争自动化和模拟技术“噩梦般”应用的伦理担忧。

超越游戏

尽管存在批评,Agora-1 的架构具有远超于复古游戏的影响。例如,在协作机器人技术中,多个机器人必须共同推理关于共享空间和交互。一个学习到的多智能体世界模型可以为机器人提供必要的框架,使其在比传统、硬编码的模拟更有效地在共享物理环境中协调其动作。通过将 Agora-1 与 PROWL 等框架结合使用——该框架使用对抗性策略来揭示世界模型的失败——Odyssey 正在为在开放式、模拟世界中训练高级智能构建基础。

Sources