OpenEnvision/WorldFoundry

Unified World Model Inference & Evaluation Infrastructure

它解决了什么问题

WorldFoundry 提供了一个统一的基础设施,用于开发、运行和评估世界模型。它消除了在不同模态(如视频生成、3D/4D 表示和具身 AI 行动策略)之间管理分散环境、资产暂存和基准布局的摩擦。

它是如何工作的

该项目实现了一个共享堆栈,将模型架构和推理适配器与实际的检查点和数据集分离。它使用统一的 GPU 环境(通过 Conda)来处理多个模型,同时提供多种交互界面:

  • TUI/CLI:一个交互式选择器,用于选择模型和基准,并生成可运行的命令。
  • Studio:一个基于浏览器的 UI,用于管理推理作业和审查工件。
  • 评估运行器:一个系统,用于运行模型-基准配对并生成标准化的评分卡。
  • 树内运行时:集成的合成和管线模块,允许在各种集成模型之间保持一致的推理路径。

它适合谁使用

它专为研究人员和开发者设计,他们正在从事世界模型、视频生成和具身智能的工作,需要一种标准化的方式来运行推理并将其模型与他人的模型进行基准比较。

亮点

  • 广泛的模型动物园:整合了广泛的模型,包括 Wan、HunyuanVideo、LTX2、Cosmos,以及各种 VLA/动作策略(例如 OpenVLA、Octo)。
  • 统一后端:支持高级注意力后端(FlashAttention 2/3、SageAttention、xFormers)和 NVFP4 量化。
  • 灵活的资产管理:支持原生 Hugging Face Hub 加载以及本地检查点暂存。
  • 基准中心:包含一个清单和官方运行器限制,用于基准如 LaryBench 和 WorldReasonBench。
  • 多 GPU 支持:具有上下文/序列并行性和高级内存管理,适用于高计算硬件(A100、H100)。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目