OpenEnvision/WorldFoundry
Unified World Model Inference & Evaluation Infrastructure
它解決了什麼問題
WorldFoundry 提供了一個統一的基礎設施,用於開發、運行和評估世界模型。它消除了在不同模態(如影片生成、3D/4D 表示和具身 AI 行動策略)之間管理分散環境、資產暫存和基準佈局的摩擦。
它是如何運作的
該專案實現了一個共享堆疊,將模型架構和推論適配器與實際的檢查點和資料集分離。它使用統一的 GPU 環境(透過 Conda)來處理多個模型,同時提供多種互動介面:
- TUI/CLI:一個互動式選擇器,用於選擇模型和基準,並生成可執行的命令。
- Studio:一個基於瀏覽器的 UI,用於管理推論工作和審查工件。
- 評估運行器:一個系統,用於運行模型-基準配對並產生標準化的評分卡。
- 樹內運行時:整合的合成和管線模組,允許在各種整合模型之間保持一致的推論路徑。
它適合誰使用
它專為研究人員和開發者設計,他們正在從事世界模型、影片生成和具身智能的工作,需要一種標準化的方式來運行推論並將其模型與他人的模型進行基準比較。
特色
- 廣泛的模型動物園:整合了廣泛的模型,包括 Wan、HunyuanVideo、LTX2、Cosmos,以及各種 VLA/動作策略(例如 OpenVLA、Octo)。
- 統一後端:支援進階注意力後端(FlashAttention 2/3、SageAttention、xFormers)和 NVFP4 量化。
- 彈性資產管理:支援原生 Hugging Face Hub 載入,以及本地檢查點暫存。
- 基準中心:包含一個清單和官方運行器限制,用於基準如 LaryBench 和 WorldReasonBench。
- 多 GPU 支援:具備內容/序列並行性和進階記憶體管理,適用於高運算硬體(A100、H100)。
相關
- 專案
- 專案
- 專案
- 專案
- 專案