OpenEnvision/WorldFoundry

Unified World Model Inference & Evaluation Infrastructure

何が解決されるか

WorldFoundry は、ワールドモデルの開発、実行、および評価のための統一インフラストラクチャを提供します。ビデオ生成、3D/4D表現、および具身AIアクションポリシーなどの異なるモダリティ間で、分散された環境、アセットステージング、およびベンチマークレイアウトを管理する摩擦を解消します。

どのように機能するか

このプロジェクトは、モデルアーキテクチャと推論アダプターを実際のチェックポイントとデータセットから分離する共有スタックを実装します。Conda を介した統一GPU環境を使用して複数のモデルを処理しながら、以下のいくつかのインターフェースを提供します:

  • TUI/CLI:モデルとベンチマークのインタラクティブピッカーで、実行可能なコマンドを生成します。
  • Studio:推論ジョブの管理とアーティファクトのレビューを行うブラウザベースのUI。
  • 評価ランナー:モデル-ベンチマークペアを実行し、標準化されたスコアカードを生成するシステム。
  • ツリー内ランタイム:統合された合成とパイプラインモジュールで、さまざまな統合モデル間で一貫した推論パスを可能にします。

誰のために設計されているか

ワールドモデル、ビデオ生成、および具身知能に取り組む研究者および開発者向けに設計されています。他のモデルとベンチマークを比較するための標準的な推論実行方法が必要な方に適しています。

ハイライト

  • 広範なモデルズー:Wan、HunyuanVideo、LTX2、Cosmos、およびさまざまなVLA/アクションポリシー(例えば、OpenVLA、Octo)を含む幅広いモデルを統合。
  • 統一バックエンド:FlashAttention 2/3、SageAttention、xFormersなどの高度な注意バックエンドおよびNVFP4量化をサポート。
  • 柔軟なアセット管理:ネイティブなHugging Face Hubローディングおよびローカルチェックポイントステージングをサポート。
  • ベンチマークハブ:LaryBenchおよびWorldReasonBenchなどのベンチマークのためのマニフェストカタログと公式ランナー制約を含む。
  • マルチGPUサポート:コンテキスト/シーケンスパラレルismと高度なメモリ管理を特徴とし、A100、H100などの高計算ハードウェア向け。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト