Ma-Zhuang/OmniNWM

[ECCV 2026] OmniNWM: Omniscient Navigation World Models for Autonomous Driving

📚 什么是 OmniNWM

OmniNWM(Omniscient Driving Navigation World Models)是一个研究级代码库,用于构建用于自动驾驶仿真的全景世界模型。该模型能够从车辆的规划轨迹中,生成全部六个周围摄像头的完整传感器输出——RGB图像、语义地图、深度图和3D占用网格。由于生成的世界是密集的多模态的,它既可以用于渲染逼真的驾驶视频,也可以作为闭环环境用于训练或评估驾驶策略。


🎯 核心思想

思想 含义
多模态生成 单个神经网络预测360°全景的RGB、语义、深度和3D占用。
归一化Plücker射线图 一种几何表示,使模型能够将像素级预测精确转换为车辆动作。
自回归稳定性 一种“强制”策略,使模型在生成长度超过真实视频时仍能保持稳定,不漂移。
基于占用的密集奖励 预测的占用网格可转化为奖励信号,实现真实的闭环策略评估。
零样本迁移 相同检查点可在其他驾驶数据集(如nuPlan)和不同相机配置上使用,无需额外微调。

🛠️ 快速入门

  1. 克隆与设置
    git clone https://github.com/Ma-Zhuang/OmniNWM.git && cd OmniNWM
    mkdir -p pretrained data
    pip install -e .
    pip install "huggingface_hub[cli]"
    
  2. 修补 transformers – 按说明编辑 modeling_utils.py(将torch版本检查从 2.3 改为 2.5)。
  3. 下载检查点
    huggingface-cli download Arlolo0/OmniNWM --local-dir ./pretrained
    huggingface-cli download hpcai-tech/Open-Sora-v2 --local-dir ./pretrained
    
  4. 准备数据 – 从README中提供的链接下载nuScenes v1.0的train/val分割数据,以及12 Hz的深度/分割标注。遵循仓库中所示的目录结构(例如,data/nuscenes/CAM_FRONTdata/nuscenes_12hz_depth_unzip等)。

🚀 典型工作流

任务 命令 说明
推理 – 轨迹到视频 torchrun --nproc-per-node 8 tools/inference.py configs/inference/infer.py 为所有六个摄像头生成33帧视频(448×800)。
分布外(nuPlan)推理 torchrun --nproc-per-node 8 tools/inference.py configs/inference/infer_nuplan.py 在nuPlan数据集上使用手动提供的轨迹。
闭环VLA测试 torchrun --nproc-per-node 8 tools/inference.py configs/inference/infer_with_occ_vla.py 运行一个循环,模型的占用预测作为奖励反馈(321帧)。
训练 – 分阶段 bash dist_train_mlp.sh configs/train/stage_1.py(然后阶段2、阶段3) 阶段逐步提高分辨率和视频长度,以保持训练稳定。

📦 仓库内容

  • omninwm/models/OmniNWM-VLA – Tri-MMi三模态融合和VLA(视觉-语言-动作)流水线的实现。
  • configs/ – 推理和三个训练阶段的即用型YAML/py配置文件。
  • tools/ – 分布式推理脚本(inference.py)。
  • pretrained/ – 下载的检查点(VAE、占用模型、Open-Sora-v2权重)的占位符。
  • data/ – nuScenes图像、深度图和分割掩码的预期目录结构。

📖 引用

如果在研究中使用OmniNWM,请引用arXiv论文:

@article{li2025omninwm,
  title={OmniNWM: Omniscient Driving Navigation World Models},
  author={Li, Bohan and Ma, Zhuang and Du, Dalong and Peng, Baorui and Liang, Zhujin and Liu, Zhenqiang and Ma, Chao and Jin, Yueming and Zhao, Hao and Zeng, Wenjun and others},
  journal={arXiv preprint arXiv:2510.18313},
  year={2025}
}

⚖️ 许可证

Apache License 2.0(见 LICENSE)。


简而言之:OmniNWM是一种前沿的世界模型,能将驾驶计划转化为高保真、多传感器仿真,既支持逼真的视频合成,也支持自动驾驶研究的闭环策略测试。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch