Ma-Zhuang/OmniNWM
[ECCV 2026] OmniNWM: Omniscient Navigation World Models for Autonomous Driving
📚 什么是 OmniNWM?
OmniNWM(Omniscient Driving Navigation World Models)是一个研究级代码库,用于构建用于自动驾驶仿真的全景世界模型。该模型能够从车辆的规划轨迹中,生成全部六个周围摄像头的完整传感器输出——RGB图像、语义地图、深度图和3D占用网格。由于生成的世界是密集的且多模态的,它既可以用于渲染逼真的驾驶视频,也可以作为闭环环境用于训练或评估驾驶策略。
🎯 核心思想
| 思想 | 含义 |
|---|---|
| 多模态生成 | 单个神经网络预测360°全景的RGB、语义、深度和3D占用。 |
| 归一化Plücker射线图 | 一种几何表示,使模型能够将像素级预测精确转换为车辆动作。 |
| 自回归稳定性 | 一种“强制”策略,使模型在生成长度超过真实视频时仍能保持稳定,不漂移。 |
| 基于占用的密集奖励 | 预测的占用网格可转化为奖励信号,实现真实的闭环策略评估。 |
| 零样本迁移 | 相同检查点可在其他驾驶数据集(如nuPlan)和不同相机配置上使用,无需额外微调。 |
🛠️ 快速入门
- 克隆与设置
git clone https://github.com/Ma-Zhuang/OmniNWM.git && cd OmniNWM mkdir -p pretrained data pip install -e . pip install "huggingface_hub[cli]" - 修补
transformers– 按说明编辑modeling_utils.py(将torch版本检查从2.3改为2.5)。 - 下载检查点
huggingface-cli download Arlolo0/OmniNWM --local-dir ./pretrained huggingface-cli download hpcai-tech/Open-Sora-v2 --local-dir ./pretrained - 准备数据 – 从README中提供的链接下载nuScenes v1.0的train/val分割数据,以及12 Hz的深度/分割标注。遵循仓库中所示的目录结构(例如,
data/nuscenes/CAM_FRONT、data/nuscenes_12hz_depth_unzip等)。
🚀 典型工作流
| 任务 | 命令 | 说明 |
|---|---|---|
| 推理 – 轨迹到视频 | torchrun --nproc-per-node 8 tools/inference.py configs/inference/infer.py |
为所有六个摄像头生成33帧视频(448×800)。 |
| 分布外(nuPlan)推理 | torchrun --nproc-per-node 8 tools/inference.py configs/inference/infer_nuplan.py |
在nuPlan数据集上使用手动提供的轨迹。 |
| 闭环VLA测试 | torchrun --nproc-per-node 8 tools/inference.py configs/inference/infer_with_occ_vla.py |
运行一个循环,模型的占用预测作为奖励反馈(321帧)。 |
| 训练 – 分阶段 | bash dist_train_mlp.sh configs/train/stage_1.py(然后阶段2、阶段3) |
阶段逐步提高分辨率和视频长度,以保持训练稳定。 |
📦 仓库内容
omninwm/models/OmniNWM-VLA– Tri-MMi三模态融合和VLA(视觉-语言-动作)流水线的实现。configs/– 推理和三个训练阶段的即用型YAML/py配置文件。tools/– 分布式推理脚本(inference.py)。pretrained/– 下载的检查点(VAE、占用模型、Open-Sora-v2权重)的占位符。data/– nuScenes图像、深度图和分割掩码的预期目录结构。
📖 引用
如果在研究中使用OmniNWM,请引用arXiv论文:
@article{li2025omninwm,
title={OmniNWM: Omniscient Driving Navigation World Models},
author={Li, Bohan and Ma, Zhuang and Du, Dalong and Peng, Baorui and Liang, Zhujin and Liu, Zhenqiang and Ma, Chao and Jin, Yueming and Zhao, Hao and Zeng, Wenjun and others},
journal={arXiv preprint arXiv:2510.18313},
year={2025}
}
⚖️ 许可证
Apache License 2.0(见 LICENSE)。
简而言之:OmniNWM是一种前沿的世界模型,能将驾驶计划转化为高保真、多传感器仿真,既支持逼真的视频合成,也支持自动驾驶研究的闭环策略测试。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch