NVIDIA Cosmos Reason 2 发布说明 / 新功能
NVIDIA 已发布 Cosmos Reason 2,这是一款开放推理视觉语言模型(VLM),旨在为机器人和 AI 代理提供在物理世界中规划和行动所需的常识和物理推理能力。该模型目前在 Physical AI Bench 和 Physical Reasoning 排行榜上位列开放模型视觉理解的首位。
技术能力与改进
Cosmos Reason 2 通过提升时空理解和时间戳精度,相较其前代模型有所改进。它被设计用于在边缘和云环境中灵活部署,提供 2B 和 8B 参数规模。
关键技术升级包括:
- 扩展上下文窗口:输入 token 限制已提升至 256K,较 Cosmos Reason 1 支持的 16K token 有显著跃升。
- 增强视觉感知:模型现已支持 2D/3D 点定位、边界框坐标、轨迹数据以及光学字符识别(OCR)。
- 部署灵活性:通过 2B 和 8B 模型规模支持多种部署规模。
物理 AI 的主要使用场景
Cosmos Reason 2 被应用于三个主要领域,以实现物理环境中更自主、系统化的决策。
视频分析 AI 代理
Cosmos Reason 2 使代理能够从海量视频数据中提取洞察。通过加入 OCR 和 2D/3D 点定位,这些代理可以解释视频中的文字,以评估环境状况。NVIDIA 提供了 Video Search and Summarization (VSS) 蓝图,以加速这些代理的开发。例如,Salesforce 使用 VSS 蓝图和 Cosmos Reason 作为 VLM,分析 Cobalt 机器人拍摄的画面,以实现工作场所安全和合规性。
数据标注与评审
该模型自动生成高质量、带时间戳的字幕以及用于训练数据集的详细描述。Uber 正在利用 Cosmos Reason 2 为自动驾驶车辆(AV)训练数据创建可搜索的视频字幕。在一篇共同撰写的 AV 视频字幕与 VQA 方案中,8B 模型在微调后显示出可衡量的提升:
- BLEU 分数:提升了 10.6%(0.113 到 0.125)。
- 基于 MCQ 的 VQA:提升了 0.67 个百分点(80.18% 到 80.85%)。
- LingoQA:提升了 13.8%(63.2% 到 77.0%)。
机器人规划与推理
Cosmos Reason 2 作为 Vision Language Action (VLA) 模型的推理引擎。除了确定任务的下一逻辑步骤外,它现在还能为机器人抓手提供具体的轨迹坐标。Encord 已将 Cosmos Reason 2 集成到其 Data Agent 库中,以支持机器人和物理 AI 开发者。
Cosmos 模型家族生态系统
Cosmos Reason 2 是面向物理 AI 的更广泛模型套件的一部分:
- Cosmos Predict 2.5:一种生成式 AI 模型,可将未来的物理状态预测为视频。它在 2 亿剪辑上进行预训练,能够基于文本、图像或视频输入生成最长 30 秒的物理一致性视频。提供 2B 和 14B 两种规模。
- Cosmos Transfer 2.5:一种多控制模型,用于 video-to-world 风格迁移,可在不同环境和光照条件下扩展仿真,常与 NVIDIA Isaac Sim 或 NVIDIA Omniverse NuRec 搭配使用。
- NVIDIA GR00T N1.6:专为类人机器人设计的开放推理 VLA 模型,利用 Cosmos Reason 增强其上下文理解和全身控制能力。