NVIDIA Cosmos-H-Dreams: 用于外科机器人手术的实时生成式模拟

NVIDIA Cosmos-H-Dreams: 用于外科机器人手术的实时生成式模拟

TL;DR

NVIDIA 已发布 Cosmos-H-Dreams,这是一个用于外科机器人手术的实时、动作条件生成式模拟器。通过将 Cosmos-H-Surgical-Simulator 蒸馏为因果学生模型并利用 FlashDreams 推理引擎,NVIDIA 实现了在单个 GPU 上以每秒 160 帧(FPS)进行外科场景的交互式闭环模拟。

从世界模型过渡到交互式模拟器

Cosmos-H-Dreams 是之前的 Cosmos-H-Surgical-Simulator 的演进——这是一个基于 NVIDIA Cosmos-Predict2.5-2B 的动作条件世界基础模型,并在 Open-H-Embodiment 数据集上进行训练。虽然原始模拟器主要用于离线策略评估和合成数据生成,但 Cosmos-H-Dreams 将这些能力提升到了实时水平。

具体来说,该模型专门用于 da Vinci Research Kit (dVRK) 桌面缝合。它以初始的 RGB 帧和机器人运动学的实时流作为输入,自回归地生成下一帧序列。NVIDIA 还通过将其与 CMR Surgical 和 Cambridge Consultants 的 Versius 外科医生控制器集成,展示了系统的多功能性。

实时性能的蒸馏管道

为了在不牺牲外科动态的情况下实现实时速度,Cosmos-H-Dreams 采用了一种专为长期自回归推出而设计的教师-学生训练管道。

外科教师

该过程始于基于 Cosmos-H-Surgical-Simulator Open-H 检查点的双向教师模型。该教师使用统一的 44 维动作表示。对于 dVRK 桌面模型,双臂动作内容(相对末端执行器平移、旋转和夹持器状态)被映射到此表示。教师在 JHU dVRK 桌面混合数据上进行微调,该数据包含成功演示和失败(例如,针掉落和未命中投掷),以确保模拟器能够准确再现不良动作的后果。

为了在长时间推出过程中保持稳定性,教师的时间视野在训练过程中逐步从 12 帧增加到 72 帧。

因果预热和自强制蒸馏

蒸馏过程分为两个主要阶段:

  1. 因果预热:因果学生从教师初始化,并被训练去模仿预计算和缓存的去噪轨迹。这教会学生使用因果注意力和流式键值(KV)缓存。
  2. 自强制蒸馏:为了防止自回归模型在条件于自身不完美输出时导致误差累积,NVIDIA 使用自强制蒸馏。学生生成其自身的上下文,而冻结的教师提供分布匹配监督,以引导这些推出朝着真实视频的方向发展。

得到的学生模型支持少步扩散,每个潜在帧只需两个去噪步骤。

FlashDreams:实时推理引擎

Cosmos-H-Dreams 通过 FlashDreams 提供服务,FlashDreams 是一个用于自回归世界和视频模型的加速推理库。FlashDreams 实施了多种优化以降低延迟,包括:

  • 流式 KV 缓存
  • CUDA Graph 捕获
  • 模型编译

这些优化将推理速度从大约 10 FPS(标准 Cosmos-H-Surgical-Simulator)提高到单个 NVIDIA RTX PRO 6000 GPU 上大约 160 FPS。这使得可以实现几种交互模式:

  • 浏览器客户端:通过 WebRTC 传递键盘命令和生成的帧。
  • Meta Quest 客户端:通过 WebXR 将跟踪的控制器运动映射到机器人动作。
  • 闭环策略:与已学习的外科策略集成,其中观察和动作会实时交换。

外科物理 AI 的未来方向

NVIDIA 将 Cosmos-H-Dreams 视为闭环外科物理 AI 的基础。未来的开发重点是超越视觉质量,通过新的基准来评估功能准确性,包括:

  • 工具尖端到达和姿态准确性
  • 夹持器循环保真度
  • 空闲稳定性
  • 反事实动作多样性
  • 长期漂移
  • 模拟与真实策略结果的一致性

潜在的下游应用包括延迟感知的远程手术、交互式外科演练、手术规划和术中决策支持。NVIDIA 指出,Cosmos-H-Dreams 是一个研究和开发平台,并不打算作为诊断系统、术中成像的替代品或物理机器人控制器。

Sources