将机器人 AI 引入嵌入式平台:数据集录制、VLA 微调与设备端优化

Hugging Face 与 NXP 详细阐述了一种在嵌入式机器人平台上部署视觉-语言-动作(VLA)模型的系统工程方法。主要结论是,成功的部署需要高一致性的数据集录制、模型图的架构分解以及异步推理的组合,以克服边缘硬件的计算和内存限制。

高一致性的数据集录制

可靠的 VLA 策略学习更依赖数据的一致性而非数据量。对于将茶包放入杯中的任务,以下录制实践对于保持精度至关重要:

环境与硬件稳定性

  • 固定摄像头支架:需要刚性支架以防止姿态漂移;机器人振动或环境重置导致的摄像头位移会严重降低精度。
  • 受控光照与对比度:固定光源并避免阳光可防止时间上的变化。机器人手臂、物体与环境之间的高对比度是避免“白对白”情形的必要条件。
  • 校准备份:保留机器人和远程操作员校准的备份,可避免软件崩溃后需要重新录制剧集。
  • 输入限制:操作员必须仅依赖策略运行时可用的摄像头输入,以避免引入模型在推理时无法获取的信息。

视角策略

使用多视角组合可提升整体精度。NXP 推荐使用三摄像头布局:

  • 顶部视角:提供场景的全局视图。
  • 夹爪摄像头:强烈推荐用于精细操作任务,因为它提供最接近的视角,便于精确抓取和对齐。
  • 左侧视角:补充顶部视角,提升高度和深度感知。

物理与数据多样性

  • 硬件微调:在夹爪爪部套上热缩管可增加摩擦、降低打滑,从而提升策略学习的稳定性。
  • 工作空间聚类:可达工作空间应划分为起始位置簇(例如 10×10 cm),每个簇至少录制 10 条剧集。
  • 恢复剧集:加入“恢复剧集”(约占训练集的 20%),即机器人在首次尝试失败后需重新拾取物体,可提升整体成功率。
  • 验证划分:应将专用簇(例如簇 6)从训练集中剔除,作为未见过的验证集,以防止过拟合。

VLA 策略微调

针对“茶包放入杯中”任务的实际微调使用了 10 个簇、共 120 条剧集,采用三路 640×480 像素、30 fps 的摄像头。

关于模型检查点的关键发现包括:

  • ACT(基于 Transformer 的动作分块):在 10 万至 16 万训练步之间(每块 100 个动作)实现了精度、泛化性和流畅性的最佳平衡。
  • SmolVLA:该模型需要显著更多的训练步数(每块 50 个动作)才能达到类似的平衡。
  • 评估指标:最终检查点应基于训练集和验证集的成功率进行选择,而非仅依赖训练损失。

针对 NXP i.MX 95 SoC 的优化

NXP i.MX 95 SoC 集成了 Arm Cortex‑A55 与 Cortex‑M 核心、Mali GPU 以及 eIQ Neutron NPU。为实现高效的边缘推理,NXP 采用了三大策略:

架构分解

VLA 不再是单一整体图,而是被划分为逻辑子块:

  1. 视觉:将 RGB 帧处理为视觉嵌入。
  2. LLM 主干:从视觉和文本嵌入生成动作令牌。
  3. 动作专家:使用流匹配对动作样本去噪,生成最终控制指令。

这种划分使得可以对每个子块进行量化并独立调度,特别是可以让动作专家以更低的频率运行。

战略性量化

量化对不同子块的影响各不相同:

  • 视觉编码器和 LLM 预填充:这些子块在量化后精度下降有限。
  • 动作专家:对去噪流的量化会显著降低性能,因为误差在迭代去噪步骤中累积。因此,该子块保持更高精度以维持稳定性。

异步推理与调度

同步控制循环会产生空闲间隙和振荡校正,因为机器人在模型推理时处于空闲状态。异步推理将生成与执行分离,使机器人能够执行当前动作块的同时并行计算下一个块。

要实现有效的异步,需要端到端的推理延迟短于动作执行时长(推理时间 < 执行时间)。

i.MX 95 性能基准

在“茶包放入杯中”任务上使用 20 条测试剧集和 10 条验证剧集进行测试,得到如下结果:

策略 格式 推理延迟 全局准确率(30 条剧集)
ACT ONNX FP32 2.86 s 0.96
ACT Optimized 0.32 s 0.89
SmolVLA ONNX FP32 29.1 s 0.47

NXP 已为 SmolVLA 确立了 6.15 秒的优化板载推理延迟基准,未来工作将聚焦于进一步的 NPU 优化、用于大规模数据生成的仿真环境以及 Sim‑to‑Real 转移。

Sources