将机器人 AI 引入嵌入式平台:数据集录制、VLA 微调与设备端优化
Hugging Face 与 NXP 详细阐述了一种在嵌入式机器人平台上部署视觉-语言-动作(VLA)模型的系统工程方法。主要结论是,成功的部署需要高一致性的数据集录制、模型图的架构分解以及异步推理的组合,以克服边缘硬件的计算和内存限制。
高一致性的数据集录制
可靠的 VLA 策略学习更依赖数据的一致性而非数据量。对于将茶包放入杯中的任务,以下录制实践对于保持精度至关重要:
环境与硬件稳定性
- 固定摄像头支架:需要刚性支架以防止姿态漂移;机器人振动或环境重置导致的摄像头位移会严重降低精度。
- 受控光照与对比度:固定光源并避免阳光可防止时间上的变化。机器人手臂、物体与环境之间的高对比度是避免“白对白”情形的必要条件。
- 校准备份:保留机器人和远程操作员校准的备份,可避免软件崩溃后需要重新录制剧集。
- 输入限制:操作员必须仅依赖策略运行时可用的摄像头输入,以避免引入模型在推理时无法获取的信息。
视角策略
使用多视角组合可提升整体精度。NXP 推荐使用三摄像头布局:
- 顶部视角:提供场景的全局视图。
- 夹爪摄像头:强烈推荐用于精细操作任务,因为它提供最接近的视角,便于精确抓取和对齐。
- 左侧视角:补充顶部视角,提升高度和深度感知。
物理与数据多样性
- 硬件微调:在夹爪爪部套上热缩管可增加摩擦、降低打滑,从而提升策略学习的稳定性。
- 工作空间聚类:可达工作空间应划分为起始位置簇(例如 10×10 cm),每个簇至少录制 10 条剧集。
- 恢复剧集:加入“恢复剧集”(约占训练集的 20%),即机器人在首次尝试失败后需重新拾取物体,可提升整体成功率。
- 验证划分:应将专用簇(例如簇 6)从训练集中剔除,作为未见过的验证集,以防止过拟合。
VLA 策略微调
针对“茶包放入杯中”任务的实际微调使用了 10 个簇、共 120 条剧集,采用三路 640×480 像素、30 fps 的摄像头。
关于模型检查点的关键发现包括:
- ACT(基于 Transformer 的动作分块):在 10 万至 16 万训练步之间(每块 100 个动作)实现了精度、泛化性和流畅性的最佳平衡。
- SmolVLA:该模型需要显著更多的训练步数(每块 50 个动作)才能达到类似的平衡。
- 评估指标:最终检查点应基于训练集和验证集的成功率进行选择,而非仅依赖训练损失。
针对 NXP i.MX 95 SoC 的优化
NXP i.MX 95 SoC 集成了 Arm Cortex‑A55 与 Cortex‑M 核心、Mali GPU 以及 eIQ Neutron NPU。为实现高效的边缘推理,NXP 采用了三大策略:
架构分解
VLA 不再是单一整体图,而是被划分为逻辑子块:
- 视觉:将 RGB 帧处理为视觉嵌入。
- LLM 主干:从视觉和文本嵌入生成动作令牌。
- 动作专家:使用流匹配对动作样本去噪,生成最终控制指令。
这种划分使得可以对每个子块进行量化并独立调度,特别是可以让动作专家以更低的频率运行。
战略性量化
量化对不同子块的影响各不相同:
- 视觉编码器和 LLM 预填充:这些子块在量化后精度下降有限。
- 动作专家:对去噪流的量化会显著降低性能,因为误差在迭代去噪步骤中累积。因此,该子块保持更高精度以维持稳定性。
异步推理与调度
同步控制循环会产生空闲间隙和振荡校正,因为机器人在模型推理时处于空闲状态。异步推理将生成与执行分离,使机器人能够执行当前动作块的同时并行计算下一个块。
要实现有效的异步,需要端到端的推理延迟短于动作执行时长(推理时间 < 执行时间)。
i.MX 95 性能基准
在“茶包放入杯中”任务上使用 20 条测试剧集和 10 条验证剧集进行测试,得到如下结果:
| 策略 | 格式 | 推理延迟 | 全局准确率(30 条剧集) |
|---|---|---|---|
| ACT | ONNX FP32 | 2.86 s | 0.96 |
| ACT | Optimized | 0.32 s | 0.89 |
| SmolVLA | ONNX FP32 | 29.1 s | 0.47 |
NXP 已为 SmolVLA 确立了 6.15 秒的优化板载推理延迟基准,未来工作将聚焦于进一步的 NPU 优化、用于大规模数据生成的仿真环境以及 Sim‑to‑Real 转移。