將機器人 AI 帶入嵌入式平台:資料集錄製、VLA 微調與裝置端優化
Hugging Face 與 NXP 詳細說明了一種系統工程方法,用於在嵌入式機器人平台上部署 Vision‑Language‑Action(VLA)模型。主要結論是,成功部署需要結合高一致性的資料集錄製、模型圖的架構分解,以及非同步推論,以克服邊緣硬體的計算與記憶體限制。
高一致性資料集錄製
可靠的 VLA 策略學習比資料量更依賴資料的一致性。以將茶包放入杯子為例,以下錄製實踐對維持精度至關重要:
環境與硬體穩定性
- 固定相機安裝:需要剛性的安裝以防止姿態漂移;機器人震動或環境重置導致的相機移位會嚴重降低精度。
- 受控光照與對比:固定光源並避免陽光,以防止時間變異。機器手臂、物體與環境之間的高對比度是避免「白對白」情況的必要條件。
- 校準備份:保留機器人與遠端操作員的校準備份,可避免軟體崩潰後需要重新錄製回合。
- 輸入限制:操作員必須僅依賴政策在執行時可取得的相機輸入,避免引入模型在推論時無法存取的資訊。
觀點策略
使用多樣的觀點可提升全局精度。NXP 建議使用三相機配置:
- 俯視:提供場景的全局視角。
- 抓手相機:強烈建議用於精細操作任務,因為它提供最接近的視角以實現精確的抓取與對齊。
- 左視角:補足俯視的高度與深度感知。
物理與資料多樣性
- 硬體調整:在抓手爪上套上熱縮管可增加摩擦、減少滑動,提升政策學習的穩定性。
- 工作空間分群:可達工作空間應劃分為起始位置群(例如 10×10 公分),每個群至少錄製 10 個回合。
- 恢復回合:包含「恢復回合」(約佔訓練集的 20%),即機器人在首次嘗試失敗後必須重新取得物體,可提升整體成功率。
- 驗證切分:應將一個專屬群(例如第 6 群)從訓練集移除,作為未見過的驗證集,以防止過擬合。
VLA 政策微調
實作上,針對「茶包放入杯子」任務的微調使用了 120 個回合,分佈於 10 個群,採用三支 640×480 像素、30 fps 的相機。
關鍵發現如下:
- ACT(Action Chunking with Transformers):在 100k 至 160k 訓練步驟之間(每個區塊 100 個動作)可取得精度、泛化與平滑度的最佳平衡。
- SmolVLA:此模型需要顯著更多的訓練步驟(每個區塊 50 個動作)才能達到類似的平衡。
- 評估指標:最終檢查點應根據訓練集與驗證集的成功率選擇,而非僅依賴訓練損失。
為 NXP i.MX 95 SoC 進行優化
NXP i.MX 95 SoC 整合了 Arm Cortex‑A55 與 Cortex‑M 核心、Mali GPU 以及 eIQ Neutron NPU。為了實現高效的邊緣推論,NXP 採用了三大策略:
架構分解
- 視覺:將 RGB 影格處理為視覺嵌入。
- LLM 主幹:根據視覺與文字嵌入產生動作代幣。
- 動作專家:應用流匹配將動作樣本去噪為最終控制指令。
此分離允許對每個子塊進行量化並獨立排程,特別是可讓動作專家以較低頻率執行。
策略性量化
- 視覺編碼器與 LLM 預填充:量化後的精度下降有限。
- 動作專家:去噪流的量化會顯著降低效能,因為誤差在迭代去噪步驟中累積。因此,此子塊需保持較高精度以維持穩定性。
非同步推論與排程
同步控制迴路會產生閒置間隙與振盪校正,因為機器人在模型執行推論時處於閒置狀態。非同步推論將生成與執行分離,使機器人能在執行當前動作區塊時,同步計算下一個區塊。
要達成此效果,端到端的推論延遲必須短於動作執行時間(推論時間 < 執行時間)。
i.MX 95 性能基準
在「茶包放入杯子」任務上,以 20 個測試回合與 10 個驗證回合進行測試,得到以下結果:
| 政策 | 格式 | 推論延遲 | 全局精度(30 回合) |
|---|---|---|---|
| ACT | ONNX FP32 | 2.86 s | 0.96 |
| ACT | 最佳化 | 0.32 s | 0.89 |
| SmolVLA | ONNX FP32 | 29.1 s | 0.47 |
NXP 已為 SmolVLA 設定了 6.15 秒的最佳化板上推論延遲基準,未來的工作將聚焦於進一步的 NPU 優化、用於大規模資料生成的模擬環境,以及 Sim‑to‑Real 的轉移。