SmolVLA:使用 Lerobot 社群資料訓練的高效能視覺-語言-動作模型
Hugging Face 已發布 SmolVLA,一個緊湊的 450M 參數開源視覺-語言-動作 (VLA) 模型,專為機器人設計。SmolVLA 能在消費級硬體上實現高效能機器人控制,於模擬環境 (LIBERO、Meta-World) 與使用如 SO100 與 SO101 手臂等平價硬體的實際任務中,超越更大型的 VLA 模型與如 ACT 的基線。
模型架構與設計
SmolVLA 採用模組化架構,結合用於感知的視覺-語言模型 (VLM) 與專門的動作專家以進行控制。
視覺-語言模型 (VLM) 主幹
SmolVLA 使用 SmolVLM2 作為其主幹,該模型由 SigLIP 視覺編碼器與 SmolLM2 語言解碼器組成。模型以如下方式處理多模態輸入:
- Images: 透過視覺編碼器提取。
- Language Instructions: 進行分詞後送入解碼器。
- Sensorimotor States: 透過線性層投射為單一 token,以對齊語言模型的維度。
動作專家:流匹配 Transformer
動作專家是一個緊湊的 transformer(約 100M 參數),負責產生未來機器人動作的序列(動作區塊)。它透過 flow matching objective 進行訓練,預測「校正向量」以將噪聲樣本導回真實軌跡。此方法允許直接、非自回歸地預測連續動作,確保即時控制與高精度,且不會產生自回歸解碼所帶來的延遲。
效率優化
為了保持低延遲與小體積,SmolVLA 實施了三項特定的架構選擇:
- Visual Token Reduction: 圖像(例如 512×512)透過 PixelShuffle 壓縮為 64 個 token,而非 1024 個,顯著降低推論時間。
- Layer Skipping: 動作專家僅在前半層注意 VLM 特徵。此舉將 VLM 與動作專家的計算成本減半,且性能損失極小。
- Interleaved Attention: 動作專家在交叉注意(將動作條件於感知與指令)與自注意(確保時間平滑並減少抖動)之間交替進行。
非同步推論堆疊
SmolVLA 引入非同步推論堆疊,以將動作執行與區塊預測解耦,消除執行延遲。
在 synchronous(同步)設定中,機器人在執行完當前區塊後會暫停以計算下一個動作區塊。相對地,在 asynchronous(非同步)設定中,機器人在仍執行當前區塊時,會將最新觀測傳送至策略伺服器(可能由 GPU 主持)。
- Early Trigger: 當佇列長度低於閾值(例如 70%)時,新的觀測會被送至伺服器。
- Decoupled Threads: 推論與控制迴路平行執行。
- Chunk Fusion: 連續區塊的重疊動作會被合併,以防止抖動。
與同步推論相比,該系統使任務完成速度提升 30%(9.7 秒對 13.75 秒),且任務吞吐量提升 2 倍(固定時間窗口內完成 19 個方塊對 9 個),同時保持相似的成功率(約 78%)。
在社群資料集上訓練
SmolVLA 於 Hugging Face Hub 上的 LeRobot 社群中,預先訓練於精選的 487 個高品質資料集,總計約 1000 萬幀。雖然規模比典型基準資料集小一個量級,卻提供了更豐富的行為、相機視角與機體多樣性。
資料標準化
為處理社群資料的碎片化特性,Hugging Face 採用了兩項標準化流程:
- Task Annotation Improvement: 使用 Qwen2.5-VL-3B-Instruct,將模糊標籤(例如 "Move")重新寫成以動詞開頭、長度不超過 30 個字的簡潔動作描述(例如 "Pick up the cube")。
- Camera View Standardization: 將不一致的相機標籤映射至標準方案:
OBS_IMAGE_1(俯視)、OBS_IMAGE_2(腕部安裝)以及OBS_IMAGE_3+(其他視角)。
預訓練的影響
在社群資料上進行預訓練可顯著提升效能。於 SO100 手臂上,成功率由 51.7%(未預訓練)提升至 78.3%(預訓練後),相當於 +26.6% 的絕對提升。
效能結果
SmolVLA 在多項基準測試中展現出強大的泛化能力與效率:
- Simulation: 在 LIBERO 與 Meta-World 上超越更大型的 VLA 與基線。
- Real-World (SO100): 在抓取-放置、堆疊與分類任務中與基線持平或更佳。
- Generalization (SO101): 相較於 ACT 基線,展現出對新機體的更佳泛化能力。
- Hardware Accessibility: 模型足夠小巧,可在 CPU、MacBook 或單顆消費級 GPU 上運行。