LeRobot L2D: 世界最大的開源自駕數據集

Hugging Face 和 Yaak 已推出 Learning to Drive (L2D),這是全球最大的開源多模態自駕數據集。L2D 提供超過 5,000 小時的駕駛數據(90+ TB),覆蓋 30 個德國城市,專門用於訓練能夠遵循自然語言指令或未來航點的端到端 AI 模型。

全面的多模態數據與規模

L2D 在規模和模態方面顯著超過現有的開源自駕數據集。儘管先前的數據集如 WAYMO、NuScenes 和 COMMA 專注於感知或特定規劃任務,L2D 是為端到端策略學習而構建的,直接從感測器輸入預測動作。

數據集規格

  • 體積: 90+ TB 的數據,包含 5,000+ 小時的駕駛。
  • 視覺: 6 個環繞的高清 RGB 攝影機,提供 360° 覆蓋。
  • 車輛狀態: 包含速度、航向、GPS 和 IMU 的完整狀態數據。
  • 控制動作: 油門、剎車和轉向的連續數據;檔位和轉向燈的離散數據。
  • 環境上下文: 包含車道數、道路類型(高速公路、住宅區)、路面(瀝青、鵝卵石、石板)以及最高速限的元數據。
  • 環境條件: 包含降水、天氣(雪、晴、雨)和照明(黎明、白天、黃昏)的數據。

專家 vs. 學生駕駛策略

L2D 区分兩種駕駛行為,以提供完整的運營數據:

  • 專家策略: 由擁有 10,000+ 小時經驗的駕駛教練執行。這些被視為最佳,且零駕駛錯誤。
  • 學生策略: 由擁有 10–50 小時經驗的學習駕駛者執行。這些包含已知的次優表現,例如方向盤急促轉動,以提供模型錯誤行為的範例及其背後的原因。

兩組都涵蓋了德國駕駛執照所需的所有 EU 強制駕駛任務,包括導航環島、超車和穿越鐵軌。

技術實施與策劃

數據收集硬體

數據是使用 60 輛配備相同感測器套件的 KIA E-niro 電動汽車收集的,包括:

  • 運算: NVIDIA Jetson AGX Xavier 和 Jetson Orin NX (64 GB)。
  • 感測器: 6 個 RGB 攝影機、一個 Taoglas GNSS 模組,以及用於數據傳輸的 5G 連線。
  • 同步: 所有模態與左前方攝影機同步,取樣率為 10 Hz。

語義索引與 LLM 驅動的搜尋

為管理超過 1 PB 的原始數據,Yaak 實施了一個語義時空索引系統:

  1. 地圖匹配: 使用 Open-Source Routing Machine (OSRM) 將 GPS 軌跡匹配到 OpenStreetMap (OSM) 圖。
  2. 路線任務分配: 路線特徵(例如橋樑、隧道)、限制(例如停車標誌、讓行)和機動作業(例如多車道左轉)被分配到軌跡。
  3. 自然語言搜尋: 一個由 llama-3.3-70b 和 Pydantic 驗證驅動的搜尋系統允許使用者使用自然語言(例如「開車到環島前,當你有優先權時向右轉」)查詢數據集以檢索特定情節。

與 LeRobot 整合

L2D 已轉換為 LeRobotDataset v2.1 和 v3.0 格式,使得可以使用最先進的模仿學習與強化學習模型,例如 ACTDiffusion PolicyPi0

分階段發布計畫

L2D 正分階段發布,以確保情節品質:

  • R0 到 R1: 初始版本專注於基本指令。
  • R2 到 R3: 添加路線資訊和次優策略的描述。
  • R4(規劃於 2025 年 11 月): 完整發布 100 萬個情節和 5,000+ 小時的數據,包括映射到 EU 強制駕駛任務的任務 ID。

閉環測試與未來評估

從 2025 年夏季開始,AI 社群可以提交模型進行帶有安全駕駛員的閉環測試。模型將在車輛上以推理模式運行(透過 Jetson AGX),並將以兩種模式進行評估:drive-by-waypoints(遵循特定座標)和 drive-by-language(遵循自然語言指令)。

Sources