LeRobot L2D: 世界最大的開源自駕數據集
Hugging Face 和 Yaak 已推出 Learning to Drive (L2D),這是全球最大的開源多模態自駕數據集。L2D 提供超過 5,000 小時的駕駛數據(90+ TB),覆蓋 30 個德國城市,專門用於訓練能夠遵循自然語言指令或未來航點的端到端 AI 模型。
全面的多模態數據與規模
L2D 在規模和模態方面顯著超過現有的開源自駕數據集。儘管先前的數據集如 WAYMO、NuScenes 和 COMMA 專注於感知或特定規劃任務,L2D 是為端到端策略學習而構建的,直接從感測器輸入預測動作。
數據集規格
- 體積: 90+ TB 的數據,包含 5,000+ 小時的駕駛。
- 視覺: 6 個環繞的高清 RGB 攝影機,提供 360° 覆蓋。
- 車輛狀態: 包含速度、航向、GPS 和 IMU 的完整狀態數據。
- 控制動作: 油門、剎車和轉向的連續數據;檔位和轉向燈的離散數據。
- 環境上下文: 包含車道數、道路類型(高速公路、住宅區)、路面(瀝青、鵝卵石、石板)以及最高速限的元數據。
- 環境條件: 包含降水、天氣(雪、晴、雨)和照明(黎明、白天、黃昏)的數據。
專家 vs. 學生駕駛策略
L2D 区分兩種駕駛行為,以提供完整的運營數據:
- 專家策略: 由擁有 10,000+ 小時經驗的駕駛教練執行。這些被視為最佳,且零駕駛錯誤。
- 學生策略: 由擁有 10–50 小時經驗的學習駕駛者執行。這些包含已知的次優表現,例如方向盤急促轉動,以提供模型錯誤行為的範例及其背後的原因。
兩組都涵蓋了德國駕駛執照所需的所有 EU 強制駕駛任務,包括導航環島、超車和穿越鐵軌。
技術實施與策劃
數據收集硬體
數據是使用 60 輛配備相同感測器套件的 KIA E-niro 電動汽車收集的,包括:
- 運算: NVIDIA Jetson AGX Xavier 和 Jetson Orin NX (64 GB)。
- 感測器: 6 個 RGB 攝影機、一個 Taoglas GNSS 模組,以及用於數據傳輸的 5G 連線。
- 同步: 所有模態與左前方攝影機同步,取樣率為 10 Hz。
語義索引與 LLM 驅動的搜尋
為管理超過 1 PB 的原始數據,Yaak 實施了一個語義時空索引系統:
- 地圖匹配: 使用 Open-Source Routing Machine (OSRM) 將 GPS 軌跡匹配到 OpenStreetMap (OSM) 圖。
- 路線任務分配: 路線特徵(例如橋樑、隧道)、限制(例如停車標誌、讓行)和機動作業(例如多車道左轉)被分配到軌跡。
- 自然語言搜尋: 一個由
llama-3.3-70b和 Pydantic 驗證驅動的搜尋系統允許使用者使用自然語言(例如「開車到環島前,當你有優先權時向右轉」)查詢數據集以檢索特定情節。
與 LeRobot 整合
L2D 已轉換為 LeRobotDataset v2.1 和 v3.0 格式,使得可以使用最先進的模仿學習與強化學習模型,例如 ACT、Diffusion Policy 和 Pi0。
分階段發布計畫
L2D 正分階段發布,以確保情節品質:
- R0 到 R1: 初始版本專注於基本指令。
- R2 到 R3: 添加路線資訊和次優策略的描述。
- R4(規劃於 2025 年 11 月): 完整發布 100 萬個情節和 5,000+ 小時的數據,包括映射到 EU 強制駕駛任務的任務 ID。
閉環測試與未來評估
從 2025 年夏季開始,AI 社群可以提交模型進行帶有安全駕駛員的閉環測試。模型將在車輛上以推理模式運行(透過 Jetson AGX),並將以兩種模式進行評估:drive-by-waypoints(遵循特定座標)和 drive-by-language(遵循自然語言指令)。