LeRobot L2D: 世界上最大的开源自动驾驶数据集

Hugging Face 和 Yaak 已经推出 Learning to Drive (L2D),这是全球最大的开源多模态自动驾驶数据集。L2D 提供了超过 5,000 小时的驾驶数据(90+ TB),覆盖 30 个德国城市,专门用于训练能够遵循自然语言指令或未来航点的端到端 AI 模型。

综合多模态数据和规模

L2D 在规模和模态方面显著超过了现有的开源自动驾驶数据集。虽然之前的数据集如 WAYMO、NuScenes 和 COMMA 侧重于感知或特定的规划任务,但 L2D 是为端到端策略学习而构建的,直接从传感器输入预测动作。

数据集规格

  • 体积: 90+ TeraBytes 的数据,包含 5,000+ 小时的驾驶。
  • 视觉: 6x 周围高清 RGB 摄像头,提供 360° 覆盖。
  • 车辆状态: 包含速度、航向、GPS 和 IMU 的完整状态数据。
  • 控制动作: 油门、刹车和转向的连续数据;档位和转向信号的离散数据。
  • 环境上下文: 包含车道数、道路类型(高速、住宅)、路面(沥青、鹅卵石、铺石)以及最高速度限制的元数据。
  • 环境条件: 包含降水、天气(雪、晴、雨)和照明(黎明、白天、黄昏)的数据。

专家 vs. 学生驾驶策略

L2D 区分两种驾驶行为,以提供完整的运营数据范围:

  • 专家策略: 由拥有 10,000+ 小时经验的驾驶教练执行。这些被认为是最优的,零驾驶错误。
  • 学生策略: 由拥有 10–50 小时经验的学习驾驶员执行。这些包括已知的次优表现,例如方向盘抖动,以向模型提供错误行为的示例及其背后的原因。

两组都涵盖了德国驾驶执照所需的所有欧盟强制驾驶任务,包括通过环形交叉口、超车和穿越铁路轨道。

技术实施和策划

数据收集硬件

数据是通过使用 60 辆配备相同传感器套件的 KIA E-niro 电动汽车收集的,包括:

  • 计算: NVIDIA Jetson AGX Xavier 和 Jetson Orin NX(64 GB)。
  • 传感器: 6 个 RGB 摄像头、一个 Taoglas GNSS 模块以及用于数据传输的 5G 连接。
  • 同步: 所有模态与前左摄像头同步,采样率为 10 Hz。

语义索引和 LLM 驱动的搜索

为了管理超过 1 PB 的原始数据,Yaak 实施了一个语义时空索引系统:

  1. 地图匹配: 使用 Open-Source Routing Machine (OSRM) 将 GPS 轨迹匹配到 OpenStreetMap (OSM) 图上。
  2. 路线任务分配: 路线特征(例如桥梁、隧道)、限制(例如停车标志、让行)和机动(例如多车道左转)被分配到轨迹上。
  3. 自然语言搜索:llama-3.3-70b 和 Pydantic 验证驱动的搜索系统允许用户使用自然语言(例如:“驶向环形交叉口,并在你有优先权时向右转”)查询数据集以检索特定情节。

与 LeRobot 的集成

L2D 已转换为 LeRobotDataset v2.1 和 v3.0 格式,从而可以使用最先进的模仿学习和强化学习模型,如 ACTDiffusion PolicyPi0

分阶段发布计划

L2D 正分阶段发布,以确保情节质量:

  • R0 到 R1: 初始版本侧重于基本指令。
  • R2 到 R3: 添加路线信息和次优策略的描述。
  • R4(计划于 2025 年 11 月): 完整发布 100 万个情节和 5,000+ 小时的数据,包括映射到欧盟强制驾驶任务的任务 ID。

闭环测试和未来评估

从 2025 年夏季开始,AI 社区可以提交模型在安全驾驶员的陪同下进行闭环测试。模型将在车载(通过 Jetson AGX)推理模式下运行,并将在两种模式下进行评估:drive-by-waypoints(遵循特定坐标)和 drive-by-language(遵循自然语言指令)。

Sources