robocurve/inspect-robots

Open source evals for physical AI. Run any LLM/VLA on any arm/humanoid against any real/sim benchmark.

解决的问题

Inspect Robots 提供了一个物理 AI 的标准化评估框架,使开发者能够在不为每种机器人硬件(身体)或模拟器组合重新编写基准测试的情况下,测试机器人策略(如 LLM 代理或视觉-语言-动作模型)。

工作原理

该框架将任务定义与机器人硬件和 AI 策略解耦。它采用插件系统,其中“身体”(如 Franka 或 Unitree G1 的特定机器人适配器)和“策略”(驱动机器人的 AI 模型)作为独立的包注册。运行前,系统会执行兼容性检查,确保策略的动作/观测空间与机器人能力匹配。

通过 CLI 或 Python API 执行运行,集成 Rerun 可视化功能,用于流式传输摄像头画面和遥测数据。每次试验都会记录到不可变的 EvalLog 中,便于审计、离线重新评分和分析。

适用人群

开发 VLA、基于 LLM 的代理或代码即策略代理的机器人研究人员和工程师,他们需要一种严格、可复现的方法,在真实硬件或模拟环境中评估其模型。

主要亮点

  • 硬件无关性: 支持多种真实机器人(通过专用插件或通用 ROS 适配器)和模拟器(如 Isaac Lab)。
  • VLA 原生支持: 内置对动作分块、开环执行和时间集成的支持。
  • 可审计日志: 为每次运行生成带版本的 Schema 日志和 HTML 报告,包括 LLM 代理的对话记录。
  • 实时可视化: 与 Rerun 无缝集成,支持图像、3D 姿态和关节时间序列的实时流式传输。
  • 安全防护: 包含默认的范围钳制和变化量限制,防止机器人出现异常运动。
  • 学习循环: 可将失败运行总结为 Markdown 格式的「学习」文件,供后续代理运行时回传使用。

相关

  • 项目
  • 项目
  • 项目
  • 项目