robocurve/inspect-robots
Open source evals for physical AI. Run any LLM/VLA on any arm/humanoid against any real/sim benchmark.
解决的问题
Inspect Robots 提供了一个物理 AI 的标准化评估框架,使开发者能够在不为每种机器人硬件(身体)或模拟器组合重新编写基准测试的情况下,测试机器人策略(如 LLM 代理或视觉-语言-动作模型)。
工作原理
该框架将任务定义与机器人硬件和 AI 策略解耦。它采用插件系统,其中“身体”(如 Franka 或 Unitree G1 的特定机器人适配器)和“策略”(驱动机器人的 AI 模型)作为独立的包注册。运行前,系统会执行兼容性检查,确保策略的动作/观测空间与机器人能力匹配。
通过 CLI 或 Python API 执行运行,集成 Rerun 可视化功能,用于流式传输摄像头画面和遥测数据。每次试验都会记录到不可变的 EvalLog 中,便于审计、离线重新评分和分析。
适用人群
开发 VLA、基于 LLM 的代理或代码即策略代理的机器人研究人员和工程师,他们需要一种严格、可复现的方法,在真实硬件或模拟环境中评估其模型。
主要亮点
- 硬件无关性: 支持多种真实机器人(通过专用插件或通用 ROS 适配器)和模拟器(如 Isaac Lab)。
- VLA 原生支持: 内置对动作分块、开环执行和时间集成的支持。
- 可审计日志: 为每次运行生成带版本的 Schema 日志和 HTML 报告,包括 LLM 代理的对话记录。
- 实时可视化: 与 Rerun 无缝集成,支持图像、3D 姿态和关节时间序列的实时流式传输。
- 安全防护: 包含默认的范围钳制和变化量限制,防止机器人出现异常运动。
- 学习循环: 可将失败运行总结为 Markdown 格式的「学习」文件,供后续代理运行时回传使用。
相关
- 项目
- 项目
- 项目
- 项目